梯度下降:大语言模型如何从‘胡乱猜词’学会生成文本

面向没有机器学习背景的程序员,以直观例子解释大语言模型训练中的梯度下降、损失函数、反向传播、学习率与优化器,并串起从预测下一个 token 到参数更新的完整训练循环。

2026-07-26 · 16 分钟 · 7680 字 · Andy SI
阅读全文

LLM 的“心口不一”: 理解 LLM 行为的一把万能钥匙

本文用 hidden state 与 token 之间的带宽鸿沟,统一解释 Chain of Thought、prompt 长度、few-shot、性格漂移与幻觉等 LLM 工程现象。

2026-05-02 · 15 分钟 · 7104 字 · Andy SI
阅读全文

大模型训练全景:一个 AI 应用工程师需要理解的一切

从数据管线、Scaling Law、系统约束、合成数据、蒸馏、后训练、评估体系到 Agent 训练,系统梳理大模型训练全链路,并解释这些机制如何影响 AI 应用工程师的模型选型、评估与 harness 设计。

2026-04-04 · 28 分钟 · 13960 字 · Andy SI
阅读全文

WHAT is LLM API KV Cache

KV Cache 是连接「Transformer 理论」和「LLM 工程部署」的一个关键概念。理解它,你就打通了从「模型怎么算」到「模型怎么跑」的最后一环。

2026-03-05 · 15 分钟 · 7103 字 · Andy SI
阅读全文

理解 Transformer 的数学直觉

此文使我(也许也可以使你)更加深刻地理解transformer的基本原理,告别对当前主流LLM的黑箱式理解。cheers!

2026-02-24 · 15 分钟 · 7302 字 · Andy SI
阅读全文