这篇文章的目标:让你读完之后,能在脑子里建立起一张「大模型如何工作」的完整地图,而不是一堆零散的名词。
一、先抛结论:大模型在做什么?
一句话——
大模型本质上是一个「接龙机器」:给定前面的文字,预测下一个最可能出现的字。
就这么简单。它不会"思考",不会"理解",它只是在海量文本上学到了「什么样的字后面,通常跟着什么样的字」。
你问它"中国的首都是哪里?",它回答"北京",不是因为它"知道"答案,而是因为在它读过的无数文本里,“中国的首都"后面跟着"北京"的概率极高。
所有的惊艳能力(写代码、翻译、推理),都是这个「预测下一个字」的机制,在足够大的规模下涌现出来的。
二、第一步:把文字变成数字(Tokenization)
计算机不认识汉字和英文,所以第一步要把文字切成小块,每块对应一个数字。这些小块叫 Token(词元)。
"我喜欢学习" → ["我", "喜欢", "学习"] → [123, 4567, 890]
"Hello!" → ["Hello", "!"] → [15496, 0]
几个关键点:
- Token 不等于「词」,也不等于「字」。可能是一个词、半个词、甚至几个字母。
- 不同模型的分词方式不同(GPT、LLaMA、Claude 各有自己的词表)。
- 中文的 Token 效率通常低于英文——同样的内容,中文消耗的 Token 更多,这也是为什么中文 API 调用更贵。
三、第二步:把数字变成「有意义的向量」(Embedding)
光有数字 ID 没用,因为 ID 123 和 4567 之间没有"远近"关系。我们需要把每个 Token 映射到一个高维向量(比如 4096 维的一串数字)。
向量的奇妙之处在于:意义相近的词,向量距离也近。
国王 ≈ [0.9, 0.2, ...]
女王 ≈ [0.85, 0.18, ...]
苹果 ≈ [-0.1, 0.7, ...]
而且向量还能做"语义运算”,最经典的例子:
向量(国王) - 向量(男人) + 向量(女人) ≈ 向量(女王)
这意味着模型已经"理解"了词与词之间的关系——这是它一切能力的基础。
四、第三步:核心中的核心——注意力机制(Attention)
这是 Transformer 架构的灵魂,也是 2017 年那篇论文《Attention Is All You Need》改变世界的地方。
它在解决什么问题?
考虑这句话:"苹果公司今年发布了新手机,我打算去买个苹果尝尝。"
两个"苹果",字面完全一样,但意思截然不同。模型怎么区分?
注意力机制让每个词去「看」句子里的其他词,决定该关注谁。
- 第一个"苹果"会强烈关注"公司、发布、手机" → 理解为企业
- 第二个"苹果"会强烈关注"买、尝尝" → 理解为水果
直观比喻
想象你在读一句长句子,读到某个词时,你的大脑会自动回看前面的关键词,把它们的意思"汇聚"过来帮助理解当前这个词。注意力机制就是在数学上模拟这个过程。
自注意力(Self-Attention) 的计算思路是:对当前位置的词,计算它与句子中每个词的"相关程度"(权重),然后把这些词的内容按权重加权求和,作为当前位置的新表示。
这里涉及三个核心角色:
- Q(Query,查询):当前词在"找什么"
- K(Key,键):其他词能"提供什么"
- V(Value,值):其他词的"实际内容"
直觉上,就是用当前词的 Q 去和所有词的 K 匹配,匹配度越高的词,其 V 的权重就越大,最后加权融合成当前词的新含义。
模型通过大量"多头注意力"(Multi-Head Attention)——也就是很多组 Q/K/V 并行计算,来捕捉不同维度的语义关系。
五、第四步:堆叠成一个深井(Transformer 架构)
一个注意力层只能做有限的事。大模型把这样的结构堆了几十甚至上百层:
输入 Token 向量
↓
[注意力层 + 前馈网络] × N 层 ← 这就是所谓的"深度"
↓
输出下一个 Token 的概率分布
每一层都在前一层的基础上,理解更抽象、更长程的关系:
- 浅层:捕捉语法、词性
- 中层:捕捉句子结构、语义
- 深层:捕捉推理、逻辑、知识
这就是为什么模型要"大"——层数多、参数多,才能学到足够丰富的模式。
六、第五步:训练的两个阶段(关键!)
这是很多人混淆的地方。大模型的能力不是一次训练出来的,而是分两大阶段:
阶段一:预训练(Pre-training)—— 「读万卷书」
让模型阅读互联网上的海量文本(网页、书籍、代码、论文),目标是预测下一个字。
输入:"床前明月光,疑是地上"
目标:"霜"
这一步消耗了 99% 的算力(动辄上万张 GPU 跑几个月),训练完得到的模型叫基座模型(Base Model)。
但基座模型有个问题:它只会无脑续写。你问它"今天天气如何?",它可能接着写"明天天气如何?后天呢?"——因为它在训练时见到的就是这种"问题列表"。
阶段二:对齐(Alignment)—— 「学会做人」
要让它变成一个有用的助手,还需要两步:
指令微调(SFT, Supervised Fine-Tuning) 用「问-答」对训练,让它学会"被人提问时,应该回答"。
人类反馈强化学习(RLHF) 让人类给模型的多个回答打分,训练一个"奖励模型",再用强化学习让模型朝着高分方向优化。
经过这一步,模型学会了:诚实、有用、无害;会说"我不知道";会拒绝有害请求。
预训练 → 会接龙,但不像助手
↓ SFT
会回答问题,但可能啰嗦/跑题
↓ RLHF
会高质量、对齐人类偏好的回答 ← 你现在用的 ChatGPT/Claude 就是这个
七、那「推理」能力从哪来?
这是最反直觉、也最前沿的问题。
模型只是在预测下一个字,为什么能做数学题、写代码、做逻辑推理?
目前主流的解释是 “涌现”(Emergence):
当模型的规模(参数量 + 训练数据)跨过某个阈值,某些能力会突然出现——就像单个水分子没有"湿润"的属性,但大量水分子聚在一起就有了。
而且,推理能力在「思维链」(Chain-of-Thought)下显著增强:
❌ 直接问:"123 × 456 = ?" → 容易算错
✅ 引导:"请一步步计算 123 × 456" → 准确率大幅提升
因为一步步写出来,等于让模型把"下一个字"的预测拆成更小的步骤,每一步都更可预测,错误率就降低了。这也是为什么像 o1、DeepSeek-R1 这类"推理模型"会显式地先输出一大段思考过程。
八、大模型的边界:它不擅长什么?
了解原理,也就了解了局限:
| 局限 | 原因 |
|---|---|
| 会"幻觉"(一本正经胡说) | 它只是在生成"听起来像"的文本,并不区分真假 |
| 数学/逻辑不稳定 | 预测下一个字 ≠ 真正的符号推理 |
| 上下文有限 | 注意力计算量随文本长度呈平方增长,文本越长越吃力 |
| 知识有截止时间 | 训练完之后发生的事,它不知道(除非联网/RAG) |
| 没有真正"理解" | 它学的是统计规律,不是世界模型 |
理解了这些,你才知道什么时候该信任它,什么时候该核实。
九、一张图总结全流程
你的问题
↓ Tokenization(切词)
[数字序列]
↓ Embedding(嵌入)
[向量序列]
↓ Transformer × N 层(注意力 + 前馈)
[深层语义表示]
↓ 语言模型头
[下一个 Token 的概率分布]
↓ 采样(temperature、top-p)
生成的字 → 循环接龙 → 完整回答
十、写在最后
大模型不神秘。剥开"智能"的包装,它的核心就是:
海量数据 + 注意力机制 + 超大规模 + 人类对齐 = 今天你看到的 AI
它不完美——会犯错、会幻觉、会"看似理解实则模仿"。但正是这种"基于统计的接龙",在足够大的规模下,产生了令人震惊的能力。
理解原理,不是为了炫技,而是为了更清醒地使用它:知道它的能力从何而来,也就知道了它的边界在哪。
延伸阅读:
- 📄 Attention Is All You Need(Transformer 原始论文)
- 📄 InstructGPT 论文(RLHF 的起源)
- 🎓 3Blue1Brown 的神经网络系列(最直观的可视化讲解)