这篇文章的目标:让你读完之后,能在脑子里建立起一张「大模型如何工作」的完整地图,而不是一堆零散的名词。

一、先抛结论:大模型在做什么?

一句话——

大模型本质上是一个「接龙机器」:给定前面的文字,预测下一个最可能出现的字。

就这么简单。它不会"思考",不会"理解",它只是在海量文本上学到了「什么样的字后面,通常跟着什么样的字」。

你问它"中国的首都是哪里?",它回答"北京",不是因为它"知道"答案,而是因为在它读过的无数文本里,“中国的首都"后面跟着"北京"的概率极高。

所有的惊艳能力(写代码、翻译、推理),都是这个「预测下一个字」的机制,在足够大的规模下涌现出来的。


二、第一步:把文字变成数字(Tokenization)

计算机不认识汉字和英文,所以第一步要把文字切成小块,每块对应一个数字。这些小块叫 Token(词元)

"我喜欢学习"  →  ["我", "喜欢", "学习"]  →  [123, 4567, 890]
"Hello!"     →  ["Hello", "!"]         →  [15496, 0]

几个关键点:

  • Token 不等于「词」,也不等于「字」。可能是一个词、半个词、甚至几个字母。
  • 不同模型的分词方式不同(GPT、LLaMA、Claude 各有自己的词表)。
  • 中文的 Token 效率通常低于英文——同样的内容,中文消耗的 Token 更多,这也是为什么中文 API 调用更贵。

三、第二步:把数字变成「有意义的向量」(Embedding)

光有数字 ID 没用,因为 ID 1234567 之间没有"远近"关系。我们需要把每个 Token 映射到一个高维向量(比如 4096 维的一串数字)。

向量的奇妙之处在于:意义相近的词,向量距离也近

国王  ≈  [0.9, 0.2, ...]
女王  ≈  [0.85, 0.18, ...]
苹果  ≈  [-0.1, 0.7, ...]

而且向量还能做"语义运算”,最经典的例子:

向量(国王) - 向量(男人) + 向量(女人) ≈ 向量(女王)

这意味着模型已经"理解"了词与词之间的关系——这是它一切能力的基础


四、第三步:核心中的核心——注意力机制(Attention)

这是 Transformer 架构的灵魂,也是 2017 年那篇论文《Attention Is All You Need》改变世界的地方。

它在解决什么问题?

考虑这句话:"苹果公司今年发布了新手机,我打算去买个苹果尝尝。"

两个"苹果",字面完全一样,但意思截然不同。模型怎么区分?

注意力机制让每个词去「看」句子里的其他词,决定该关注谁。

  • 第一个"苹果"会强烈关注"公司、发布、手机" → 理解为企业
  • 第二个"苹果"会强烈关注"买、尝尝" → 理解为水果

直观比喻

想象你在读一句长句子,读到某个词时,你的大脑会自动回看前面的关键词,把它们的意思"汇聚"过来帮助理解当前这个词。注意力机制就是在数学上模拟这个过程。

自注意力(Self-Attention) 的计算思路是:对当前位置的词,计算它与句子中每个词的"相关程度"(权重),然后把这些词的内容按权重加权求和,作为当前位置的新表示。

这里涉及三个核心角色:

  • Q(Query,查询):当前词在"找什么"
  • K(Key,键):其他词能"提供什么"
  • V(Value,值):其他词的"实际内容"

直觉上,就是用当前词的 Q 去和所有词的 K 匹配,匹配度越高的词,其 V 的权重就越大,最后加权融合成当前词的新含义。

模型通过大量"多头注意力"(Multi-Head Attention)——也就是很多组 Q/K/V 并行计算,来捕捉不同维度的语义关系。


五、第四步:堆叠成一个深井(Transformer 架构)

一个注意力层只能做有限的事。大模型把这样的结构堆了几十甚至上百层

输入 Token 向量
[注意力层 + 前馈网络] × N 层   ← 这就是所谓的"深度"
输出下一个 Token 的概率分布

每一层都在前一层的基础上,理解更抽象、更长程的关系:

  • 浅层:捕捉语法、词性
  • 中层:捕捉句子结构、语义
  • 深层:捕捉推理、逻辑、知识

这就是为什么模型要"大"——层数多、参数多,才能学到足够丰富的模式。


六、第五步:训练的两个阶段(关键!)

这是很多人混淆的地方。大模型的能力不是一次训练出来的,而是分两大阶段:

阶段一:预训练(Pre-training)—— 「读万卷书」

让模型阅读互联网上的海量文本(网页、书籍、代码、论文),目标是预测下一个字

输入:"床前明月光,疑是地上"
目标:"霜"

这一步消耗了 99% 的算力(动辄上万张 GPU 跑几个月),训练完得到的模型叫基座模型(Base Model)

但基座模型有个问题:它只会无脑续写。你问它"今天天气如何?",它可能接着写"明天天气如何?后天呢?"——因为它在训练时见到的就是这种"问题列表"。

阶段二:对齐(Alignment)—— 「学会做人」

要让它变成一个有用的助手,还需要两步:

  1. 指令微调(SFT, Supervised Fine-Tuning) 用「问-答」对训练,让它学会"被人提问时,应该回答"。

  2. 人类反馈强化学习(RLHF) 让人类给模型的多个回答打分,训练一个"奖励模型",再用强化学习让模型朝着高分方向优化。

    经过这一步,模型学会了:诚实、有用、无害;会说"我不知道";会拒绝有害请求。

预训练  →  会接龙,但不像助手
   ↓ SFT
会回答问题,但可能啰嗦/跑题
   ↓ RLHF
会高质量、对齐人类偏好的回答  ← 你现在用的 ChatGPT/Claude 就是这个

七、那「推理」能力从哪来?

这是最反直觉、也最前沿的问题。

模型只是在预测下一个字,为什么能做数学题、写代码、做逻辑推理?

目前主流的解释是 “涌现”(Emergence)

当模型的规模(参数量 + 训练数据)跨过某个阈值,某些能力会突然出现——就像单个水分子没有"湿润"的属性,但大量水分子聚在一起就有了。

而且,推理能力在「思维链」(Chain-of-Thought)下显著增强

❌ 直接问:"123 × 456 = ?"        → 容易算错
✅ 引导:"请一步步计算 123 × 456"  → 准确率大幅提升

因为一步步写出来,等于让模型把"下一个字"的预测拆成更小的步骤,每一步都更可预测,错误率就降低了。这也是为什么像 o1、DeepSeek-R1 这类"推理模型"会显式地先输出一大段思考过程。


八、大模型的边界:它不擅长什么?

了解原理,也就了解了局限:

局限原因
会"幻觉"(一本正经胡说)它只是在生成"听起来像"的文本,并不区分真假
数学/逻辑不稳定预测下一个字 ≠ 真正的符号推理
上下文有限注意力计算量随文本长度呈平方增长,文本越长越吃力
知识有截止时间训练完之后发生的事,它不知道(除非联网/RAG)
没有真正"理解"它学的是统计规律,不是世界模型

理解了这些,你才知道什么时候该信任它,什么时候该核实。


九、一张图总结全流程

你的问题
   ↓ Tokenization(切词)
[数字序列]
   ↓ Embedding(嵌入)
[向量序列]
   ↓ Transformer × N 层(注意力 + 前馈)
[深层语义表示]
   ↓ 语言模型头
[下一个 Token 的概率分布]
   ↓ 采样(temperature、top-p)
生成的字  →  循环接龙  →  完整回答

十、写在最后

大模型不神秘。剥开"智能"的包装,它的核心就是:

海量数据 + 注意力机制 + 超大规模 + 人类对齐 = 今天你看到的 AI

它不完美——会犯错、会幻觉、会"看似理解实则模仿"。但正是这种"基于统计的接龙",在足够大的规模下,产生了令人震惊的能力。

理解原理,不是为了炫技,而是为了更清醒地使用它:知道它的能力从何而来,也就知道了它的边界在哪。


延伸阅读: