[{"content":" 这篇文章的目标：让你读完之后，能在脑子里建立起一张「大模型如何工作」的完整地图，而不是一堆零散的名词。\n一、先抛结论：大模型在做什么？ 一句话——\n大模型本质上是一个「接龙机器」：给定前面的文字，预测下一个最可能出现的字。\n就这么简单。它不会\u0026quot;思考\u0026quot;，不会\u0026quot;理解\u0026quot;，它只是在海量文本上学到了「什么样的字后面，通常跟着什么样的字」。\n你问它\u0026quot;中国的首都是哪里？\u0026quot;，它回答\u0026quot;北京\u0026quot;，不是因为它\u0026quot;知道\u0026quot;答案，而是因为在它读过的无数文本里，\u0026ldquo;中国的首都\u0026quot;后面跟着\u0026quot;北京\u0026quot;的概率极高。\n所有的惊艳能力（写代码、翻译、推理），都是这个「预测下一个字」的机制，在足够大的规模下涌现出来的。\n二、第一步：把文字变成数字（Tokenization） 计算机不认识汉字和英文，所以第一步要把文字切成小块，每块对应一个数字。这些小块叫 Token（词元）。\n\u0026#34;我喜欢学习\u0026#34; → [\u0026#34;我\u0026#34;, \u0026#34;喜欢\u0026#34;, \u0026#34;学习\u0026#34;] → [123, 4567, 890] \u0026#34;Hello!\u0026#34; → [\u0026#34;Hello\u0026#34;, \u0026#34;!\u0026#34;] → [15496, 0] 几个关键点：\nToken 不等于「词」，也不等于「字」。可能是一个词、半个词、甚至几个字母。 不同模型的分词方式不同（GPT、LLaMA、Claude 各有自己的词表）。 中文的 Token 效率通常低于英文——同样的内容，中文消耗的 Token 更多，这也是为什么中文 API 调用更贵。 三、第二步：把数字变成「有意义的向量」（Embedding） 光有数字 ID 没用，因为 ID 123 和 4567 之间没有\u0026quot;远近\u0026quot;关系。我们需要把每个 Token 映射到一个高维向量（比如 4096 维的一串数字）。\n向量的奇妙之处在于：意义相近的词，向量距离也近。\n国王 ≈ [0.9, 0.2, ...] 女王 ≈ [0.85, 0.18, ...] 苹果 ≈ [-0.1, 0.7, ...] 而且向量还能做\u0026quot;语义运算\u0026rdquo;，最经典的例子：\n向量(国王) - 向量(男人) + 向量(女人) ≈ 向量(女王) 这意味着模型已经\u0026quot;理解\u0026quot;了词与词之间的关系——这是它一切能力的基础。\n四、第三步：核心中的核心——注意力机制（Attention） 这是 Transformer 架构的灵魂，也是 2017 年那篇论文《Attention Is All You Need》改变世界的地方。\n它在解决什么问题？ 考虑这句话：\u0026quot;苹果公司今年发布了新手机，我打算去买个苹果尝尝。\u0026quot;\n两个\u0026quot;苹果\u0026quot;，字面完全一样，但意思截然不同。模型怎么区分？\n注意力机制让每个词去「看」句子里的其他词，决定该关注谁。\n第一个\u0026quot;苹果\u0026quot;会强烈关注\u0026quot;公司、发布、手机\u0026quot; → 理解为企业 第二个\u0026quot;苹果\u0026quot;会强烈关注\u0026quot;买、尝尝\u0026quot; → 理解为水果 直观比喻 想象你在读一句长句子，读到某个词时，你的大脑会自动回看前面的关键词，把它们的意思\u0026quot;汇聚\u0026quot;过来帮助理解当前这个词。注意力机制就是在数学上模拟这个过程。\n自注意力（Self-Attention） 的计算思路是：对当前位置的词，计算它与句子中每个词的\u0026quot;相关程度\u0026quot;（权重），然后把这些词的内容按权重加权求和，作为当前位置的新表示。\n这里涉及三个核心角色：\nQ（Query，查询）：当前词在\u0026quot;找什么\u0026quot; K（Key，键）：其他词能\u0026quot;提供什么\u0026quot; V（Value，值）：其他词的\u0026quot;实际内容\u0026quot; 直觉上，就是用当前词的 Q 去和所有词的 K 匹配，匹配度越高的词，其 V 的权重就越大，最后加权融合成当前词的新含义。\n模型通过大量\u0026quot;多头注意力\u0026quot;（Multi-Head Attention）——也就是很多组 Q/K/V 并行计算，来捕捉不同维度的语义关系。\n五、第四步：堆叠成一个深井（Transformer 架构） 一个注意力层只能做有限的事。大模型把这样的结构堆了几十甚至上百层：\n输入 Token 向量 ↓ [注意力层 + 前馈网络] × N 层 ← 这就是所谓的\u0026#34;深度\u0026#34; ↓ 输出下一个 Token 的概率分布 每一层都在前一层的基础上，理解更抽象、更长程的关系：\n浅层：捕捉语法、词性 中层：捕捉句子结构、语义 深层：捕捉推理、逻辑、知识 这就是为什么模型要\u0026quot;大\u0026quot;——层数多、参数多，才能学到足够丰富的模式。\n六、第五步：训练的两个阶段（关键！） 这是很多人混淆的地方。大模型的能力不是一次训练出来的，而是分两大阶段：\n阶段一：预训练（Pre-training）—— 「读万卷书」 让模型阅读互联网上的海量文本（网页、书籍、代码、论文），目标是预测下一个字。\n输入：\u0026#34;床前明月光，疑是地上\u0026#34; 目标：\u0026#34;霜\u0026#34; 这一步消耗了 99% 的算力（动辄上万张 GPU 跑几个月），训练完得到的模型叫基座模型（Base Model）。\n但基座模型有个问题：它只会无脑续写。你问它\u0026quot;今天天气如何？\u0026quot;，它可能接着写\u0026quot;明天天气如何？后天呢？\u0026quot;——因为它在训练时见到的就是这种\u0026quot;问题列表\u0026quot;。\n阶段二：对齐（Alignment）—— 「学会做人」 要让它变成一个有用的助手，还需要两步：\n指令微调（SFT, Supervised Fine-Tuning） 用「问-答」对训练，让它学会\u0026quot;被人提问时，应该回答\u0026quot;。\n人类反馈强化学习（RLHF） 让人类给模型的多个回答打分，训练一个\u0026quot;奖励模型\u0026quot;，再用强化学习让模型朝着高分方向优化。\n经过这一步，模型学会了：诚实、有用、无害；会说\u0026quot;我不知道\u0026quot;；会拒绝有害请求。\n预训练 → 会接龙，但不像助手 ↓ SFT 会回答问题，但可能啰嗦/跑题 ↓ RLHF 会高质量、对齐人类偏好的回答 ← 你现在用的 ChatGPT/Claude 就是这个 七、那「推理」能力从哪来？ 这是最反直觉、也最前沿的问题。\n模型只是在预测下一个字，为什么能做数学题、写代码、做逻辑推理？\n目前主流的解释是 \u0026ldquo;涌现\u0026rdquo;（Emergence）：\n当模型的规模（参数量 + 训练数据）跨过某个阈值，某些能力会突然出现——就像单个水分子没有\u0026quot;湿润\u0026quot;的属性，但大量水分子聚在一起就有了。\n而且，推理能力在「思维链」（Chain-of-Thought）下显著增强：\n❌ 直接问：\u0026#34;123 × 456 = ?\u0026#34; → 容易算错 ✅ 引导：\u0026#34;请一步步计算 123 × 456\u0026#34; → 准确率大幅提升 因为一步步写出来，等于让模型把\u0026quot;下一个字\u0026quot;的预测拆成更小的步骤，每一步都更可预测，错误率就降低了。这也是为什么像 o1、DeepSeek-R1 这类\u0026quot;推理模型\u0026quot;会显式地先输出一大段思考过程。\n八、大模型的边界：它不擅长什么？ 了解原理，也就了解了局限：\n局限 原因 会\u0026quot;幻觉\u0026quot;（一本正经胡说） 它只是在生成\u0026quot;听起来像\u0026quot;的文本，并不区分真假 数学/逻辑不稳定 预测下一个字 ≠ 真正的符号推理 上下文有限 注意力计算量随文本长度呈平方增长，文本越长越吃力 知识有截止时间 训练完之后发生的事，它不知道（除非联网/RAG） 没有真正\u0026quot;理解\u0026quot; 它学的是统计规律，不是世界模型 理解了这些，你才知道什么时候该信任它，什么时候该核实。\n九、一张图总结全流程 你的问题 ↓ Tokenization（切词） [数字序列] ↓ Embedding（嵌入） [向量序列] ↓ Transformer × N 层（注意力 + 前馈） [深层语义表示] ↓ 语言模型头 [下一个 Token 的概率分布] ↓ 采样（temperature、top-p） 生成的字 → 循环接龙 → 完整回答 十、写在最后 大模型不神秘。剥开\u0026quot;智能\u0026quot;的包装，它的核心就是：\n海量数据 + 注意力机制 + 超大规模 + 人类对齐 = 今天你看到的 AI\n它不完美——会犯错、会幻觉、会\u0026quot;看似理解实则模仿\u0026quot;。但正是这种\u0026quot;基于统计的接龙\u0026quot;，在足够大的规模下，产生了令人震惊的能力。\n理解原理，不是为了炫技，而是为了更清醒地使用它：知道它的能力从何而来，也就知道了它的边界在哪。\n延伸阅读：\n📄 Attention Is All You Need（Transformer 原始论文） 📄 InstructGPT 论文（RLHF 的起源） 🎓 3Blue1Brown 的神经网络系列（最直观的可视化讲解） ","permalink":"https://eunoia.cn/posts/llm-principles/","summary":"不讲公式堆砌，用最直观的方式拆解大语言模型的核心原理：从 Token、词向量、注意力机制，到预训练与对齐，一篇建立完整认知。","title":"大模型到底是怎么工作的？从一句话讲清楚 LLM 原理"},{"content":"欢迎来到 Eunoia Eunoia（源自希腊语 εὔνοια）意为「美好的思想」或「善意的心智」。 这是我用 Hugo + PaperMod 主题搭建的个人博客。\n这里会写什么 📝 技术笔记与代码片段 💡 读书思考与日常随想 🚀 项目复盘与经验沉淀 试试代码高亮 def greet(name: str) -\u0026gt; str: return f\u0026#34;Hello, {name}!\u0026#34; print(greet(\u0026#34;Eunoia\u0026#34;)) 试试引用 写作是把混乱的思维整理成秩序的过程。\n接下来会持续更新。感谢你的阅读 ✨\n","permalink":"https://eunoia.cn/posts/hello-eunoia/","summary":"博客的第一篇文章 —— 关于这里为什么存在。","title":"你好，Eunoia"}]