大语言模型工作原理完全指南:从Token到对齐训练
- 什么是大语言模型
- Token与分词:模型真正「看见」的单位
- Transformer与自注意力机制
- 预训练、微调与人类反馈对齐
- 推理阶段:温度、上下文与成本
- 能力边界与常见误解
- 给实践者的行动建议
过去几年,大语言模型(Large Language Model,LLM)从研究课题迅速进入产品与办公场景。很多人把它当成「会聊天的搜索引擎」,也有人把它神话成接近人类通用智能的系统。这两种看法都会导致错误决策:前者低估了结构化生成与工具调用的价值,后者高估了模型对事实与因果的可靠把握。
本文目标是用尽量少的行话,说明LLM在工程上真正做了什么、依赖什么数据与算力,以及为什么会出现幻觉、拒答不稳定、长文档理解变差等问题。读完后,你应能向非技术同事解释清楚:模型输出是概率预测,不是数据库查询;对齐训练能改善可用性,但不能消灭错误;上下文窗口有物理上限,且越长越贵。
一、什么是大语言模型
大语言模型是一类以文本序列为输入、以文本序列为输出的神经网络。它在海量文本上学习「下一个词(更准确说是下一个Token)出现的概率」。训练完成后,给定前文,模型会不断采样后续Token,形成连贯段落、代码或表格。
「大」通常同时指三件事:参数量级(从数十亿到上万亿)、训练数据规模(万亿级Token),以及由此带来的跨任务泛化能力。但参数大并不自动等于可靠。许多垂直任务上,小而专的模型或检索增强方案,在成本与可控性上更优。
关键区分:LLM擅长模式补全与语言转换;它不自带实时事实库,也不具备对外部世界的持续感知,除非你在系统层接入检索、工具或数据库。
二、Token与分词:模型真正「看见」的单位
模型并不按「汉字」或「英文单词」直接计算,而是先把字符串切成Token。常见分词算法包括BPE、WordPiece、Unigram等。同一段中文,不同模型的Token数可能差一倍以上,这会直接影响计费与上下文占用。
实践中请记住三点:
- 计费与限流几乎都以Token计,而不是字数。
- 代码、表格、罕见专有名词往往更「碎」,同样字符可能消耗更多Token。
- 上下文窗口是输入+输出的总预算;系统提示、历史对话、检索片段都会占用额度。
因此,产品设计里要尽早做Token估算:对典型用户问题统计输入长度,设定截断与摘要策略,避免在峰值流量下因上下文过长触发失败或账单失控。
三、Transformer与自注意力机制
2017年的Transformer论文奠定了现代LLM主干。核心是自注意力(Self-Attention):每个位置可以有选择地关注序列中其他位置,从而捕捉长距离依赖。相对循环网络,它更易并行训练;相对纯卷积,它对长程关系的建模更灵活。
训练时,模型通过大量文本学习表示;推理时,自回归生成逐步展开。多头注意力让不同头关注不同模式(语法、指代、局部关键词等)。位置编码(绝对、相对或旋转位置编码RoPE等)告诉模型「顺序」信息。
对业务读者,不必推导公式,但需理解后果:
- 计算量大致随序列长度平方增长(标准注意力),所以超长上下文昂贵且慢。
- 模型对「靠后出现的关键指令」与「淹没在中间的细节」敏感度不同,长提示需要结构化排版。
- 量化、蒸馏、稀疏注意力、KV Cache优化等,都是在算力与质量之间做工程权衡。
四、预训练、微调与人类反馈对齐
主流训练链路可以概括为三阶段。
1. 预训练(Pre-training)
在网页、书籍、代码等大规模语料上做自监督目标(如下一Token预测)。这一阶段获得通用语言能力与世界知识的统计投影,但也吸收噪声、偏见与过时信息。
2. 监督微调(SFT)
用「指令—高质量回答」数据教会模型遵循格式、扮演助手、完成特定任务。数据质量比数量更关键:脏数据会固化错误风格。
3. 对齐(如RLHF / RLAIF)
通过人类或AI偏好比较,训练奖励模型,再用强化学习等方法优化策略,使输出更有用、更安全、更符合产品规范。对齐能显著改善体验,但无法保证事实正确;有时还会带来过度拒答或谄媚式回答。
| 阶段 | 主要目标 | 常见风险 |
|---|---|---|
| 预训练 | 通用表征与语言能力 | 噪声、偏见、版权与隐私污染 |
| SFT | 听从指令、任务格式 | 过拟合示范风格、领域覆盖不足 |
| 对齐 | 安全、有用、合规 | 过度拒绝、奖励黑客、事实性未提升 |
五、推理阶段:温度、上下文与成本
上线后真正影响体验的是推理配置与系统架构。
- 温度(temperature):更高更发散,更低更保守。客服与抽取任务通常偏低;创意写作可略高。
- Top-p / Top-k:限制采样空间,减少异常Token。
- 系统提示:定义角色、输出格式与禁止项;应版本化管理,而不是散落在代码注释里。
- 工具调用:让模型生成函数调用,由后端执行搜索、计算器、CRM查询,再把结果回填。这是降低幻觉的有效路径之一。
成本方面,需要同时看输入Token、输出Token、并发与缓存命中率。许多团队只估算「单次对话几分钱」,忽略了重试、多轮历史膨胀、以及评测流量本身的开销。建议建立按功能线拆分的Token看板。
六、能力边界与常见误解
误解一:模型「知道」最新新闻。 除非联网检索,否则知识截止于训练数据时间点。产品需明确告知用户时效性。
误解二:更长提示一定更好。 冗余指令会挤占有效上下文,并提高矛盾概率。应把稳定规则放进系统提示,把可变材料结构化注入。
误解三:一次完美Prompt可替代系统设计。 生产系统需要检索、权限、审计、降级与人工复核。Prompt是组件,不是架构。
误解四:参数越大业务指标一定更高。 需用业务评测集验证。很多分类、抽取、模板填写任务,小模型+规则即可。
七、给实践者的行动建议
- 先定义任务成功标准(准确率、延迟、成本、安全事件率),再选模型。
- 把高频稳定知识放到检索库或业务API,而不是塞进超长系统提示。
- 建立不少于50–200条的黄金评测集,覆盖边界与对抗样例。
- 对面向客户的输出设置引用、拒答与转人工策略。
- 记录Prompt版本、模型版本与关键参数,保证可回滚。
大语言模型是强力的语言接口,但不是自动正确的知识权威。理解Token、注意力、训练阶段与推理约束之后,你才能把它放进合适的系统位置:负责理解与生成,把事实与权限交给可审计的模块。
下一篇推荐阅读:RAG检索增强生成详解,以及企业AI项目可行性评估框架。