
摘要预训练完成后模型还远远谈不上“好用”。它可能会续写文本却不一定听得懂指令可能知道很多知识却不会按照固定格式输出甚至给出了正确答案置信度也未必可信。把基础模型改造成聊天助手、推理模型或决策模型的过程通常统称为后训练。本文将解释后训练与微调的关系并梳理 SFT、LoRA、DPO、RLHF、蒸馏和概率校准各自解决的问题。一、先给结论后训练是阶段微调是方法很多文章把“后训练”和“微调”当作同义词日常交流中问题不大但严格来说二者不是同一个概念。后训练Post-training基础模型完成预训练以后为了让它更有用、更可控、更适合某类任务而进行的一整套训练与优化阶段。微调Fine-tuning在已有模型参数的基础上继续训练使模型适应特定数据、任务或行为要求的一类方法。因此更准确的关系是微调是后训练的一部分但后训练不只有微调。可以把大模型的训练过程简化为下面这条流水线海量通用数据 ↓ 预训练获得语言、知识与基础能力 ↓ 监督微调 SFT学会遵循指令 ↓ 偏好优化 DPO / RLHF回答更符合人类偏好 ↓ 蒸馏、领域适配、概率校准与安全对齐 ↓ 可部署的聊天、推理或决策模型这里从预训练结束之后开始的部分都可以纳入“后训练”这个大概念。二、预训练到底训练了什么预训练通常使用规模巨大的文本、代码或多模态数据让模型反复完成“预测下一个 token”等自监督任务。经过预训练模型会获得语言结构和表达能力数据中蕴含的大量知识一定程度的推理、归纳和代码能力根据上下文继续生成内容的能力。但“会续写”不等于“会当助手”。一个只经过预训练的基础模型面对用户问题时可能继续模拟网页、补写问题或者生成多个互相矛盾的答案。它并不知道开发者希望它扮演什么角色也没有稳定遵循指令的习惯。后训练的核心任务就是把“能力”组织成可用的“行为”。三、后训练通常包括哪些技术1. 监督微调让模型学会按要求回答监督微调Supervised Fine-TuningSFT使用成对的示例训练模型例如{ instruction: 判断用户意图, input: 帮我把这句话翻译成英文, output: translation }模型通过大量示例学习指令与标准答案之间的映射。SFT 常被用于建立问答和对话格式学习行业术语与业务规则固定 JSON 等结构化输出适配分类、抽取、路由等具体任务。SFT 是最典型的微调也是后训练中最常见的一步。2. LoRA 和 QLoRA它们解决的是“怎么训得更省”全参数微调会更新模型的全部参数训练效果上限较高但显存、计算和存储成本也很高。LoRA 不直接大规模修改原模型参数而是在部分网络层旁边增加小型、可训练的低秩矩阵。训练时主要更新这些新增参数因此成本明显降低。QLoRA 又进一步将底座模型量化以减少显存占用。需要注意SFT 描述的是训练目标和数据形式LoRA 描述的是参数更新方式。二者不是二选一。完全可以使用 LoRA 来完成一次 SFT也可以使用全参数更新来完成同样的 SFT。3. 偏好优化让模型不只“答对”还要“答得合适”对于很多问题并不存在唯一标准答案。例如两个回答都没有事实错误但一个更清晰、简洁和安全。偏好数据通常由同一问题下的多个候选回答以及它们的优劣关系构成。DPODirect Preference Optimization等方法可以让模型更倾向于生成被偏好的回答。它主要优化的是模型行为而不是简单灌入知识。4. RLHF利用反馈信号进一步优化行为RLHF 即基于人类反馈的强化学习。经典流程会先收集人类偏好再训练奖励模型最后使用强化学习优化语言模型。现代后训练流程还可能使用可验证奖励、规则奖励或 AI 反馈。对于数学和代码任务答案是否正确往往可以由计算器、测试用例或验证器直接检查这为强化学习提供了相对明确的奖励信号。强化学习更适合优化复杂策略但训练难度和成本通常也高于普通 SFT。5. 蒸馏把大模型能力迁移给小模型蒸馏通常让能力较强的教师模型生成答案、标签、推理轨迹或概率分布再用这些数据训练较小的学生模型。它常用于降低推理成本缩短响应时间将通用模型能力迁移到专用模型为特定任务批量生产训练数据。蒸馏得到的小模型不一定全面超越教师模型但可能在目标任务上以更低成本达到足够好的效果。6. 概率校准让“80% 把握”真的接近 80%分类和决策模型不仅要给出选项还经常需要输出每个选项的概率。概率值如果不可靠业务系统就很难设置自动处理阈值。例如系统可能规定置信度高于 0.90自动执行0.600.90交给更强模型复核低于 0.60转人工处理。如果模型总是过度自信这套流程就会失效。概率校准的目标是让预测置信度与真实正确率尽量一致。这也是决策类模型后训练中的重要环节。四、用 Microsoft Decision-1 理解“后训练”Microsoft Decision-1 是一个很直观的案例。根据微软公开资料它建立在 Qwen3.5-9B 的开放权重之上并针对固定选项的决策评分进行了后训练。它接收上下文、问题和候选答案返回各个候选项的概率而不是像普通聊天模型那样生成一段开放文本。这类模型可用于意图分类、请求路由、优先级判断、结果验证和工作流控制。从这个案例可以看出后训练并不是简单地“再喂一点数据”。它可能同时涉及将通用生成模型改造成专用决策模型让模型遵循固定的输入输出协议优化单次决策的准确率与延迟校准各候选选项的概率增加拒答或“不确定”机制。微软并未公开全部训练配方因此不能断言其中具体采用了哪些未披露算法。但用“后训练”描述整个能力改造过程比只说“微调”更准确。五、常见概念对照概念它描述什么主要目的预训练从大规模数据学习通用能力获得语言、知识和基础推理能力后训练预训练后的整体优化阶段让模型有用、可控并适合部署SFT使用输入与标准答案训练学会指令和任务格式全参数微调更新模型的全部参数充分改变模型能力与行为LoRA / QLoRA参数高效的训练方式降低显存、计算和存储成本DPO直接使用偏好对优化让输出更符合期望偏好RLHF使用反馈和奖励进行强化学习优化复杂行为与策略蒸馏从教师模型向学生模型迁移能力获得更小、更快的模型概率校准调整预测概率的可信程度支持阈值控制和风险管理六、什么时候只做微调什么时候需要完整后训练如果需求只是让模型识别内部术语、适应固定格式或者提升某个垂直任务的效果一次高质量的 SFT 或 LoRA 微调可能已经足够。如果要把模型投入复杂生产系统还需要考虑模型是否遵循业务规则遇到证据不足时是否会拒绝判断输出概率是否可信是否存在安全与合规风险低置信度结果如何升级处理延迟、吞吐和部署成本是否达标。这时需要的往往不是一次孤立的微调实验而是一套包含数据构建、监督训练、偏好优化、评测、校准和安全治理的后训练工程。七、三个常见误区误区一后训练就是 LoRALoRA 只是一种参数高效训练技术。后训练还可能使用全参数微调、偏好优化、强化学习、蒸馏和校准等方法。误区二微调可以可靠地给模型灌入大量新知识微调更擅长改变模型的行为、格式与任务偏好。对于频繁变化、必须准确追溯的知识检索增强生成RAG或数据库查询通常更合适。误区三训练集准确率高就可以直接上线生产环境中的数据分布、边界案例和风险远比训练集复杂。独立测试集、压力测试、概率校准、人工升级机制和线上监控都不可缺少。总结如果只记住一句话可以记住预训练决定模型“有什么基础能力”后训练决定这些能力“以什么方式被使用”微调则是实现后训练目标的一类重要手段。随着大模型从聊天工具进入代理、路由和自动化工作流后训练的重点也在变化不仅要追求模型会不会回答还要关心它是否稳定、可信、低成本以及系统能否安全地使用它的结果。理解后训练不只是理解一种算法而是在理解基础模型如何真正变成产品。参考资料MicrosoftMicrosoft-Decision-1 模型介绍https://commandline.microsoft.com/microsoft-decision-1-model-foundry/Microsoft FoundryMicrosoft-Decision-1 模型目录Microsoft-Decision-1 | Model Catalog | Microsoft FoundryQwenQwen3.5-9B 模型页https://huggingface.co/Qwen/Qwen3.5-9B