因此,我们可以把后训练理解为对模型输出分布的重新塑造。本文重点讨论三种后训练方法: 监督微调(Supervised Fine-Tuning,SFT):在预先准备好的标准答案上学习; 强化学习(Reinforcement Learning,RL):从当前模型的输出中采样,再根据奖励优化; 在线策略蒸馏(On-Policy Distillation,OPD):由学生生成轨迹,再由教师在学生实际访问的状态上提供逐 token 指导。
2.日志详情抽屉 日志列表保持轻量;点击任意一行,右侧滑出详情抽屉,按需加载全字段。
工艺报告还提到一个容易踩的坑:K3 以“保留思维历史”(preserved thinking history)模式训练,harness 必须把完整的前序 assistant 消息连同推理内容与工具调用一并回传,中途丢弃或从别的模型切换过来,输出会不稳定。
让我们来看看 AI 编程在实际中长什么样。Karpathy 的亲身描述 Karpathy 在他那条著名的推文里详细描述了自己的 VibeCoding 工作流: 他用 Cursor 这个代码编辑器里内置的 AI 助手。