因此,我们可以把后训练理解为对模型输出分布的重新塑造。本文重点讨论三种后训练方法: 监督微调(Supervised Fine-Tuning,SFT):在预先准备好的标准答案上学习; 强化学习(Reinforcement Learning,RL):从当前模型的输出中采样,再根据奖励优化; 在线策略蒸馏(On-Policy Distillation,OPD):由学生生成轨迹,再由教师在学生实际访问的状态上提供逐 token 指导。
停止过程按相反方向释放资源: beforeStop -> 调用所有 PluginResourceReleaser Bean -> 从 PluginApplicationContextRegistry 注销 -> 关闭 Spring 子容器 -> 清空插件持有的 context 引用 -> 恢复线程上下文 ClassLoader 线程池、连接、文件句柄和三方 SDK 客户端不能依赖 ClassLoader 卸载自动回收。
构建一个生产级 Agent 的正确姿势是:用 LangChain 的 @tool 把每个能力封装好,用 LangGraph 的图把这些工具编排成可控、可恢复、有状态的系统,并全程接入 tracing、retry、fallback、human-in-the-loop。
0, 'energy_threshold': ENERGY_THRESHOLD }, 'language_pair': { 'source': 'auto', 'target': 'zh' }, 'enable_tts': False, 'tts_stream_mode': config.
这半天测下来,我最大的收获不是“蓝耘好用”这个结论,而是那三句话:延迟看尾部,成本看缓存,Agent 看工具调用。下次再有人问我“接第三方 API 是不是填个 base_url 就行”,我会把这篇甩给他。填 URL 谁都会,但选之前先把这几个数测一遍,能省下的可能就是你下个月的账单。
For each question, provide your recommended answer.