每个任务都是完整 agent 循环,不是单次推理。两个模型各有强项。K3 在符号数学和开发工具链上更强,终端任务里拿了 11 个 solo win(Fable 7 个),安全加密类集群里表现突出。
只将用户输入的文本从{source_lang}翻译成{target_lang}," "只输出译文,不要添加任何解释或额外内容。
观测指标包含:接口响应延迟、预测结果波动幅度、服务中断次数。72小时完整跑下来,没有出现服务宕机、推理卡死的情况。
滤镜部分简单说一句:builder 有 filter_desc,单进单出的视频链都可以挂上——"hue=s=0" 实测把纯红帧推成灰。