Kimi K3 实战对标 Fable 5:开源模型在 SWE-bench 上几乎打平了 - OSCHINA - 中文开源技术交流社区

发布时间: 2026-07-21 · 来源: 新能源产业网 · 阅读量: 2464
digital image 1 code image 2 server image 3

# 造一个约 6000 token 的大 system 上下文BIG=$(python3 -c "print('你是一个资深工程师。以下是项目规范:'+ '规则条目。'*2000)")# 连发两次完全相同的请求,盯 cached_tokens 的变化for round in 1 2; do echo "=== 第 $round 次 ===" curl -sS "$LY_BASE/chat/completions" \ -H "Authorization: Bearer $LY_KEY" -H "Content-Type: application/json" \ -d "$(jq -n --arg m "$LY_MODEL" --arg s "$BIG" \ '{model:$m,messages:[{role:"system",content:$s},{role:"user",content:"回复ok"}]}')" \ | jq '.usage.prompt_tokens, .usage.prompt_tokens_details.cached_tokens' sleep 2done

你觉得呢?" 每一个问题都带推荐答案,你只需要点头或摇头。6 个问题、2 分钟,所有模糊点变成了明确的技术决策。

不对!它根据你的历史数据、上下文、你之前的记录等信号,改写成它认为高概率的查询。

但 Agent 是「执行命令 → 拿结果 → 决定下一步」的循环,如果在同一次工具调用里既要输出登录链接又要轮询,链接就没法通过模型返回给用户,从而阻塞整个会话。

listdir(".") for entry in entries: print(entry) # 递归遍历 for root, dirs, files in os.

配图