0, 'speaking': False, 'speech_duration': 0.
工程层——决定能不能用延迟看 p95/p99 尾部,别信平均值;流式下 time_starttransfer约等于 TTFT用真实工具调用任务验 tool_use(读写文件),不是问一句“你好”就算接上了确认协议:有 Anthropic 端点就直连,只有 OpenAI 端点就得挂翻译层看可靠性 / 有没有智能路由做故障转移——Agent 发几十次请求,1% 错误率就够你崩成本层——决定贵不贵支不支持提示词缓存,以及缓存命中怎么计价(这是 Agent 场景最大的省钱杠杆)计价粒度透不透明,有没有用量看板 / 调用日志能对账标称上下文 vs 真实可用的最大输出,别被“128k 上下文但输出砍到 4k”坑了长期层——决定敢不敢一直用模型版本能不能锁定,别今天满血明天偷偷换量化版数据合规:你的代码 prompt 会不会被拿去训练、日志留多久我自己这轮测下来,蓝耘 MaaS 在“Anthropic 直连、缓存命中 97.9%、可靠性 100%、延迟方差极小”这几条上是实打实过关的,截图和数据都在上面,你可以自己复现。它不是每一项都第一,但在我这个“自费跑 Agent”的场景里,它把我真正在乎的都做对了。结尾回到开头那个让我肉疼的账单。上次换便宜 API 越换越贵,不是因为我运气差,是因为我压根没搞懂该看什么——我只看了单价那一个数字,漏掉了缓存这个真正决定 Agent 成本的杠杆。
Walk down each branch of the design tree, resolving dependencies between decisions one-by-one.
同时同步建设外部信号: Reddit discussions G2 reviews 覆盖 AI 常引用的信源地方 … 小结 GEO 的核心逻辑就三句话: AI 搜索会把用户的一个主 Query 扩散成 8-12 个子查询(Fan-out) 你的内容只要精准命中其中一条子查询并排在前列,就能被 AI 引用为 Citation。
在构建中,Skill 会通过 go:embed 打包进二进制,与 CLI 的版本严格锁定,同时达成了 skill install 命令,可以一键安装技能。