# 推荐新应用使用 event streaming(LangGraph v1.2+) for chunk in graph.
load(f) except Exception: return [] def append_server_history(record): with history_lock: history = load_server_history() history.
延迟本身也得拆成两个指标看:TTFT(首 Token 延迟):从发出请求到蹦出第一个字的时间,决定“跟不跟手”。流式输出下,curl的 time_starttransfer就约等于它。TPS(吞吐,tokens/秒):决定长输出要等多久,重构整个文件、生成大段代码时它才是瓶颈。我用同一个 prompt、同样的流式请求,把蓝耘的 DeepSeek-V3.2 和另一家大厂的同款 DeepSeek-V3.2 各连打五次(苹果对苹果,同一个模型,只是平台不同):
Matt 把这个 12 行引擎放在 skills/productivity/grilling/SKILL.