Sierra 推出工具调用新基准 τ^τ-bench,Kimi K3 相隔两天成绩差异引质疑
zainhas · x · 2026-09-09
Sierra 发布了新的工具调用基准 τ^τ-bench(hyper-tau-bench),测模型在多轮真实业务场景中调用工具的能力。
发帖人提出两个观察点:
- Kimi K3 相隔两天测出的成绩不同,同模型不同 harness(OpenCode vs Kimi Code)也会影响结果,说明基准对运行环境敏感;
- banking(银行)子基准最难,无论对模型还是人类都是最大的坎。
该帖与随后的排行榜链接内容属同一事件,详细数据见配套帖子。
所属事件:Sierra 发布工具调用新基准,人类远超最强模型(2 条相关)→
「模型」频道最新
- OpenAI 高管称 Astra 需求空前,GPT-6 用量若续涨或暂停新增 Pro 订阅 — op7418 · 2026-09-09
- 老玩家自称练出「直觉 pangram」一眼识别 AI 生成文本 — IndraVahan · 2026-09-09
- 腾讯混元发布 Gander:全双工多模态交互智能体技术报告 — Tencent-Hunyuan · 2026-09-09
- Moonshot 开源 MoBA:称 95% 注意力计算被浪费,长文本快 16 倍 — gekobraa · 2026-09-09
- 从算错 2+2 到数学博士级:一张推文概括 AI 三年进化 — haider1 · 2026-09-09
- Muse Spark 1.3 横扫 tax agent 评测:每任务 $0.32,便宜 3 倍 — zainhas · 2026-09-09