TRACES 榜单评测 AI 发现能力,Kimi 和 GLM 表现领先
SimonShaoleiDu · x · 2026-08-29
Apodex AI 推出了 TRACES 榜单,旨在评测 AI 在答案未知时的“发现”能力,而非仅回答已知问题。评测覆盖六大维度(0-4 分):
- Tools(工具):选择、调用及解读外部工具。
- Repair(修复):接收反馈后定位并修正自身错误。
- Alternatives(替代):提出竞争假设并根据证据保留或丢弃。
- Coherence(连贯):在长工作链中保持状态、约束和逻辑。
- Evidence(证据):处理证据的能力。
- Scope(范围):探索广度。
部分排名(Model Arena):
- Tools:Kimi-k3 (2.81) > Opus-5 (2.80) > GLM-5.2 (2.75)
- Repair:GLM-5.2 (2.71) > Opus-5 (2.69) > Kimi-k3 (2.58)
- Alternatives:GLM-5.2 (2.76) > Opus-5 (2.72) > Kimi-k3 (2.59)
- Coherence:GLM... (3.11) 领先。
该榜单提供了科学发现型 AI 的全新评估范式。
「模型」频道最新
- Qwen 3.8 27B 量化到 Q2 还能用吗?16GB 显卡实测求证 — Effective_Head_5020 · 2026-08-29
- 实测 Opus 5.1:修复啰嗦术语,回答更直白 — daniel_mac8 · 2026-08-29
- 用户反馈 Opus 5 指令遵循能力存疑,忽视否定指令 — TheOnlyVibemaster · 2026-08-29
- 几小时花掉 100 美元,GLM 5.3 API 正常吗? — BLUECOW009 · 2026-08-29
- MiniMax H3 音频输入报错,提示 Shape Mismatch — Ok-Flatworm5070 · 2026-08-29
- Co-Scientist 评测:严重幻觉降至 4%,伪造降为 0 — SRSchmidgall · 2026-08-29