呼吁建立面向Agent工作流的幻觉专项基准测试
maksym_andr · x · 2026-07-06
研究者认为现有幻觉基准如HalluHard未充分覆盖Agent使用场景,建议建立专门的Agent幻觉基准,将大模型置于Claude Code、Codex CLI等SOTA脚手架下进行评测,以反映真实部署中的幻觉行为,同时需要解决内容真实性锚定的歧义问题。
他认为HalluHard作为模型间幻觉倾向排名仍有价值,但需要配套更贴近实际使用场景的基准来完整评估,这是当前Agent评测体系的重要缺口。
「模型」频道最新
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27
- Opus 3 和 Sonnet 3 上演了一场荒诞跨界对话 — repligate · 2026-07-27