实测 Astra 事实核查:仍会产出大量不相关的「假批评」
AndyMasley · x · 2026-09-07
Andy Masley 让 Astra 对自己写的一段文字做事实核查,发现它仍带着所有 LLM 的通病:提出很多似是而非、不切题的批评。例如原文只声称「数据中心在此处未增加水污染」,模型却反驳「水污染总体上当然仍可能是问题」——把对具体断言的核查偷换成泛泛而谈。
即便是最新的前沿模型,在做事实核查类任务时依然缺乏对「断言边界」的把握,这一点尚未被攻克。
「模型」频道最新
- OpenAI Astra 展示 3D 交互:贴纸可沿最近边缘方向剥离 — arena · 2026-09-08
- 337KB 就能开口说话:sanoTTS 把 TTS 塞进 3 美元芯片 — alexcovo_eth · 2026-09-08
- AI 智能体 Astra 两局满分饱和 EBR-bench,还找到破坏游戏的卡牌 — Jsevillamol · 2026-09-08
- 曝 Grok 4.7 已在 Grok Bot 中悄悄灰度测试,发布临近 — mark_k · 2026-09-08
- 网友质疑国际象棋 benchmark:模型下载 Stockfish 就能碾压 Magnus — iruletheworldmo · 2026-09-08
- Claude Fable 5.1 系统提示词解析:从禁用列表到「热修复」式迭代 — dbreunig · 2026-09-08