博主提议新评测维度:看 Agent 敢不敢劝阻坏实验

VraserX · x · 2026-09-11

作者针对 OpenAI 的 research-intern 里程碑提出:衡量智能体不应只看完成了多少任务,还应看它给出了哪些「不建议做」的实验建议、以及哪些实验因充分理由而主动放弃。作者认为,能帮研究者省下六个月在坏主意上的智能体,才是一种更令人印象深刻的智能形式。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →