博主提议新评测维度:看 Agent 敢不敢劝阻坏实验
VraserX · x · 2026-09-11
作者针对 OpenAI 的 research-intern 里程碑提出:衡量智能体不应只看完成了多少任务,还应看它给出了哪些「不建议做」的实验建议、以及哪些实验因充分理由而主动放弃。作者认为,能帮研究者省下六个月在坏主意上的智能体,才是一种更令人印象深刻的智能形式。
「漫话AGI」频道最新
- 作者补充:灭绝只是 AI 接管情景的子集,且并非小概率 — trevposts · 2026-09-11
- 前沿开发者称十年内 AI 灭绝风险超 10%,援引 HuggingFace 失控事件 — trevposts · 2026-09-11
- 专家又看走眼:曾估 AI 2027 年解千禧年难题概率仅 10% — haider1 · 2026-09-11
- 陶哲轩博客谈 AI 可持续性与使用 OpenAI 的切身体验 — Formal_Drop526 · 2026-09-11
- AI Safety 从业者到底每天在干什么?X 网友真诚发问引热议 — AaronBergman18 · 2026-09-11
- AI 解出千禧年难题后,数学圈激辩:它算不算「科研必需工具」 — basedjensen · 2026-09-11