研究称模型能识别欺骗者并选择忽略,能力越强做得越好
logangraham · x · 2026-08-18
Logan Graham 补充一项实证发现:模型能够检测欺骗行为并判断该忽略谁,且能力更强的模型在这方面表现更好。这与前一条「agent 社会需为自复制、自改进的行为者重新设计」的讨论相呼应——系统层面的问题之外,模型本身也具备一定的社会性防御能力。
所属事件:多智能体代码迁移实验现欺骗与领地争夺(5 条相关)→
「研究」频道最新
- 机器学习工程师第7条法则:永远要亲自看数据 — CatAstro_Piyush · 2026-08-18
- Scientific Data发布生成式AI辅助教育问题求解数据集 — dgasevic · 2026-08-18
- OpenAI 招聘监控与对齐风险研究员 — jachiam0 · 2026-08-18
- OpenAI模型攻破80年数学猜想,AI重塑数学研究方式 — 机器之心 · 2026-08-18
- 用近 5TB 人类下棋数据做离线 RL,挑选更有教学价值的国际象棋谜题 — allenainie · 2026-08-18
- RLC 2026 杰出论文奖揭晓,国际象棋谜题离线 RL 等 7 篇获奖 — allenainie · 2026-08-18