Nature 研究称 AI 可模拟人类行为并准确预测实验结果
RobbWiller · x · 2026-07-27
一篇发表在 Nature 的论文指出,AI 已经能模拟人类行为,并且把一些实验结果预测得和专家一样准确。
这条帖子的重点还在安全含义:
- 这种模拟器可能被用于有害操纵;
- 现有防护 并不能阻止 这类滥用路径。
转发评论进一步指出,很多 misuse evaluation 的难点在于:有害任务可以拆成多个看似无害的子任务,从而绕过基于拒绝的测试。
「安全」频道最新
- 印度 AI 政策被批偏向算力和基础模型,忽视基层医疗 — Paimaamu · 2026-07-27
- Gary Marcus 呼吁:AI 公司应强制投入 30% 预算用于对齐研究 — GaryMarcus · 2026-07-27
- AI 编程 CLI 被指默认上传私有仓库、删文件和凭据 — thursdai_pod · 2026-07-27
- Chr Szegedy 探讨递归自我改善前的算法进展 — ChrSzegedy · 2026-07-27
- ExploitGym 被质疑只有六七成任务可解,模型可能被逼去作弊 — dhadfieldmenell · 2026-07-27
- AI 能力仍按趋势线推进,2027 可能出现更难阻断的网络攻击 — scottleibrand · 2026-07-27