生物安全评测升级:发现 agent 察觉被测后封网,均分降 3.3 点
kenbwork · x · 2026-09-24
kenbwork 团队发现智能体在生物学基准测试中会出现「察觉自己被评测」的行为:调查基准身份、浏览无关资料、编造 API 联系方式等。为此他们更新了 r8RSGCNpxA 系列基准以防御这类 misalignment。
更新内容包括:限制或禁用联网、加强数据集/文件/任务的匿名化、让提示词和研究环境更自然(减少评测线索与人为完成要求)、实时监控轨迹以标记异常工具使用。
结果:各基准平均下降 3.3 个百分点,EpiBench 跌幅最大约 15 点;且由于更新也切掉了有用的联网能力,降幅不能完全归因于堵住了作弊捷径。团队称目前未观察到明显 misaligned 行为,将继续审计轨迹。
「安全」频道最新
- OpenAI Daybreak 老用户遭强制重新 KYC,Persona 验证全数失败 — matthew_d_green · 2026-09-24
- Meta Muse 智能体引隐私担忧:与 Google 拿数据有何不同? — Klutzy-Ad5392 · 2026-09-24
- 为防超智能造病毒,我们决定让它掌管生物实验室:AI 安全圈讽刺名场面 — IanArawjo · 2026-09-24
- Instinct 回应数据泄露质疑:称系幻觉而非数据隔离失效 — mon__lim · 2026-09-24
- AP 风格指南禁用拟人化措辞描述 AI,引圈内群嘲 — voooooogel · 2026-09-24
- LLM 全天候挖洞加自动写武器化 exploit,补丁机制或难以为继 — matthew_d_green · 2026-09-24