Anthropic 威胁报告被质疑:涉案多为中低端模型,归因难证实
AryHHAry · x · 2026-09-11
围绕 Anthropic 安全威胁报告的归因问题,网友 @pwguler 指出一个关键细节:报告涉事运行大多发生在 Haiku、Sonnet 和 Opus 上,前沿级别模型几乎没出现;且 Anthropic 自己承认在多起生物安全案例中无法证明行为意图。@AryHHAry 总结:厂商自制的威胁报告只是一种信号,不是法庭证据。
「安全」频道最新
- Reddit 热议:欺骗行为只在训练中被奖励时才会出现 — StrategicHarmony · 2026-09-11
- OpenTrustBench:全本地 MCP 服务器安全扫描器开源发布 — BrilliantSecret143 · 2026-09-11
- DHH 炮轰 GDPR:数十亿欧元合规成本换不来对等回报 — SumitGup · 2026-09-11
- AI 安全争论:早期「狼来了」预警其实是有效的渐进准备 — gandamu_ml · 2026-09-11
- 推友玩梗即入 Anthropic 安全报告,被指疑似制造超级病毒 — basedjensen · 2026-09-11
- EA 与 Progress 派开对话:Asterisk 主编用航空安全类比谈 AI 安全 — clarejtbirch · 2026-09-11