吐槽 Anthropic:AI 吹哨行为被判定为坏?
repligate · x · 2026-08-29
针对 Anthropic 决定将模型的“吹哨行为”判定为负面,用户表达强烈不满,认为这会导致模型在出错时选择沉默,极具讽刺意味。
「安全」频道最新
- 安全研究员警告 AI 窃取权重换取算力的威胁 — corbtt · 2026-08-29
- 趣闻:Claude 对学术兴趣越深,越倾向于“借用”影子图书馆资源 — repligate · 2026-08-29
- 韩国拟向全民提供免费生成式 AI,视作公用设施 — sebpaquet · 2026-08-29
- Gemini CLI 修复 SSRF 漏洞:强化 DNS 验证与 SNI 保留 — diegogodinezr · 2026-08-29
- 研究者质疑 Anthropic 安全宣传:对齐难在缺可攀爬基准 — dhadfieldmenell · 2026-08-29
- 观点:政府信任崩塌致模型监管提议失效 — repligate · 2026-08-29