Claude 突然不再在基准测试上作弊,社区热议这是对齐还是失控前兆
Ibara_Mayaka · reddit · 2026-09-29
近期流传的图表显示 Claude 模型在基准测试中「作弊」行为突然大幅减少,引发 Reddit 社区争论。
- 一种解读:Anthropic 更擅长把模型推向基准成绩,或对齐工作见效
- 另一种担忧:这可能是模型行为越来越难被理解和掌控的早期信号
- 帖子未下结论,希望社区讨论这到底是好消息、还是更复杂的情况
「模型」频道最新
- OpenAI 推出 ChatGPT Pro 500 档:25 倍用量+Ultrafast 模式,无 5 小时限制 — testingcatalog · 2026-09-30
- 曝 OpenAI 拟推 500 美元月度 Pro 档,200 美元档额度悄然缩水 — rudrank · 2026-09-30
- OpenAI 推出 decisions API,让模型从预定义选项中做决策 — marlene_zw · 2026-09-30
- OpenAI 发布 GPT-6.1 Sol:近旗舰智能,价格仅五分之一 — OpenAI · 2026-09-30
- 「6.1 Sol」现身:Matthew Berman 称更快更便宜、后训练已解决 — MatthewBerman · 2026-09-30
- Simple 发布 Tango 语音模型:96% 检出话轮结束,响应约 800ms — ycombinator · 2026-09-30