Anthropic 称 AI R&D 评测已饱和、失去信息量
dfrsrchtwts · x · 2026-09-23
转发者指出,报告中有单独一节认为 AI R&D 类评测已经饱和、不再有信息量,并表示自己倾向于认同这一判断。这反映前沿实验室对内部能力评测体系有效性的反思。
所属事件:研究者称 AI R&D 评测已饱和失去区分度(3 条相关)→
「模型」频道最新
- DiffusionGemma 成 DGX Spark 上的黑马:单机跑「快速 agent」任务 — bodonoghue85 · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 双模型上线,OpenAI 官宣在即 — rickasaurus · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 正式发布,双模型同日上线 — soumitrashukla9 · 2026-09-23
- GPT-6 Luna 推理档位曝光:从轻量思考一路到 max 档 — seanwbren · 2026-09-23
- GPT-6 Sol 与 Luna 定价公布,网友称或挤压大量闭源模型 — indian_truely · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 现身 Codex 模型选择器,官宣在即 — daniel_mac8 · 2026-09-23