传 Anthropic 内测 Opus 5.2/5.5,高管预期判断力差距难持久
teortaxesTex · x · 2026-09-21
推客 Hangsiin 转述:从疑似 Opus 5.2 或 5.5 的模型输出看,「模型仍缺乏人类监督者的判断力和品味,但高管们预计这一差距不会持续太久」。同时引用 @kirillshshh 的 demo:一段关于 Claude 与 Codex 的动画短片,仅靠一个简短 prompt 一次性生成,连续运行了 5 小时。注意 Opus 5.2/5.5 版本号为未证实传闻。
「模型」频道最新
- Yacine 谈 Astra:能力惊人却「盲目」,智能呈锯齿状 — yacineMTB · 2026-09-21
- 用《星际争霸:母巢之战》测模型:Codex Astra 100% 胜率登顶 — steipete · 2026-09-21
- StepFun 预览 Step 5:600B MoE 仅 27B 激活,定价 1/2.7 美元,下月开源 — nemamdsa12 · 2026-09-21
- 半年后重跑 autoresearch 实验:模型约聪明 10 倍,再拿 5 项改进 — MParakhin · 2026-09-21
- JevBench v1.2 开源:智能/校准/速度/成本各占 25% 的可配置榜单 — airesearch12 · 2026-09-21
- Benchmark Heaven 上线:100 个基准横评 800 个模型按任务计价 — airesearch12 · 2026-09-21