研究者实测 Opus:工期估算来自训练数据里人类样本,几无自省
StefanoGogioso · x · 2026-10-01
Stefano Gogioso 回应「Claude 的 2-3 天估时」话题,对 Opus 5.5 做了初步探查。
他发现这类时间数字很可能是从训练数据中的人类样本推断/幻觉出来的,模型几乎没有尝试自我反思——除非上下文已收窄到 agent 人设时才会有限度地反思。
他判断第三种假设(训练数据中的统计模仿)最可能成立。
「模型」频道最新
- Gemini 4 Argon 全面超越 Astra 与 Opus 5.5,Google 杀回赛场 — Yuchenj_UW · 2026-10-01
- 新模型长程编码 FrontierSWE v2 达 55%,远超 Gemini 3.x 的 20% — xennygrimmato_ · 2026-10-01
- Gemini 4 Argon 高推理模式完整基准结果出炉 — ArtificialAnlys · 2026-10-01
- Gemini 4 Argon 登顶 AutomationBench,领先 Claude Sonnet 5.5 六个百分点 — ArtificialAnlys · 2026-10-01
- GPT-6.1 Sol 缓存输入 $0.10/M:长任务 Agent 账单真正由它决定 — victor_explore · 2026-10-01
- Gemini 4 Argon 定价激进:比 Opus 便宜一半,比 GPT-6 便宜五倍 — haider1 · 2026-10-01