研究者吐槽 Claude:首次未达成的目标,多轮也难补救
DimitrisPapail · x · 2026-09-17
研究者 Dimitris Papailiopoulos 表达了对 Claude 的主要不满:当模型第一次尝试没能达成某个目标时,它后续处理和纠正这个未完成目标的能力很差。这也是很多用户的共同体验——一次不成,接着追问往往也难以收敛到正确结果。
「模型」频道最新
- 实测 Jev 对比 Luna:140 项标注对 139 比 138,快 4.6 倍且便宜 83% — TheMoonMidas · 2026-09-17
- Jev 闪电棋拖垮 Fable 靠时间策略,却被 GPT-6 Astra 18 步将死 — TheMoonMidas · 2026-09-17
- 200毫秒决策的浏览器 Agent 亮相:靠 Jev 模型读页面控件做 Computer Use — TheMoonMidas · 2026-09-17
- Jev 以每秒 16.5 份速度分类 1.1 万法律文书,共 49.5 万次文档问答 — TheMoonMidas · 2026-09-17
- 1024 个模拟人格集体应对场景,开发者用 Jev 搭出虚拟人群仿真 — TheMoonMidas · 2026-09-17
- 改 prompt 就能改变 AI 打法:Jev 玩俄罗斯方块快到自己推方块 — TheMoonMidas · 2026-09-17