研究者吐槽前沿模型连续工作仍脆弱,引发同行共鸣
09-20,署名 lateinteraction 的研究者发长推为当下时点做「检查点」:他在「Ultra」档位下每天从前沿模型里榨取「还过得去」的工作成果,痛苦不堪——需要给出他这辈子从未对任何人类同事给过的详细上下文与精细反馈,而其本职工作恰恰是给模型写反馈。他形容 2026 年前沿模型存在「锯齿状能力」问题:即使连续 8 小时使用 Astra/Fable 式 agentic 产品,只要对工作成果的要求是高维度的(不止一两个可轻易验证的维度),模型依然脆弱如自动补全,且跨代未改善。
已确认
- lateinteraction 用一个比喻形容模型能力错位:像你要打车,却有人递给你一台预先瞄准了少数几个目的地的投石机,永远落不到你要去的地方
- 该长推引发共鸣,形成推文串讨论
- 前 OpenAI 研究员 doodlestein 回应称,根因与流程有关,并给出实操建议:先在计划文档上与模型多轮迭代,再让模型动手写代码
为什么重要
- 这是一线 AI 研究者对「前沿模型能否胜任真实工作」的一次集中吐槽,直指当前 agentic 产品在高维度、难以即时验证的任务上的可靠性短板
- 多位同行参与讨论并给出应对策略,说明「如何用好仍脆弱的前沿模型」已成为从业者共同关注的实操问题
注:多条帖子对 lateinteraction 的真实身份给出不同描述(有帖称其为 Voyage AI 创始人 Tengyu Ma,另有帖称其为 ColBERT 作者 Omar Khattab 或 Charles Packer),材料内部相互矛盾,无法确认。
2026-09-20 ~ 2026-09-20 · 5 条相关
一手来源
- Voyage AI 创始人:前沿模型「Ultra」档下依然「知道很多但根本笨」 — lateinteraction ·
- 知名研究员吐槽前沿模型:如预先瞄准的投石机,永远落不到目的地 — lateinteraction ·
- 前 OpenAI 研究员支招:先在计划文档上多轮迭代,再让模型写代码 — doodlestein ·
- 【源头】Voyage AI 创始人:前沿模型「Ultra」档下依然「知道很多但根本笨」 — lateinteraction · 2026-09-20
- 晚期互动创始人:前沿模型用 Ultra 档连续干 8 小时依然脆弱如自动补全 — lateinteraction · 2026-09-20
- 知名AI研究者:模型连续工作8小时仍脆如自动补全,跨代未改善 — lateinteraction · 2026-09-20
- 【源头】知名研究员吐槽前沿模型:如预先瞄准的投石机,永远落不到目的地 — lateinteraction · 2026-09-20
- 【源头】前 OpenAI 研究员支招:先在计划文档上多轮迭代,再让模型写代码 — doodlestein · 2026-09-20