晚期互动创始人:前沿模型用 Ultra 档连续干 8 小时依然脆弱如自动补全
lateinteraction · x · 2026-09-20
Voyage AI/晚期互动创始人 Charles Packer(lateinteraction)长文吐槽从前沿模型中提取「OK 级别」工作的痛苦:他给出的详细上下文和精细反馈之多,「超过我一生中给任何人类的反馈」——而他的本职工作就是给反馈。他的判断是:如果你对模型产出有高维度、细粒度的要求,很快就会对哪怕 Astra 或 Fable 连续 8 小时工作有多脆弱、多像自动补全而抓狂。他提醒不要被少量「单模态、可验证」的成功案例分心——他预测这类案例会越来越多,但这几乎不能说明高维任务中似乎(至今)固有的脆弱性与崩塌问题。
所属事件:研究者吐槽前沿模型连续工作仍脆弱,引发同行共鸣(5 条相关)→
「编程与Agent」频道最新
- LangChain 推出 Jev 评测器:打分方差低 92-913 倍,成本仅 0.34 美元 — LangChain · 2026-09-20
- 自然语言逻辑解释器开源:Jev 负责统一,Claude 做前置转换 — narphorium · 2026-09-20
- 开发者将 Jev 接入 Codex 加速浏览器操作,数百次试验仅花 $0.007 — TheZachMueller · 2026-09-20
- CUA Agent 数据集要连任务一起伪标注,因为网站常变任务会过期 — mervenoyann · 2026-09-20
- Pi 编码工具发布 0.86.0:支持会话中系统消息与动态工具 — mitsuhiko · 2026-09-20
- 开发者把今年做的抖动着色器全搬进 Leafalia,跑通了 — eschadiol · 2026-09-20