AI 研究者实测:前沿模型够格当主力,但离「超人」还很远
lateinteraction · x · 2026-09-13
AI 研究者 lateinteraction(来自 Distill/Jina 的知名 AI 从业者)吐槽了自己与前沿模型的日常:一天中有 N 小时在和模型协作中「沮丧又不解地 babysit 它们,忍受频繁的错误与 slop」,只有 M 分钟间隙才看到 X 上大家吹「这些模型(尤其下一代)在几乎所有事上超人」。
他的结论很克制:按过去的 AI 标准这些模型已经极其优秀,足以作为大多数日常工作的主力工具;但在他真正关心的任何「连贯的宽泛技能」上,模型并不超人。这条观察对冲了社交媒体上「下一代即超人类」的叙事,来自重度一线使用者的真实体感。
所属事件:从业者吐槽前沿模型:可当主力但远非超人类(4 条相关)→
「模型」频道最新
- GPT-6 Astra 视觉能力登顶,实测力压 Gemini 3.8 Flash — Roger_M_Taylor · 2026-09-13
- Devin SWE-2 首日实测:速度快、价格友好,续航不及 Codex — CtrlAltDwayne · 2026-09-13
- 实测对比:Gemini 集成测试挂,Grok/Kimi 易漏需求 — zainhas · 2026-09-13
- 约11美元/百万token:去中心化训练新模型推理优化曝光 — bittingthembits · 2026-09-13
- 开发者玩转字符级模型:免 retokenization bug、随意字符串处理 — cephaloform · 2026-09-13
- SemiAnalysis 深挖位置编码:放宽数学约束后的更广嵌入空间 — burny_tech · 2026-09-13