边缘场景仍能拉开模型差距
dotey · x · 2026-07-21
作者认为,模型是否“够用”很看具体工作场景:写作上 Opus 4.6 还难替代,设计上 Opus 4.8 更强,而遇到疑难问题时 Fable 5 表现最好。
他举了一个播客转录的例子:音频时间戳总对不上,先用火山引擎云转录,问题仍然存在;再问 GPT 5.6 Sol,也只判断成 VAD 切分问题,但修完还是不行。最后 Fable 5 指出根因是 MP3 为 VBR 变码率文件,导致时间估算失败,稍作修改就解决了。此前在 speaker 识别上也遇到类似情况,Fable 5 能处理而其他模型效果一般。
结论是:普通场景差距不大,但极端/边缘场景会拉开明显差距。
「模型」频道最新
- Sam Altman 将赴华盛顿,向国会简报 OpenAI 的 GPT-6 — inductionheads · 2026-07-22
- 基准图对比 GPT-5.6 Luna、Grok 4.5 和 Gemini 3.6 Flash — iruletheworldmo · 2026-07-22
- 帖子称 Kimi 源自 Fable 蒸馏,引发模型归属争议 — cephaloform · 2026-07-22
- Gemini 3.6 Flash 已可在 Antigravity 和聊天中使用 — MartianOnJupiter · 2026-07-22
- Gary Marcus:LLM 会做数学不等于真的懂智能 — GaryMarcus · 2026-07-22
- OpenAI Codex + GPT-5.6 Sol 在验证测试中达到 99% 召回 — soumitrashukla9 · 2026-07-22