Blender 同题实测:两旗舰模型输出差距悬殊,训练数据分布是主因
ZeroStateReflex · x · 2026-09-09
- 在 Blender 内用同一 prompt 各生成 12 秒内容:Claude Fable 5.1 输出明显逊于 GPT-6 Astra,差距之大出乎意料。
- 作者(在 Blender 内构建 AI 工具的开发者)猜测原因并非模型能力弱,而是 Anthropic 的训练语料中 Blender 相关数据太少,Blender 尚不在其分布内。
- 类比 Karpathy 提过的现象:早期模型下国际象棋很差,把棋类数据加入下一轮训练后大幅提升;作者认为 Blender 也会如此。
- 结论:比起通用 benchmark 分数,在真实软件内的实测更能暴露模型在特定工具中的能力缺口。注意:所涉模型未经官方证实。
所属事件:Blender 同题实测:两旗舰模型输出差距悬殊(2 条相关)→
「Fun」频道最新
- ChatGPT 当室内设计师实机演示引围观 — zeeg · 2026-09-09
- AI 圈再现「李世石时刻」:模型走出 AlphaGo 式名场面 — polynoamial · 2026-09-09
- 「我还得养兔子呢」:开发者吐槽订阅账单的梗图 — tlakomy · 2026-09-09
- Gary Marcus 晒 GPT-6 Astra 生成视频,嘲讽 OpenAI「人类级智能」说法 — GaryMarcus · 2026-09-09
- 「1000 家攻关纳维-斯托克斯的初创公司集体哀嚎」:AI 圈玩梗 — GabGarrett · 2026-09-09
- LlamaIndex 员工变身可颂「经销商」,带 3000 美元额度上门送甜点 — llama_index · 2026-09-09