模型评测公司任务里,Fable 找到定位问题而 Sol 只会堆文档
jdjohnson · x · 2026-07-27
作者说,他常用的测试方式是让模型评估自己的公司,并提出三个能立刻改善现状的动作。
- Fable 是第一个真正找出一些问题的模型,主要集中在定位上。
- Sol 则被他认为几乎没用:它只会生成或建议更多没人需要的文档,充满“做样子”的味道;被追问时,它还经常承认那样做其实不会带来任何实际效果。
这条帖子的重点,是对不同模型在真实商业诊断任务上的表现做了一个快速对比。
「模型」频道最新
- Meta 据传将推出 harness 和新开源模型 — garrytan · 2026-07-27
- llama.cpp 合入 GLM-5.2-Vision 本地多模态支持 — QuixiAI · 2026-07-27
- 马斯克称 Grok 4.5 是靠谱干活机,接着转赞 Tim Sweeney — elonmusk · 2026-07-27
- 开放模型一年内占 token 比例从 10% 升至 30% — togethercompute · 2026-07-27
- Hyperagent 真实浏览器任务对比 Opus 5 和 GPT-5.6 Sol — PrajwalTomar_ · 2026-07-27
- Mollick 说 Opus 5 和 Codex 语音模式迫使他当天改指南 — emollick · 2026-07-27