DeepMind模型被指体验远逊官方评测,专家呼吁公开原始思维链
billyuchenlin · x · 2026-08-02
针对 DeepMind 模型的表现,多位 AI 领域开发者展开了讨论。他们指出,官方报告中的模型表现与实际使用体验存在巨大鸿沟,仿佛是“不同的物种”。
讨论认为,这种差距可能源于模型本身的能力,也可能得益于专家用户的提示词技巧和充足的算力预算。此外,开发者也希望未来能进一步公开模型的原始思维链(raw thinking traces),甚至实现完全的可复现性,以验证其真实水平。
「模型」频道最新
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24
- 隐身模型 Ox Alpha 登场 Context Arena,匹配 GPT-5.6 — scaling01 · 2026-08-24
- Fable 5 仅占 6% 销量,Anthropic 遭遇降本冲击 — rohanpaul_ai · 2026-08-24
- Opus 5 说话像法庭剧?如何调教掉废话 — thk_ · 2026-08-24
- 2026 年中国模型全景:DeepSeek V4、Kimi K3 等在列 — TheTuringPost · 2026-08-24
- 传闻 Claude Opus 6 泄露:上下文 250 万,推理更强 — iamaliveix · 2026-08-24