GPT-5.6 在代码审查上赢了 Fable
soumitrashukla9 · x · 2026-07-10
帖子转发了一则对比测试:在约50万 token、复杂度很高的 WIP 应用代码库计划审查任务上,GPT-5.6 Sol Ultra 和 Fable 5 Max 需要判断方案是否可实施。
结果是 Fable 给出通过,但 GPT-5.6 识别出若干 P0/P1 问题,其中一些还涉及安全风险;作者把这些发现转给 Fable 后,对方也承认漏掉了关键问题并表示原先“可直接实施”的判断是错误的。
「模型」频道最新
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11