长上下文测试质疑GPT-5.6退步
Pale-Entertainer-386 · reddit · 2026-07-13
作者用一个长上下文测试来质疑当前 LLM 评测过度依赖 IQ 式短题,认为这类 benchmark 容易掩盖真实使用中的理解与信息整合能力。
他的方法是:给模型一段高信息密度、结构复杂的长文档(示例为一篇 76 页论文),要求模型从全文中提取关键发现、定位来源并区分事实与推断,而不是只做摘要。作者声称,这种测试暴露出 GPT-5.6 相比 GPT-5.5 的回归。
文章还在尝试把这种方法整理成一个可复用的“长上下文研究能力评测”原型,但作者也明确说,目前只在单篇论文和少量模型上验证过,跨论文、跨模型的稳定性还需要进一步测试。
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11