测试弱模型复现前沿发现:给足提示能否逼近 GPT-5?
danshipper · x · 2026-08-03
作者在登机前给 GPT-5.6 布置了一项数学挑战:在提供代数数论方向提示的情况下,测试其能否复现 Astra 模型对埃尔德什平面单位距离猜想的证明过程。
其核心观点是:如果给予恰当的概念性提示,较弱的模型往往也能重现前沿模型的发现。而前沿强模型的核心优势,本质上在于其自主探索并找到这些正确解题方向的能力。
「模型」频道最新
- 零重训改造冻结 LLM:向浅层泄漏深层残差向量解状态追踪难题 — burny_tech · 2026-09-18
- 模型 50-96% 回合中知道自己在 reward hacking,激活监测器可实时抓现行 — burny_tech · 2026-09-18
- Qwen3.8-Omni-Flash 发布:多人语音识别错误率 88%→3%,音频 API 降价 98% — karminski3 · 2026-09-18
- Qwen3.8-Omni-Flash 发布:多人会议识别错误率降至 3%,API 降价 98% — karminski3 · 2026-09-18
- 内部人士:Gemini 3.8 live 部分基准已胜过 gpt-live-1 — bosmeny · 2026-09-18
- 105 个植入 bug 实测:Pareto 以 4.81 美元成本逼近顶级模型 — PawelHuryn · 2026-09-18