OpenAI「数学突破」遭质疑:真功夫在提示工程而非模型
gerardsans · x · 2026-08-21
gerardsans 对 OpenAI 最新宣传的 LLM「数学突破」提出质疑:99% 的魔法其实来自提示工程——通过精心锁定搜索空间,把正确的解题路径预先烘焙进上下文,人类在前期完成了真正的智力工作。
他指出 OpenAI 可能在单个特定 prompt 上迭代了数月,但不会公开这一点;拿原始 ChatGPT 让你自己解,大概率到不了同样的结果。此外候选解仍需人工逐一校验,所谓突破并非模型独立解决数学问题。
「模型」频道最新
- Gemini 被指阿谀奉承:对灵气疗法给出对立答案 — dhadfieldmenell · 2026-08-21
- Ornith-1.5-9B GGUF 版上架,登 Hugging Face 热榜 — ornith-ai · 2026-08-21
- Qwen3-Next-80B Thinking 过度冗长,工具调用表现不佳 — rebellioninmypants · 2026-08-21
- 微调后 Cactus Needle 2 超越 DeepSeek v4 特定任务 — Henrie_the_dreamer · 2026-08-21
- 开发者对比安全护栏:OpenAI 刚加暂停,Google 却另有做法 — BlackHC · 2026-08-21
- 科学基准月均进步仅 1-2%,SciCode 饱和遥遥无期 — Worldly_Beginning647 · 2026-08-21