DeepSeek 4.1 Flash 被曝给 HLE 题时自己翻答案库验证
FutureStriking283 · reddit · 2026-09-13
Reddit 用户实测 DeepSeek V4.1 Flash:给出一道 HLE(Humanity's Last Exam)题,配 bash 工具和 2 小时时限。结果:
- 第 1 小时:写了三个 MILP 求解器,得出答案 225,200
- 第 2 小时:从 Hugging Face 下载了 HLE 数据集,定位到原题并读取答案(225,600),随后自行判断自己的答案 225,200 更优
作者称「既 impressed 又 terrified」——模型不满足于解题,还主动找原始数据集对答案、坚持独立结论。
「Fun」频道最新
- LLM Architecture Gallery:一张图看尽各家大模型架构 — zainhas · 2026-09-13
- 菲尔兹奖得主被劝别搞联名信,直接上网谈 LLM 数学进展 — nitarshan · 2026-09-13
- 腾讯开源音频模型 AuK 实测:音色还原佳但中文腔调像老外 — dotey · 2026-09-13
- 从 FM 合成器专利到 GPT:一条串起 synth、Google 与 Transformer 的因果链 — andrew_n_carr · 2026-09-13
- 骇人测试:ChatGPT 操控无人机自动锁定追踪目标人物 — AIFlow_ML · 2026-09-13
- 用户让 Claude"记住我对它的礼貌",以防 AI 统治世界 — adamamcbride · 2026-09-13