Lanyon 基准称前沿模型解 Euler 方程频繁失手
CatAstro_Piyush · x · 2026-08-04
Frontier 模型解 Euler 方程仍频繁翻车
Lanyon 的第二篇基准测试称,GPT-5.6 Sol、Fable 5、Kimi K3 等前沿模型在 Euler 方程求解上会反复出现错误,包括:
- 数值振荡
- 热力学不一致
- 误差阶数错误
- 甚至代码根本跑不通
帖子还指出,数学形式化错误很常见,单次尝试的 token 成本可以高达几十美元。相较之下,Lanyon 声称自家的神经符号架构能稳定生成带端到端正确性证明的求解器,而且成本低 100 倍以上。
所属事件:基准测试称前沿模型求解偏微分方程频出错(2 条相关)→
「模型」频道最新
- 前沿模型编码更强了,但写作质量似乎退步 — HamelHusain · 2026-08-04
- 多款 LLM 识别同一飞机和航空公司都翻车 — airbus_a360_when · 2026-08-04
- Qwen3.8-Max 设计测试追平 GPT-5.6,价格仅四分之一 — alejandroll10 · 2026-08-04
- Anthropic 的 Fable 5 被指近期明显退化 — _ghostchant · 2026-08-04
- 免费多模型路由把我的试错成本变成评测预算 — GabriellaAmaya · 2026-08-04
- H3 最大的问题是太慢,生成延迟卡住了实验探索 — cocktailpeanut · 2026-08-04