Pachter 实测批 OpenAI 语料论文:近似算法难落地
计算生物学家 Lior Pachter 于 10 月 8 日连发多条帖子,对 OpenAI 论文语料中的近似算法论文进行实测与批评,随后引发与计算理论学者 rrwilliams(Ryan Williams)的公开讨论。
已确认
- Pachter 实测了 OpenAI 论文语料中一篇关于最短公共超串(shortest common superstring)2-近似算法的论文,发现按论文原样构建,仅 1,000 条测序读段的规模即不可行,而该问题与测序读段压缩相关。
- 另一篇编辑距离论文给出单位成本下以至少 2/3 概率成功的随机 (1+epsilon) 近似算法,Pachter 认为其不生成比对结果且单位成本约束使其对生物序列比对毫无用处。
- 他将批评与 2015 年 Backurs-Indyk 的(条件性)编辑距离下界相联系,并重提自己当年博客文章《In biology n does not tend to infinity》的观点:生物学场景中问题规模不会趋于无穷。
- Pachter 总体态度是:即便这些近似算法结果是理论里程碑,现实意义有限,并引用 Hardy「仅有美学价值」的说法表达立场。
- rrwilliams 回应称存在一个权衡:在通用计算模型中试图求解所有可能实例,意味着结果未必适用于大量实际应用;他还提出是否存在更好的步数计数方式的疑问。
为什么重要
- 这一讨论触及理论计算机科学与实际生物信息学应用之间的鸿沟:复杂度界与近似保证在具体工程和生物学规模下可能完全失效。
- OpenAI 论文语料被用作 AI 研究素材,其收录论文的实际可用性受到领域专家质疑,对评估该语料质量有参考意义。
2026-10-08 ~ 2026-10-08 · 5 条相关
一手来源
- 研究者实测 OpenAI 论文:最短公共超串 2-近似算法在测序规模下不可行 — lpachter ·
- Pachter 批 OpenAI 语料论文:单位成本随机近似算法对序列比对毫无用处 — lpachter ·
- 学者争论计算理论突破:通用模型求解与实用性的权衡 — rrwilliams ·
- 【源头】研究者实测 OpenAI 论文:最短公共超串 2-近似算法在测序规模下不可行 — lpachter · 2026-10-08
- 【源头】Pachter 批 OpenAI 语料论文:单位成本随机近似算法对序列比对毫无用处 — lpachter · 2026-10-08
- 学者泼冷水:近似算法理论突破难落地,实际价值存疑 — lpachter · 2026-10-08
- Lior Pachter 借 OpenAI 论文重提 2015 编辑距离下界:生物学里 n 不会趋于无穷 — lpachter · 2026-10-08
- 【源头】学者争论计算理论突破:通用模型求解与实用性的权衡 — rrwilliams · 2026-10-08