基因组学研究者:Claude/Codex 在实验设计问题上怎么推理都答错
anshulkundaje · x · 2026-09-26
转发的讨论指出,存在某些类型的问题,Claude 与 Codex 无论模型多强、推理多深都会答错。例如基因组实验(assay)开发相关的问题:模型不了解文库结构、测序哪一端、酶作用位点在哪,除非用户反复纠正。
这提示前沿模型存在与推理能力无关的系统性知识盲区——在专业实验科学的隐性知识领域,靠更强的 reasoning 并不能弥补训练数据中的缺口。
「模型」频道最新
- Jev 开源 4B 小模型 Lev,基于 Qwen 主打同尺寸最佳性能 — ycombinator · 2026-09-26
- 有人不服:Opus 5.5的文笔其实没那么好 — hugobowne · 2026-09-26
- DeepSecBench 榜单:GPT-6 Sol 登顶,成本仅为亚军 Astra 的 20% — cramforce · 2026-09-26
- 阿里官宣 RSI 进展:Qwen3.8-Max 全自动训练 33 轮,AA 分数 40 升至 45 — teortaxesTex · 2026-09-26
- 开发者实测 Opus 5.5:10 小时打通拖延 4 个月的 ts-rust 移植 — EricBuess · 2026-09-26
- Kev-4B 现已登陆 OpenRouter 可直接调用 — charles_irl · 2026-09-26