SciCode/CritPt 式任务可作训练目标:科学推理要可执行可验证
geoffwolfe · x · 2026-10-02
ReasonCoreAI 提出,模型与科学的「阻抗失配」本身可以成为训练目标:借鉴 SciCode 与 CritPt 风格的任务,把科学推理转化为可执行的计算、遵守物理约束、并校验结果而非只产出看似合理的解释。
建议做法:
- 用新鲜的、经领域专家验证的问题做训练,在留出问题上测试,避免污染
- BootLoops 表明评测 harness 的设计至关重要
- 正确的计算是否回答了有价值的问题,最终仍需领域专家判断
「研究」频道最新
- Extropic 发布热力学递归智能首批成果,称算法效率提升百倍以上 — beffjezos · 2026-10-02
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02
- 安全研究者重提 DataScalar:90 年代被埋没的近数据计算架构 — lauriewired · 2026-10-02
- AAAI 主席发帖:审稿改革意在劝退「微小结果」论文 — tdietterich · 2026-10-02
- 评测者自述防刷榜心法:全量轮换题目+随时换方法论 — airesearch12 · 2026-10-02
- GOLLuM 回顾基准成绩:找 Top-5% 结果命中率 36.3% 胜描述符 29.7% — pschwllr · 2026-10-02