13个skill装进编码助手,Spark-to-Paper端到端写论文有证有据

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai, Liangwei Zheng, Jin Jiang, Junsheng Zhang, Wenhao Wang

cs.CL

2026-08-12

Spark-to-Paper用13个skill在Claude Code里端到端写论文,引用有效率99.5%,造假检测率从单次起草的14%升到92%。

这篇在解决什么

把一个研究想法变成一篇完整论文,不只是「写文字」这一件事:要检索文献、设计并跑实验、根据实验结果决定哪些主张站得住、画出能发表的图、还要让全文几十页内容前后一致。已有的自动化研究系统(AI Scientist、Agent Laboratory 等)把这整套流程做成了独立的应用,自带一套编排服务甚至专门的数据库,能力覆盖面不小,但和研究者平时真正干活的编码环境是分开的两套东西。论文要回答的问题很直接:能不能把这整套端到端的论文生成流程,做成一组可以直接装进现有编码助手(比如 Claude Code)的可复用 skill,而不用再造一个独立的智能体平台。

方法

Spark-to-Paper 由十三个 skill 组成,每个负责一项具体的研究任务(规划、查文献、写作、审稿、画图、跑实验),它们通过一个共享的项目目录互相通信:一个 skill 把产出写进项目文件,下一个 skill 读取这些文件继续干活。系统里有两条明确的分工线:

针对长流程里容易出现的失败模式,论文特别定义了「自我反驳循环」(Self-Refutation Loop):系统反复跑实验、反复判定证据不支持最初的研究目标,却还在同一个方向上打转、不肯承认这个想法可能就是不成立。Spark-to-Paper 把这类循环的「实验-质疑-修订」轮数上限设为 7 轮,超过上限就把这次尝试记录成一份失败报告,换一个新想法重新开始,而不是硬把不成立的结论包装成一篇看起来成功的论文。图表生成也做了角色区分:反映实测数据的图直接用画图代码从数据生成矢量 PDF;方法示意图这类说明性图先用图像生成模型出一版视觉草稿,再用编码助手的能力把它重建成可编辑的 HTML,渲染出来和原图比对、迭代调整,最后导出矢量 PDF。

结果

在 8 个受控研究主题上,Spark-to-Paper 的引用有效率达到 99.5%,图表元素可编辑比例达到 96.4%,两项都高于此前发布的 AI Scientist(引用有效率 93%,图表可编辑率 0%)、AI Scientist-v2(91%,3%)、Agent Laboratory(96%,0%),这几个系统几乎都不产出可编辑的矢量图。一次专门的消融实验往手稿里注入 36 个跨十类失败模式的编造性错误,测试系统能不能发现它们:单纯一次性起草只能揪出 14%,加上确定性检查门升到 69%,再加自我审查升到 81%,完整版本(门禁+自我审查+对抗性审查)升到 92%,对抗性审查揪出的问题里有 74% 被独立评审确认是真实问题。整套系统平均每篇论文花费 1190 万 token、8.1 美元、3.2 小时,比起单次直接起草的 0.11M token、0.66 美元、16 分钟贵了不少,但单次起草的引用有效率只有 81%。案例研究里,研究者故意在提案里塞进两个错误预期(比如让不平衡的临床数据用 Accuracy 当主指标、假设去掉数据泄露后因果分解模型效果该和普通循环网络差不多),系统跑完实验后都给出了和错误预期相反的结论,并据此改写了论文的主张。

为什么重要

比起把整个研究流程做成一个新的独立智能体平台,Spark-to-Paper 证明这套能力可以直接长在已有编码助手上,不需要额外维护一套编排服务、数据库或调度器,对已经在用 Claude Code 一类工具做研究的团队来说迁移成本很低。它的证据纪律同样重要:实验设计在看到结果之前就锁死,数字格子空着直到真的跑出结果,手稿里的主张会因为新证据被削弱、移除或挪到局限章节,而不是被写作模型「圆」过去。让证据决定手稿内容,而不是让手稿内容决定怎么解读证据,是它和纯粹追求生成流畅论文的系统最大的区别。

局限与存疑

论文没有专门开一节讲局限,但从评测设计本身能看出边界:8 个受控主题规模不大,案例研究里展示的两个领域(临床筛查、电力负荷预测)都是有明确、可核验评测标准的场景,系统在没有清晰对错标准的开放式研究问题上表现如何没有验证。消融实验的造假检测用的是人为注入的 36 个探针,和真实研究里自然产生的错误在分布上可能不完全一致。此外,对比 AI Scientist 等系统时,论文用的是这些系统公开发布论文的事后审计结果,而不是在同一批题目、同一个模型后端下重新跑一遍,价格和成本之间不是严格可比的。

术语

原文与代码

社区讨论

相关论文

全部论文解读