论文写作 Agent 爆 token 又编数据,作者复盘四项关键修复
Altruistic-Video-849 · reddit · 2026-09-20
背景
作者搭建了七步 LangGraph 工作流,撰写带引用的研究论文,并接入 Groq、OpenAlex 与 Crossref 实测。假数据测试全过,真实运行却暴露四类问题:
- Token 超限:一篇论文 prompt 打到 8,779 tokens,超过每分钟 8,000 上限。修复:来源上限设 15、裁剪摘要、critic 只看正文与其引用的来源。
- "已验证"来源掺假:42 个"验证过"的来源里混入一篇无关的边缘计算论文。修复:先按相关性排序,再按序验证。
- 字数失控:初稿 2,086 词,超出 1,500 上限,因为把 369 词的参考文献也算进去了。
- 无出处数字:critic 抓到一个任何来源都不支持的"减少 12% 燃耗"。修复:写作者不得陈述摘要中没有的数字。
剩余短板与开放问题
引用已在代码层对照 Crossref 校验,主题与论题由人审批后才起草。但作者坦承未测量:论文质量本身,以及每个句子是否忠实于来源——目前只靠一个 LLM 审稿人判断,这不算证据。他正在考虑句级蕴含检查,并向社区征集:如何不用"再问一个 LLM"来验证论断与引用来源的一致性?
「编程与Agent」频道最新
- 开发者用 Claude Skill 一键把图片里的建筑拆解成可调 Three.js 模型 — jasonkneen · 2026-09-20
- Cursor Pro 信用点消耗过快遭用户吐槽,月付 25 美元寻找替代品 — ReporterUnusual9295 · 2026-09-20
- Fuzzing 与 property-based testing 正在分化:一个管探索,一个管断言 — blaizedsouza · 2026-09-20
- 「软件工厂」观:LLM 只该负责生成,规约与验证不能交给它 — blaizedsouza · 2026-09-20
- 单条成本不到 1 美分:Jev 做 NSFW 提示词过滤的实测与阈值坑 — Murky_Ad8671 · 2026-09-20
- 启发式无法认证启发式:软件工厂的编排思路可能全错了 — blaizedsouza · 2026-09-20