Ouroboros 给 LLM 加程序执行轨迹,小模型调试正确率最高提升 34 个点
The_Homeless_God · reddit · 2026-09-11
开发者发布开源工具 Ouroboros:一个面向 LLM 和程序员的 debugger-tracer,自动记录程序每一步的实际行为——每次函数调用、参数和返回值,支持 8 种语言,解决 LLM 写代码时的幻觉问题。
工作原理:工具解析代码找到函数边界,注入记录代码,在隔离副本中运行程序(不污染工作区),再把带执行轨迹的调试结果交回给 LLM。安装支持 uv/brew,可让 Claude Code、Codex 等 agent 自建 skill 持续使用,也提供 MCP 服务。
实测效果(600 题/组)显著:
- qwen3.5:4b 正确率 44.0% → 78.3%(+34.3)
- qwen2.5:14b 61.0% → 84.7%(+23.7)
- qwen3:32b 66.7% → 90.3%(+23.6)
- Claude Opus 5 子 agent 95.0% → 98.3%(+3.3)
结论:执行轨迹对能力较弱的小模型帮助最大,强模型增益有限但仍有提升。工具、文档和数据集均已开源。
「编程与Agent」频道最新
- 时间线在吹 Astra,回看自己的 agent 连复现一篇论文都难 — DominiqueCAPaul · 2026-09-11
- Bend 不在训练集里,AI 却一晚上写出 3D 引擎跑到 120 FPS — rickasaurus · 2026-09-11
- Vesence 发布浏览器内 Agent 原生桌面,整项目可委托执行 — garrytan · 2026-09-11
- 让 GPT-6 花 2 小时做爆款网站,产出先画马再赛马的游戏 — yungcontent · 2026-09-11
- PARSER 拆解长文阅读:子代理并行分块,主代理散射聚合推理 — omarsar0 · 2026-09-11
- Agent 每轮塞 40 个工具 schema 浪费 token,动态路由的取舍怎么破 — Abject_Housing7279 · 2026-09-11