代码算数模型说话:独立开发者根治本地小模型编造账目
Revibed69 · reddit · 2026-10-06
开发者在做 Windows 本地记账应用 Burrow 时遇到经典难题:7B 级小模型算术极差,给 40 笔交易问餐饮花了多少,会自信地给出流畅但完全错误的答案——在金融应用里不可接受。
他的解法是一条硬规则:「代码负责计算,模型只负责总结」:
- 只喂聚合结果:所有数字先经 SQL/JavaScript 算好,模型只看到 diningthismonth: 312.40 这类预计算上下文,绝不接触原始交易列表
- 提示词反向约束:prompt 明确要求使用给定数字、禁止自行计算,模型只负责把数据转成自然语言并指出重点
- CI 强制执行:写脚本扫描所有 system prompt,出现 calculate/compute/add up 等词直接构建失败
结果是响应在小笔记本上依然飞快,且数字完全可信。他也在征求社区意见:让模型自己调工具算数,还是像他一样彻底收走算数权?
「编程与Agent」频道最新
- AI 形式化验证的残酷现实:停机问题挡住了「现有代码库」 — danbri · 2026-10-06
- 开发者用 Grok Bot + Claude Code 跑通 SEO/AEO 增长闭环 — doooyle · 2026-10-06
- 实测 Grok 语音 Agent:读 Notion、发邮件、转账全自动 — FinanceYF5 · 2026-10-06
- Grok Bot 实验预告:下周全靠语音 Agent 处理日常待办 — FinanceYF5 · 2026-10-06
- 语音指挥 Grok Bot 全自动干活:管日程、回 Slack 还能转账 — FinanceYF5 · 2026-10-06
- 给 GPT-6 Astra 加持久记忆:修复方案跨会话复用实测 — Med1_Ai · 2026-10-06