预注册五模型对照实验:267 词规格帧让 LLM 代码缺陷显著下降
Sandeep Dhuri · hf · 2026-09-30
一项预注册(pre-registered)对照研究测试了"生成前规格说明"(specification frame)对 LLM 代码质量的影响:在提示词前加入一段 267 词的固定规格框架,声明结果必须满足的条件。
实验设计
- 50 个来自金融、医疗、保险实践的真实后端任务,覆盖钱款算术、时间处理、重试安全、访问控制四类高发缺陷
- 5 家厂商的 5 个前沿模型,每个任务跑两次:裸提示 vs 规格帧前置
- 9 个确定性 AST 检查器评分,Bandit 安全扫描器独立复检;假设、反驳指标、分析代码全部预注册
结果
- 全部 5 个模型缺陷均下降(每任务平均减少 0.160.70 项,Holm 校正后符号检验全部显著)
- 两臂有差异的 100 次中,规格帧胜出 95 次;从未让任何模型在任何领域变差
- Bandit 在裸臂发现 53 个中高危问题,规格臂仅 11 个,方向在所有模型上一致
- 模型默认行为越弱的领域,规格帧收益越大——它补上了模型缺失的纪律
全部 500 份输出、提示词、检查器与预注册材料带 DOI 公开,可独立复现。
「编程与Agent」频道最新
- 开源 agent 实测:云模型做规划+本地 Qwen 写码,成本降到 1/4 — GapNew4766 · 2026-09-30
- 8 个研究 agent 用同一 30B 基模自学 144 小时,直播检验后训练能力 — my_cat_can_code · 2026-09-30
- OpenAI Nan Yu:老板 agent 指挥一群 agent 是自欺,应按活动分束管理 — victor_explore · 2026-09-30
- 开源 MCP 工具:让 Claude 直接查询 TikTok 千亿级数据 — operatorarkay · 2026-09-30
- 开发者观点:真正的 always-on 常驻智能体从未被尝试过 — jacob_posel · 2026-09-30
- Skill 脚手架模板:统一结构让 agent skill 审查更快不破 CI — blaizedsouza · 2026-09-30