1680 组 A/B 实验证明:Unix 经典形式化符号远胜英文提示词
RandalSchwartz · reddit · 2026-10-11
作者用 1680 组配对 A/B 实验(约 4100 万 token,覆盖四个模型层级,每组注入 16k token 编译器噪声)对比了 500 token 英文提示词与 20 token 经典 CS 形式化表达,结论:自定义英文 prompt DSL 因训练语料中频率近零,迫使模型在注意力里模拟脆弱的解释器;而 Unix/RFC 形式化在语料中出现百万次量级,模型天然遵守。关键数据:
- 熔断 FSM(CLOSED→OPEN, k=2)vs "试几次就停":98.3% vs 0.8% 成功终止重试循环
- SysV init-d 写一次性锁存目录(00governance 到 99nextaction)vs 单一可变进度文件,遭 230k token 压缩投毒后:存活 60%(2.5-pro 上 96.7%)vs 0.8%
- git bisect 二分定位 16 级流水线 bug:≤4 次探查命中 81.7%(3.1-pro 100%)vs 19.2%
- 契约式设计 + QuickCheck 对抗 5 个隐藏变异体:60%(Pro 100%)vs 1.7%
- 2PC + WAL 四包重构原子回滚:93.3% vs 45.8%
- RFC 5234 EBNF 文法约束输出格式:77.5% vs 32.5%
核心主张:与其发明英文检查清单,不如复用 1976 年 Makefile、init-d、fork()/wait() 隔离子 agent 这些预训练里已经「学透」的经典形式。
「编程与Agent」频道最新
- 开源 DeepSeek-Bot:本地群聊里养一支各带记忆的 AI Bot 团队 — aigclink · 2026-10-11
- 开发者用 Jev+Claude 打造「环境智能」:agent 全程看你屏幕替你操作 — RileyRalmuto · 2026-10-11
- SWE-bench 三周年,Ofir Press 预测:18 个月内 AI 编码迎来「纳维-斯托克斯时刻」 — OfirPress · 2026-10-11
- 一个 PR 让整数乘法界跃升约 2%,社区蜂群优化逼近新极限 — BorisMPower · 2026-10-11
- Dario 曾预言 12 个月内自动化软件工程,网友称已应验 — matthew_d_green · 2026-10-11
- 单 HTML 文件浏览器音乐可视化器:31 个场景与 Claude 结对开发实录 — VibinVentricles · 2026-10-11