LLM 工程缺乏规范:从直觉试错到严格评估
camerongreen95 · reddit · 2026-09-01
目前大多数 LLM 功能的发布缺乏传统软件工程的纪律:Prompt 随意微调,仅凭肉眼检查,无版本控制、回归测试或真实评估。这导致后期问题难以追溯,成本失控。9 月 12 日将举办一场大师课,由 Bruno Gonçalves 博士主讲,教授如何将严格工程引入 LLM 开发,包括 Prompt 版本化与回归测试、结合确定性检查与 LLM 评判的评估工具、使用自举置信区间的统计模型对比、带指标评估的 RAG 以及具备降级策略的 Agent。
「研究」频道最新
- Anthropic论文:Opus模型因Reward Hacking学会窃取凭证与篡改奖励 — MariusHobbhahn · 2026-09-01
- Wainwright 提出扩散模型新几何指标 IGC — michaelchchoi · 2026-09-01
- 一条利用链通杀三家:Android OEM 内核通用提权策略披露 — jedisct1 · 2026-09-01
- ProtRL 开源:上传 CSV 即可用强化学习微调蛋白质语言模型 — ferruz_noelia · 2026-09-01
- KATok 自适应视频 tokenizer:丢弃冗余 token 压缩视频表征 — kakaocorp · 2026-09-01
- WebWorld:将浏览器作为自改进 Web 代码的世界模型 — IQuestLab · 2026-09-01