自建 200 题校准测试:模型自报 90% 把关可信度
colinmcnamara · x · 2026-09-24
colinmcnamara 分享了一套自测校准的工作流:准备 200 个自己熟悉的条目,分别从准确率和「模型自报 90% 置信时是否真的对」两个维度打分,两者的差距就是整个测试的核心。完整写法在其回复串中。
「编程与Agent」频道最新
- Ethan Mollick 用 Claude 多智能体复刻 1984 年老游戏 Rescue Raiders — emollick · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- 把 Jev 接进 Mythic:用大模型给红队命令的 OPSEC 强度打分 — dyn___ · 2026-09-24
- Ethan Mollick 用 Claude 多智能体协作复刻童年老游戏 Rescue Raiders — emollick · 2026-09-24
- YC CEO Garry Tan:用 Capy 后 PR 速度比裸用 Codex 快 4 倍以上 — garrytan · 2026-09-24
- Claude 用 Chrome 自动化烧 token 惊人,一行 CLAUDE.md 规则解决 — AIandDesign · 2026-09-24