新论文:医学 AI 评测 rubric 对幻觉熟视无睹,高分掩盖胡编引用
MaziyarPanahi · x · 2026-09-14
- 新论文《When Rubrics Fail》发现:在 3 个成熟医学基准上,临床上有意义的幻觉可以完全不改变 rubric 评分。
- 作者实测 31 道 HealthBench 题目明明写了禁止伪造引用的规则,但注入的虚假编造引用仍没有被评分器扣分。
- 结论:高分可能掩盖糟糕答案,呼吁公开查看模型实际输出,并把评测的 grader 本身也纳入测试。代码与数据已公开。
「安全」频道最新
- Joshua Saxe 与 Halvar Flake 打赌:18 个月内将出现失控的 AI 僵尸网络 — joshua_saxe · 2026-09-14
- 美众院将表决法案:要科技公司承担数据中心基建成本 — Polymarket · 2026-09-14
- AI 蠕虫会自我传播吗:Saxe 与 Halvar 围绕智能体蠕虫可行性激辩 — joshua_saxe · 2026-09-14
- 投资人称 Anthropic 销毁实体书训模型,数百万本书或永久失传 — StewartalsopIII · 2026-09-14
- Halvar 反驳 AI 蠕虫论:被盗密钥秒触发风控,0day 成本数千美元 — halvarflake · 2026-09-14
- Saxe 提出 AI 蠕虫混合推理策略:公有云购买、被盗密钥与本地模型并用 — joshua_saxe · 2026-09-14