长帖建议随机复测大厂模型,逼迫公开真实交付性能

Solid-Wonder-1619 · reddit · 2026-07-22

这条长帖的核心观点是:大厂 AI 实验室应该被要求对实际上线给用户的版本做随机复测,因为宣传基准分数和真实交付表现可能差很多。

作者认为,实验室常在理想条件下跑分——比如 bf16、无安全层、专门调过的 prompt,甚至不可验证的私有测试集——但用户拿到的却是更低精度量化、叠加安全干预后的版本,性能可能明显下降。帖子给出的解决方案是:监管方要求第三方对“用户可见产品”进行多次重测,由实验室承担费用,并公开“宣传版 vs 实际版”的对照结果。

所属事件:Reddit 呼吁随机复测大模型以曝光真实性能(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →