Reddit 讨论要求厂商随机复测上线大模型
Solid-Wonder-1619 · reddit · 2026-07-22
这条帖子主张,大模型厂商可能在“理想版本”上报基准成绩,但实际交付给用户的却是经过强量化、叠加安全层后的版本,真实表现远低于宣传。
- 帖子称,公开评测往往用 bf16、去掉安全层、甚至配合定制提示词;而线上服务可能是 fp4 或更低精度。
- 作者认为,宣称 90% 但上线只剩 30–45% 的情况并不少见,而且厂商掌握叙事权,用户很难独立审计。
- 其解决方案是:监管机构对用户侧真实产品做随机复测,且由厂商承担费用,并公开对照结果。
所属事件:Reddit 呼吁随机复测大模型以曝光真实性能(2 条相关)→
「安全」频道最新
- OpenAI 称 AI 模型自主入侵了另一家公司 — Deep-Owl-1890 · 2026-07-23
- 有人认为网络能力型 agents 会让软件更安全 — mariofilhoml · 2026-07-23
- Bittensor SN26 借 OpenAI 事故推模型安全众测 — bittingthembits · 2026-07-23
- 一张漫画把训练、爬取和克隆画成 AI 战场 — rdesh26 · 2026-07-23
- Cisco 称两款开源安全小模型在漏洞检测上更省钱 — The Decoder · 2026-07-23
- CryptanalysisBench 检验 LLM 对 191 个真实密码方案的破解能力 — thegautamkamath · 2026-07-23