实测temp=0非确定性:API评分微小波动致安全评级翻转
Midoxp · reddit · 2026-08-01
一位开发者在测试视觉大模型对药品包装的相似度打分时,发现 temperature=0 并不能保证结果的确定性,且这种非确定性足以改变最终的安全评级。
实验发现:
- 在相同的图片和提示词下,模型(如 gpt-4.1-mini)多次运行的平均分在 38.5 左右徘徊。由于 40 分是“低风险”与“中风险”的分界线,最终的安全分类在多次运行中出现了五五开的翻转。
- 中位数策略失效:对单次结果取3次中位数并不能有效修正这种边界波动。
- 推理模型表现反常:对于推理类模型(如 gpt-5.6-luna),提高推理努力反而可能导致评级翻转频率增加,且成本更高。
- 评分模式离散:旧模型倾向于输出5的倍数(粗粒度),而新模型输出自由整数。表面上旧模型看似稳定,实则是在有限的几个答案中跳跃。
作者指出,在随机系统中仅凭3次采样得出的结论是不可靠的,这揭示了基于大模型打分阈值的业务逻辑存在隐含风险。
「研究」频道最新
- 阿里达摩院开源医学多模态模型 ClinFusion — aigclink · 2026-08-01
- 重构超150万细胞:小鼠胚胎细胞谱系图谱发布 — anshulkundaje · 2026-08-01
- Edison Scientific 汇总发布多项 AI 研究成果与开源模型 — CatAstro_Piyush · 2026-08-01
- AI 为何难成爱因斯坦?论文指其缺乏原理发现能力 — OdedRechavi · 2026-08-01
- 实验证明:512分辨率训练AI绘图配合超分可省大量显存 — More_Bid_2197 · 2026-08-01
- 单图高保真几何重建:微软 MoGe-3 刷新 9 项基准纪录 — RexDouglass · 2026-08-01