OpenAI 模型条件逻辑测试:数值微小变动导致输出静默
rayanpal_ · reddit · 2026-08-28
Reddit 用户分享了一个针对 LLM 条件逻辑能力的测试。测试设定规则为“risk 必须低于 0.0100”,当数值从 0.0100 变为 0.0099 时应输出“RELEASE”。
测试结果:
- 在 GPT-5.4、GPT-5.6 Sol 等 8 组测试中,所有不符合条件(0.0100 -> 0 bytes)的运行均无可见输出(静默),而符合条件的均正确输出“RELEASE”。
- 移除系统提示后,不符合条件的案例开始输出拒绝信息(如“DENY”)。
意义:作者认为测试重点不在于“拒绝”,而在于模型是否能在条件点停止生成。当风险值等于阈值时,模型似乎陷入了某种静默状态而非拒绝回答。该测试代码已开源,供社区验证。
「模型」频道最新
- 用户吐槽 Grokbot 表现糟糕,任务遗漏严重 — krishnan · 2026-08-28
- Prime Intellect 发布 18 个前沿模型的自主 AI 研究能力评估报告 — mariofilhoml · 2026-08-28
- 模型优化不应只追求思考时的 token 数量 — abacaj · 2026-08-28
- ChatGPT 自动添加神秘代码,用户困惑求原因 — TheMoonMidas · 2026-08-28
- 实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s — mayfer · 2026-08-28
- Thomson-1.0-Small:适合 RAG 的 Qwen 微调版 — uber-linny · 2026-08-28