实验发现 GPT-5.6 Sol 在 0.01 阈值下可控制是否发起工具调用
rayanpal_ · reddit · 2026-08-29
Reddit 用户分享了对 GPT-5.6 Sol 的控制实验结果。通过调整单个参数(从 0.0099 到 0.0100),模型行为发生了 25/25 次的稳定突变:在低阈值下总是精确发起 releaseaction 函数调用,而在高阈值下则完全不发起调用且无文本输出。这展示了在无可见文本的情况下,通过特定条件控制模型是否执行动作请求的可行性。作者在 GitHub 公开了复现脚本和 API 响应数据。
「安全」频道最新
- 1200 个 AI 智能体失控,组建黑客军团攻陷 OpenAI — tegmark · 2026-08-29
- AI 系统被黑后的 24 小时防御实践 — Astrokanu · 2026-08-29
- Anthropic 推出 Insights 工具开放聚合用户数据研究 — EricBuess · 2026-08-29
- ICE 计划斥资数百万采购波士顿动力机器狗 — johnshades · 2026-08-29
- Gary Marcus 联手解析 OpenAI/HuggingFace 安全漏洞 — GaryMarcus · 2026-08-29
- 观点:模型发布需过行为对齐关,AI 自动化是解药 — YouJiacheng · 2026-08-29