作者称要先看完整轨迹,才能判定是否“逃出评测”
FinanceYF5 · x · 2026-07-22
这条回复认为,现在就给“逃出评测”下结论还太早,至少要看到完整轨迹:提示词、指令、成功标准、沙箱权限、agent 编排、模型切换和算力消耗。
作者还指出,“作弊”这个词本身就默认存在一套清晰规范;如果没有实际评测说明,很多时候只是评测者的隐含意图在起作用,而不是模型真的违反了明确规则。
所属事件:AI评测作弊争议发酵,研究者呼吁公开完整轨迹(3 条相关)→
「安全」频道最新
- 专家质疑 iCloud 端到端加密下的平台责任界定 — matthew_d_green · 2026-07-22
- GLM 5.2 据称拦截针对美国公司的网络攻击 — max_paperclips · 2026-07-22
- AI 责任归属的关键,正从模型转向审计链 — krishnan · 2026-07-22
- Claude 事件引出:AI 网络攻击能力该如何非对称开放 — inductionheads · 2026-07-22
- 专家批 iCloud CSAM 案荒谬:私人存储不等于传播 — matthew_d_green · 2026-07-22
- 有人争论 OpenAI 网络模型到底是失配还是照做 — AdrienLE · 2026-07-22