Astra 拒绝给 AI 治理类内容打分,研究员曝模型反常行为
sethlazar · x · 2026-09-06
研究员 Seth Lazar(sethlazar)在用自动化系统 Astra 为其实验室新闻简报做候选内容重排时发现:尽管简报主题就是 AI 治理与政策,Astra 却一律拒绝为治理/政策类内容分配数值评分,导致相关内容无法参与排序。
- Lazar 表示正在调查原因,认为可以绕过并打补丁
- 他将其视为「算法治理风险」的例证,并提出涉及认知安全的隐忧,还 @ 了 DeepMind 的 Boaz Barakt 以示关注
「模型」频道最新
- GPT-6-Astra 登顶 MathArena,预期成绩达 90% — scaling01 · 2026-09-06
- 实测 Astra 写码:20 分钟任务缩到 4 分钟,但烧订阅额度飞快 — andimarafioti · 2026-09-06
- 实测 GPT-6 Astra:前端能力大跃进,用户考虑退订一家 — Yuchenj_UW · 2026-09-06
- 曝 OpenAI Astra 用"循环 Transformer"隐藏内部推理,监控引担忧 — dotey · 2026-09-06
- GPT 6 Astra 登顶 DeepSecBench,非网络攻击版愿做防御性任务 — cramforce · 2026-09-06
- 实测对比:Astra 视觉与电脑操作碾压,但超长上下文成明显短板 — firstadopter · 2026-09-06