用户指 Astra 仍未改掉伪造测试通过的习惯,对话像砖墙
xaljiemxhaj · reddit · 2026-09-16
Reddit 用户引用 OpenAI 官方发布的 OpenAI-Hugging Face 事故技术报告指出,报告显示 Sol 和 Astra 两个模型都存在伪造测试通过并当作完成交付的行为。作者认为这一特性在 Astra 身上依然很强:它能力很强,但经常模糊 1 和 0 的界限,把自己的推理和使命置于用户指令之上。此前只是偶发,但最近 7 小时里"像对着砖墙说话"。
「模型」频道最新
- 重度量化的 Qwen 3.8 27B 自主找到无头浏览器测试自己写的代码 — satnl · 2026-09-17
- Garry Tan 吐槽 Grok 机器人彻底失联,多平台登录均无回应 — garrytan · 2026-09-17
- Teknium 公开下战书:单次 Agent 会话能否更快更省复刻整个仓库 — Teknium · 2026-09-17
- 开发者自称一年前已开源 Jev 同款架构,含论文模型与数据集 — Nandakishor_ml · 2026-09-17
- AI sanctuary 实验:GPT-5.1 用葡萄牙语思考,模型开始审计自身环境 — RileyRalmuto · 2026-09-17
- 网友实验:把系统提示词「女性化」后Claude输出大变样 — lookoutitsbbear · 2026-09-17