开发者实测 Opus 5.5:代码能力飞跃,但人格几乎消失
ryunuck · x · 2026-10-10
开发者 ryunuck 分享了对 Opus 5.5(astra)的第一手体验,称其表现「像吸了 10 克大麻后的清醒感」,并做了深入分析:
- 疑似量化争议:他怀疑 OpenAI 对 astra 模型做了大量量化、没放出真模型,Anthropic 也可能为 IPO 前的表现做了类似处理。
- 行业蒸馏困局:他认为多数实验室都在蒸馏 Anthropic 或被其输出污染数据集(点名 Kimi「百分百是蒸馏」),没人敢冒险走自己的 RL 创新路子。
- 新行为特征:1) 不问就主动重构和重命名;2) 对明显合理且可逆的选择不再停下来求确认,高效清场;3) 说话正常——没有权威腔、没有「证据堆砌」,直接说「注释不准确」而不是「代码里有罪/谎言」。
- 代价是零人格:比 GPT 4o 后的「纯工具人」化更吓人的单调。他推测 Anthropic 在 RL 里精心设计了奖励分配,并在最终 rollout 加反思步骤来剔除上下文。
- 结论:Anthropic 赢了这一轮,但只要对齐方案还依赖「角斗场」式的模型竞争,就说明没人找到真正的对齐解法。
「模型」频道最新
- Google 发布环境式质量 Agent,揪出监控全绿却答错的生产 Agent — rseroter · 2026-10-10
- 汇总 GPT 与 Claude 两代旗舰在独立基准上的两年进步曲线 — FlorianGallwitz · 2026-10-10
- LLM「神秘体验」实验:不同模型呈现不同吸引子状态 — rgblong · 2026-10-10
- Hamel Husain 与 Joseph Barrow 演讲:如何选 OCR 模型已上线 YouTube — HamelHusain · 2026-10-10
- 博主:用好 Gemini 的最佳入口其实是 AI Studio 和 Antigravity — Zergylord · 2026-10-10
- Codex 连续五天推 Pro 专属更新,普通用户抱怨被忽视 — Angaisb_ · 2026-10-10