从 .6 误切回 .8:开发者实测感受代际级能力跃升
AI_Andrew · x · 2026-09-04
一位开发者分享了自己的意外对照实验:他花了数小时用 swarm of agents 在「.6」上构建,几乎要放弃时才发现模型被误切回了旧版本,回到「.8」后落差极其明显,称这是「戏剧性的代际改进」。
他的观察:
- .7:数学与科学更强,但「气质更冷」(sterile)。
- .8:思考更久更深,带一点个性;出错后擅长在下一轮自我纠错甚至反超,代价是首轮精度可能略低。
他补充表示一直在密集构建中记录模型行为模式,试图区分哪些改进来自 harness、哪些来自模型本身,并预告后续会发布更系统的对比。
「模型」频道最新
- Qwen3.8-Max-0902 编码专项训练后 RSI-Exam 成绩提升 22% — HuaxiuYaoML · 2026-09-04
- MazeBench 3D 迷宫环境上线,可免费在线试玩 — patience_cave · 2026-09-04
- GPT-5.6 Sol 暂居 MazeBench 榜首,Fable 5.1 或有望反超 — patience_cave · 2026-09-04
- 两月内 0% 到 4%:Gemini Flash 系列世界建模逐代进步 — patience_cave · 2026-09-04
- MazeBench 新结果:Gemini 3.8 Flash 仅得 4%,模型普遍低于 1% — patience_cave · 2026-09-04
- GPT-6 Astra 实测分析:更像电脑操作专家,而非 AGI — becomingengageably · 2026-09-04