实测对比:Astra 更懂任务,Fable 更像人——pass@40 打错字后被自作主张纠正
bclavie · x · 2026-09-05
开发者 bclavie 分享对 Astra 与 Fable 两个模型的行为观察:Astra 更「任务智能」,Fable 则更像人类的直觉。
一个例子:他打错字,向 Astra 请求 pass@40(4),Astra 规规矩矩照办并开始执行;而 Fable 直接回复「我会把 pass@40 理解为打错字,按 pass@4 来测」。这种自主纠错体现了两个模型在严格执行与常识推断上的不同取舍。
所属事件:Astra 与 Fable 实测对比:任务智能与人类直觉各有所长(2 条相关)→
「模型」频道最新
- 研究者实测:GPT-6 进 Codex 处理难题仍需人工引导 — DimitrisPapail · 2026-09-05
- 掩码扩散模型并行生成的软肋:条件独立导致联合不连贯 — alec_helbling · 2026-09-05
- GPT-6 Astra 官方指南内置提示词,专治模型乱跑冗余测试 — JeremyNguyenPhD · 2026-09-05
- 微调 Qwen3-8B 单卡 4090 生成文本,pangram AI 检测 100% 判为人类 — StewartalsopIII · 2026-09-05
- 27B 开源模型看草图直接生成可编辑 FreeCAD 零件 — MaziyarPanahi · 2026-09-05
- Astra 系统卡披露:Apollo 测试期仅三天,含思维链访问 — tallinzen · 2026-09-05