实测者的朴素验模法:把卡住的难题丢给新模型看能否破局
wightmanr · x · 2026-09-05
作者认为 GPT-6 Astra 确实是台阶式进步,但不用「生成一个 3D 大作」式的炫技测试,而用更朴素的方法:把手头因反复 ping-pong、等待人工介入而卡住的任务丢给新模型,若它能给出简洁、可用、干净的方案,才算是真强——Astra 通过了,而 Fable 5.1 仍在 ping-pong。
作者还总结了一个观察:过去 18 个月每次新模型出来都重复同一循环——很快习惯新能力、委派更多更难的任务、然后在某个点上再度陷入低效拉扯,直到下一个模型。
「编程与Agent」频道最新
- 让 Claude 与 Copilot CLI 互审代码:交叉模型 Review 实践 — DanWahlin · 2026-09-05
- Coinbase 推 x402 协议:用钱包签名取代 AI Agent 的 700 把 API key — kleffew94 · 2026-09-05
- 开发者观察:GPT-6 Astra 全程只用 bash,不用读写工具调用 — lucasmeijer · 2026-09-05
- Astra 持续性能力受质疑:实测者称暂无革命性进展 — Benata · 2026-09-05
- 开发者晒 Astra 全流程造品:代码、剪辑、写帖全由 agent 完成 — daniel_mac8 · 2026-09-05
- 开源 astra-advisor:让 Astra 把任务委派给更小的模型省钱 — daniel_mac8 · 2026-09-05