实测者的朴素验模法:把卡住的难题丢给新模型看能否破局

wightmanr · x · 2026-09-05

作者认为 GPT-6 Astra 确实是台阶式进步,但不用「生成一个 3D 大作」式的炫技测试,而用更朴素的方法:把手头因反复 ping-pong、等待人工介入而卡住的任务丢给新模型,若它能给出简洁、可用、干净的方案,才算是真强——Astra 通过了,而 Fable 5.1 仍在 ping-pong。

作者还总结了一个观察:过去 18 个月每次新模型出来都重复同一循环——很快习惯新能力、委派更多更难的任务、然后在某个点上再度陷入低效拉扯,直到下一个模型。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →