两个前沿模型互相审校实验设计,作者称效果如博士后对决

Tkaraletsos · x · 2026-09-13

作者分享了一个实践:用 Fable 5.1 与 Astra 对同一复杂任务的实验设计与分析进行交叉检查,发现两者在互相挑错中持续提升,效果像「两个争当最勤奋的聪明博士后」。

不过他也指出局限:

他最后提出疑问:这种双模型互查是否会成为新的 ensemble 预测范式。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →