astra 复跑自动科研基准:非主流解法「狂野」程度超预期
generativist · x · 2026-09-13
AI 研究者 generativist 补充其 astra 自动科研基准测试的细节:他的测试 harness 会特意筛选非主流(off-beaten-path)的解法,而这次 astra 给出的方案连他都称得上「wild」,呼应其「前沿模型或已针对此类任务完成深度 RL、自我改进正在发生」的判断。
所属事件:研究者复跑自动科研基准:前沿模型表现惊艳引自我改进之问(2 条相关)→
「漫话AGI」频道最新
- Beff Jezos 发起反抗大厂宣言:誓言推翻「token 收割者卡特尔」 — beffjezos · 2026-09-13
- 评论称 OpenAI 与 Anthropic 若无法控险就该停售模型 — AlexTensor · 2026-09-13
- AI 沙皇 Sacks 力挺前沿双寡头:放慢?不需要谁批准 — kevinnbass · 2026-09-13
- 算力将转向可解释性与对齐,RL 狂奔前须先解决奖励劫持 — zephyr_z9 · 2026-09-13
- 三大巨头罕见齐声呼吁放慢 AI,Reddit 猜有未公开事故 — Traditional-Chip8339 · 2026-09-13
- tszzl 预测重大事故后开源模型恐遭禁,Kimi/DeepSeek 应受 API 监控 — mimi10v3 · 2026-09-13