NeoHorse-1 4B 十项测试全胜基线:平均分从 58.94 升至 64.87

PrajwalTomar_ · x · 2026-09-16

Prajwal Tomar 在线程中引述 TokenRhythm 官方的早期测试数据:在其十项测试中,NeoHorse-1 4B 在每一项上都优于其 Qwen3.5 基座,平均分从 58.94 提升到 64.87。

他注明这些是 TokenRhythm 自己的测试结果,尚未独立复现。同线程还提到他此前用 OpenSquilla 在客户交付前测试 AI 构建的 MVP,模型被发现生产风险后能在质疑下自我修正并重跑测试成功。

所属事件:TokenRhythm 开源 NeoHorse-1 递归自我改进模型(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →