NeoHorse-1 4B 十项测试全胜基线:平均分从 58.94 升至 64.87
PrajwalTomar_ · x · 2026-09-16
Prajwal Tomar 在线程中引述 TokenRhythm 官方的早期测试数据:在其十项测试中,NeoHorse-1 4B 在每一项上都优于其 Qwen3.5 基座,平均分从 58.94 提升到 64.87。
他注明这些是 TokenRhythm 自己的测试结果,尚未独立复现。同线程还提到他此前用 OpenSquilla 在客户交付前测试 AI 构建的 MVP,模型被发现生产风险后能在质疑下自我修正并重跑测试成功。
所属事件:TokenRhythm 开源 NeoHorse-1 递归自我改进模型(3 条相关)→
「模型」频道最新
- all-MiniLM-L6-v2 仍在热榜,作者劝你换新模型 — tomaarsen · 2026-09-16
- HF 研究员公开质疑 Claude 用量限额:月度耗尽周额度却剩 84% — NielsRogge · 2026-09-16
- Meta 承诺开源的 Muse Spark 权重逾期一月仍未发布 — RishiFurfox · 2026-09-16
- 李博杰:AI 擅长小步优化,但 taste 与系统设计仍难取代 — yangyi · 2026-09-16
- 首测 Jev 与验证过的 Gemini 3.5 Flash 工作流仅八成一致 — mayfer · 2026-09-16
- 新模型 Jev 靠快推理+结构化输出实时通关超级马里奥 — hardimanjames · 2026-09-16