PRAXIST 开源:MLE-bench 拿 49 金,成本仅 Claude Code 十二分之一
SignalCompetitive582 · reddit · 2026-08-28
Sapient Intelligence(HRM 架构团队)发布 PRAXIST,一个以「谱系」为核心的世代式自主研发 agent 系统:把可复现工件与评估结果转化为带类型的证据图,将局部工件构建与队列级证据合成分离,让后续尝试继承已验证机制、未解论断与约束,避免长期任务反复重学同一教训。
关键结果:在标准 75 任务 MLE-bench 上,官方评分 PRAXIST 获 60 枚奖牌(80.0%,其中 49 金),对比 Claude Opus 4.8 上的 Claude Code 基线 55 枚奖牌(73.3%,34 金),模型花费 3,054 美元对 38,370 美元——约十二分之一成本。四个开放工程案例研究(量化交易、LiDAR-惯性-视觉 SLAM、托卡马克磁控、火箭着陆)均改进任务原生基线,并保留完整可审计的发现路径。
商业化与信号:PRAXIST 开源,但年营收超 100 万美元的公司需商业许可。作者认为这体现了 harness 对 LLM 能力的巨大提升(不只造更好的「发动机」,还要造更好的「车身」),也可能暗示 HRM 架构本身难以继续扩展。
所属事件:PRAXIST 多智能体框架开源:MLE-bench 拿 49 金(5 条相关)→
「编程与Agent」频道最新
- 开发者如何决定采用一个 MCP server?最信哪些信号 — SnooPuppers6082 · 2026-08-28
- Agent 任务为何总在半小时内停下?缺的是可机器验证的反馈环 — EntireBig7258 · 2026-08-28
- 不等官方App:用户让Grok直接读Conductor API文档管Agent — iannuttall · 2026-08-28
- AQuA论文提出评测契约清单:改个工具schema就算新系统 — creditme7 · 2026-08-28
- 四小时高铁实测:Fold 折叠屏加远程桌面足够跑全部 Agent — kevinkern · 2026-08-28
- Accio 开源 CommerceAgentBench:验证 Agent 真实工作 — kimmonismus · 2026-08-28