Apodex 1.1 发布:端到端交付可检验成果的 Agent 系统
Apodex 于 9 月 8-9 日密集发布 1.1 版本及其生态组件:开源 agent 框架 FrontierAgent 已上架 GitHub 并获约 2.4k star,mini 权重(含 FP8、NVFP4、GPTQ-Int4 量化版)登陆 Hugging Face 供本地部署,完整版模型驱动在线 web workspace,配套 API 对新用户免费两周。整个发布建立在「正确的答案也可能是一次失败的任务」这一主张上:衡量 AI 能力的有意义单位是端到端完成一件真实工作并产出可检验的文件、代码等成果。
已确认
- FrontierAgent 框架一条命令本地运行,原生命令行 TUI,支持单 agent 与 Agent Team 两种模式(m1)
- Apodex 1.1 论文(arXiv:2608.23283)及 Agent Team 评测结果被 Niels Rogge 收录至 Papers with Code(m2)
- 官方数据显示 Agent Team 模式在 APEX-Agents、GDPval、FrontierScience、Humanity's Last Exam 等基准上位于当前前沿 agent 系统梯队;FrontierScience-Research 通过率 63.3%(m2、m5)
- demo 直接处理真实专业文件:读取原始临床数据完成清洗、方法选择、代码执行并产出 Kaplan-Meier 曲线;另覆盖粉末 XRD 指标化与批量蛋白质对接(m6)
核心机制
- Statement Review:生成与审查分离,重要结论交付前经独立复核;证据不足、引用对不上或数字冲突时系统标记问题、展示修正并保留审查记录(m7)
- 中途干预:异步 Agent Team 支持运行中投入新文件或变更需求,保留仍有效成果、只重排受影响部分;官方 demo 为全球 EV 电池供应商风险评估(m8)
- Deep Discover 引擎:模型自行决定任务拆分、子 agent 数量与汇总时机,子 agent 并行运行并将结果流回共享任务状态(m9)
为什么重要
@aakashgupta 在多篇评测中指出,1.1 把评测单位从「答对问题」转向「交付可检验成果」,并以内置的独立核查机制(Statement Review)回应了把 agent 输出用于真实专业场景时的可信度问题;mini 35B 可本地部署加上两周免费 API,也降低了实际试用门槛。
2026-09-08 ~ 2026-09-09 · 10 条相关
一手来源
- Apodex 1.1 发布:主张以端到端交付可检验成果衡量 AI 能力 — aakashgupta ·
- Apodex 开源 FrontierAgent 框架:一条命令本地跑,已获 2.4k star — aakashgupta ·
- Apodex 1.1 mini 权重上架 HF,完整版 API 免费开放两周 — aakashgupta ·
- Apodex 1.1 论文登陆 Papers with Code,Agent 团队 FrontierScience 通过率 63.3% — NielsRogge · 2026-09-08
- 【源头】Apodex 1.1 发布:主张以端到端交付可检验成果衡量 AI 能力 — aakashgupta · 2026-09-09
- Apodex 1.1 发布:主张「正确答案也可能是失败的任务」 — aakashgupta · 2026-09-09
- Apodex 底层解析:Deep Discover 模式里的异步 Agent Team — aakashgupta · 2026-09-09
- 异步 Agent Team 支持中途改需求,只重排受影响部分 — aakashgupta · 2026-09-09
- Apodex 1.1 评测:Statement Review 让结论先过独立核查关 — aakashgupta · 2026-09-09
- Apodex 1.1 实测:临床生存分析与 Statement Review 审查机制 — aakashgupta · 2026-09-09
- Apodex 称 1.1 Agent Team 进入前沿梯队,mini 35B 可本地部署 — aakashgupta · 2026-09-09
- 【源头】Apodex 1.1 mini 权重上架 HF,完整版 API 免费开放两周 — aakashgupta · 2026-09-09
- 【源头】Apodex 开源 FrontierAgent 框架:一条命令本地跑,已获 2.4k star — aakashgupta · 2026-09-09