专题 · FULL STORY

Apodex 1.1:发布到实测

Apodex 发布 1.1 版本,开源 FrontierAgent 执行框架与 35B 参数 mini 模型;随后多位用户实测,验证其在复杂任务中需求中途变更时仍能自动重排任务的能力。

2026-09-08 ~ 2026-09-09 · 2 集 · 17 条

第 1 集 · Apodex 1.1 发布:开源 FrontierAgent 框架与 35B mini 模型(2026-09-08,14 条)

Apodex 发布 1.1 版本并开源 agent 执行框架 FrontierAgent 与 35B 参数的 1.1 mini 模型,整版建立在一个主张上:衡量 AI 能力的有意义单位是端到端完成一份真实工作,产出文件、代码等可检查的结果,而非仅仅答对问题——「正确的答案也可能是失败的任务」。该主张与配套的可验证交付机制,使其成为关注 agent 可信输出的观察者值得留意的发布。

已确认

  • FrontierAgent 已开源上 GitHub,macOS/Linux 一条命令即可启动,无需预装、不强依赖 Docker;原生命令行 TUI,支持单 agent 与 Agent Team 两种模式,目前约 2.4k star
  • Apodex 1.1 mini 为 35B 参数开源权重,已上架 Hugging Face,含 FP8、NVFP4、GPTQ-Int4 等量化版本,可与 FrontierAgent 配合本地部署
  • 完整版模型驱动在线 web workspace,配套 API 对新用户免费两周
  • 官方数据显示 1.1 搭配 Agent Team 模式在 APEX-Agents、GDPval、FrontierScience、Humanity's Last Exam 等基准上位于当前前沿 agent 系统梯队;据转发帖,Apodex 1.1 论文(arXiv:2608.23283)及 Agent Team 评测结果已被收录至 Papers with Code,Agent 团队在 FrontierScience 通过率 63.3%
  • 设计上把「生成结果」与「检查结果」拆为独立步骤(Statement Review):重要结论交付前由独立环节复核,弱证据、引用不匹配、计算冲突会被标记并保留审查记录
  • Deep Discover 模式内置异步 Agent Team:由模型自行决定任务拆分、子 agent 数量与汇总时机,子 agent 并行运行并将结果流回共享任务状态;运行中可投入新文件或变更需求,系统保留有效成果、只重排受影响部分,官方 demo 为全球 EV 电池供应商风险评估
  • 官方 demo 直接处理真实专业文件,如读取原始临床数据表完成清洗、生存分析并产出 Kaplan-Meier 曲线,另覆盖粉末 XRD 指标化与批量蛋白质对接

为什么重要

  • 发布从「告诉你怎么做」转向「陪你一起完成任务」的协作式定位,把可检验交付而非问答准确率作为能力标准,针对的是 agent 输出用于真实专业场景时的可信度问题
  • 生成与核查分离的 Statement Review 机制被评测者(aakashgupta)认为是最被低估的能力,也是把 agent 输出用于实际工作的关键保障
  • 开源框架加开源 35B 权重的组合降低了本地复现门槛,mini 模型可与 FrontierAgent 配合在本地跑完整工作流

第 2 集 · 实测 Apodex 1.1:需求中途变更也能自动重排任务(2026-09-09,3 条)

多位用户实测 Apodex 1.1:给它一个复杂任务(如在单张 24GB GPU 上对比 8 个可自托管开源模型的显存、速度、许可证、质量与成本),并在任务运行中途修改需求。结果显示系统能自动重组研究流程、并行多 agent 重排整个任务板,展现较强的研究编排能力。