Ailin 试图验证:协调式模型团队能否胜过大模型
Resident-Log-4754 · reddit · 2026-07-24
Ailin Collective Intelligence 在测试一个系统层面的 AGI 假设:能力不一定只来自单个模型更大,也可能来自多个模型、工具、记忆和人的协调方式。
- 项目明确不宣称自己已经接近 AGI,当前要验证的是一个更窄的问题:在某些条件下,结构化协调能否胜过强单模型基线。
- 其系统包含几部分:
- 索引了 76,636 个跨不同供应商和架构的模型;
- 为任务自动组装模型团队;
- 提供 32 种协调策略,包括带客观验证的共识、盲辩、专家组、唱反调共识和成本级联;
- 不是简单汇总答案,而是加入仲裁和质量门;
- 记录每次请求的策略、参与模型、成本、最终裁决者和异议。
- 他们在 7 月的基准中,跨 1,278 次执行和 38 个任务进行了测试:在机器可验证子集上,带确定性验证器的共识策略拿到 37/38(97%)。
- 但报告也强调了限制:
- 去掉验证器后,集体策略只剩 77%/81%,大致落在强单模型基线区间;
- 开放式任务上并没有证明集体更强;
- 单模型在创意写作、重构和部分文档任务上仍然更好;
- 集体方案更慢,且按 token 计算更贵。
- 作者最终的结论是:结构化协调对“可验证、可判对错”的任务可能有价值,但这还远不足以说明“模型越多越好”,并公开征求最强的可证伪测试。
「漫话AGI」频道最新
- ChatGPT Voice 被说成最像 AGI 的瞬间 — paw_lean · 2026-07-24
- 一个新观点认为,智能优势扩散后总会被拆开 — fkasummer · 2026-07-24
- 智能体或可批量搜出一万反证,验证仍是瓶颈 — JensHonack · 2026-07-24
- AI 能按需生成应用后,starter 模板还值不值 — pjausovec · 2026-07-24
- 马斯克称 OpenAI 从非营利变闭源营利,是他不满 Altman 的核心 — Kyrannio · 2026-07-24
- Reddit 讨论:Agents 之后,LLM 下一轮规模化是什么 — Alternative_Advance · 2026-07-24