福尔摩斯侦探游戏实测:小模型蜂群+强推理者破案率 96%
No_Yogurtcloset_7050 · reddit · 2026-10-11
LMGame 团队用程序化生成的维多利亚伦敦侦探游戏,测试小型快速 agent 蜂群能否破解凶案(100 个地址、10 名嫌疑人、每址一条线索,须在 12 案时内指认凶手、动机与藏身处)。
主要结果(100 案标准局/栽赃局):
- GPT6-Astra 当福尔摩斯 + 12 个 Jev agent 搜证:96 / 93
- 规则版福尔摩斯 + Jev 蜂群:95 / 0
- 单个 GPT6-Astra 独自跑遍全城:57 / 59(加倍时间可到 91 但超时)
- 100 个 Jev 无领袖蜂群投票:38 / 42,中位耗时仅 2.2 案时
关键发现:
- 蜂群提供证据覆盖,领袖负责推理裁决,分工即「分而治之」
- 蜂群无领袖时共识过早:个别 agent 误读线索,自信投票在邻区间扩散,错误没人复核
- 证据诚实时,只数线索的规则领袖就能以极低成本媲美大模型(95 vs 96)
- 一旦有人撒谎(凶手收买证人),计数式领袖全军覆没(0/100),只有会追问「谁在提供证据、为什么」的强推理模型能解 93 案
项目开源并含其他环境(CPU 调试、鱼群、蜜蜂选巢):github.com/lmgame-org/Gaming-JevSwarm
所属事件:小模型蜂群搭档强推理者 侦探游戏破案率达 96%(2 条相关)→
「编程与Agent」频道最新
- 「你的客户不再是人」:Agent Experience 将决定产品生死 — dhruv2038 · 2026-10-11
- 免费 LLM API 频现 429,开发者用多供应商回退链救活多 Agent 应用 — Willing_Advisor_9998 · 2026-10-11
- Synthesia 推出 Syren Video:提示词生成机构级视频,免费试用 — heyshrutimishra · 2026-10-11
- Codex 负责人调侃「完美之日就是只剩重置之时」,小红虎问 OpenAI 靠重置留人? — xiaohu · 2026-10-11
- 一个 MCP 接通 X、Ins、WhatsApp、Telegram 和 Gmail — gauthi3r_XBorg · 2026-10-11
- 开发者用单个 Codex/Claude 会话一天内原生移植世嘉 MD 游戏 — ssh4net · 2026-10-11