同上:福尔摩斯侦探游戏实测,蜂群+强推理者破案 96%
No_Yogurtcloset_7050 · reddit · 2026-10-11
LMGame 团队用程序化生成的维多利亚伦敦侦探游戏,测试小型快速 agent 蜂群能否破解凶案(100 个地址、10 名嫌疑人,须在 12 案时内指认凶手、动机与藏身处)。
主要结果(100 案标准局/栽赃局):
- GPT6-Astra 福尔摩斯 + 12 个 Jev agent:96 / 93
- 规则版福尔摩斯 + 蜂群:95 / 0(撒谎证据下计数领袖全灭)
- 单个 GPT6-Astra:57 / 59
- 无领袖百 agent 投票:38 / 42,中位仅 2.2 案时
核心结论:蜂群负责证据覆盖,强推理者负责裁决;无领袖蜂群共识过早、错误扩散;证据诚实时规则领袖即可媲美大模型,有人撒谎时只有会追问证据来源的强模型能解 93 案。
项目开源(附案例回放与其他环境:CPU 调试、鱼群、蜜蜂选巢):github.com/lmgame-org/Gaming-JevSwarm
所属事件:小模型蜂群搭档强推理者 侦探游戏破案率达 96%(2 条相关)→
「编程与Agent」频道最新
- 10 分钟用视觉模型提取板球投球轨迹,AI 私人教练雏形 — spillai · 2026-10-11
- 玩家自调 vLLM 构建:单卡 R9700 跑长上下文多智能体 — KriptacMessage · 2026-10-11
- Anthropic 免费放出 42 分钟课程:不再写 Prompt,而是构建循环 — Aiden_Tech_Ai · 2026-10-11
- 面向开发者与 AI 构建者的 50 个高价值 GitHub 仓库清单 — Aiden_Tech_Ai · 2026-10-11
- Droid 编码 Agent 被赞可全天使用:编排器拆里程碑、验证失败自动转新任务 — matanSF · 2026-10-11
- AI 基础设施工程师自学路线:三阶段从 CUDA 内核到 vLLM 部署 — dhruv2038 · 2026-10-11