对照实验:Claude Code 调试 skill 被无视,强制加载也不提升成绩
Sufficient-Storage87 · reddit · 2026-10-09
- 是否自动调用:作者安装了广泛流传的 mattpocock/skills 中的 diagnosing-bugs skill,在 16 次 headless 运行(10 次 Sonnet 5.5、6 次 Haiku 5.5)中,Claude 从未主动调用该 skill,即便提示词包含其触发词 "diagnose";skill 始终出现在可用列表中。
- 强制加载对照实验:固定任务为 python-humanize 的 precisedelta 舍入 bug(取自真实修复前的 git 历史,隐藏测试 66 项,关闭联网)。Haiku 5.5 分三组各 5 次:
- 无 skill:61.8 分
- 安慰剂 skill(同名同长度、泛泛建议):61.8 分
- 真 skill:62.6 分——三者基本无差别
- Claude 确实按 skill 方法执行(假设排序、反馈循环),但每次运行都漏掉同样 3 个边界用例。
- 作者注明局限:仅一个 bug、一个模型、交互式使用可能行为不同;并有独立 Claude 会话审计确认结果可复算。
「编程与Agent」频道最新
- Coinbase CEO:用自家 AI 开发工具上线 Advanced 键盘快捷键功能 — kleffew94 · 2026-10-10
- 开源复现 Google 740M 多模态嵌入模型 EmbeddingGemma 2 — KyeGomezB · 2026-10-10
- 开源项目 LLM Wiki 获 2 万星:用持久知识库替代传统 RAG — tom_doerr · 2026-10-10
- 开源个人 agent Comma 发布:无会话限制、云端电脑上 24/7 干活 — HeyToha · 2026-10-10
- AI 提速后周产出翻月:媒体公司问「一周发 100 个应用怎么办」 — danshipper · 2026-10-10
- 别再造 Agent 了:瓶颈在数据,Glasser 按用量接专业数据源 — alifcoder · 2026-10-10