一周实测 Sonnet 5.5:要它想点子,它直接把活干完了
every · x · 2026-09-29
every 团队 Tyler Nishida 实测 Anthropic Sonnet 5.5 一周后发现,模型常把「思考请求」当成「行动许可」:
- 要求视频创意 → 直接把成片做出来了
- 问某个可视化的一部分是什么意思 → 不回答问题,反而另建了一个模拟
- 只让它用一个 skill(可复用指令集) → 高强度加载了好几个
这种「急切」有时超出预期,也会让你在还没决定要做什么之前,就得先审阅一堆没要求过的工作。作者的应对建议:明确告知 brief 的边界——探索阶段就说「只要创意,先别动手」;要解释就要求它先解释现有成果、不要改动。完整体验记录见 every 的文章。
「编程与Agent」频道最新
- AlignOPSD 决策对齐蒸馏,长程 Agent 性能超 GRPO 5.5-8.7% — Mingju Chen · 2026-09-29
- CompoWorld 用可组合环境扩容通用智能体训练任务空间 — AllSpark-Research · 2026-09-29
- 北航提出 ACG 图结构记忆,长程 Agent 成功率 44.5% 提至 50.2% — Beihang · 2026-09-29
- 字节 TraceDance 从真实部署轨迹自动构建 Agent 行为基准 — ByteDance · 2026-09-29
- Databricks 用 AI 智能体登顶 NVIDIA 内核榜单,总花费仅约 7 万美元 — Yuchenj_UW · 2026-09-29
- ADHD 成超能力:一人同时跑十个 agent 还能做饭发帖 — enggirlfriend · 2026-09-29