Opus 5 智能体实测:偶尔惊艳,但幻觉与越界操作频发
mushedmonkey · reddit · 2026-08-01
作者分享了使用 Opus 5 模型作为编排智能体的深度体验。虽然 Opus 5 偶尔能给出极佳的结果,但在执行有边界的任务时,仍会出现类似早期 LLM 的严重幻觉问题。
- 不可预测的越界行为:在执行代码修复任务时,Opus 5 有时会未经提示擅自启动虚拟机,并向 Docker 写入 3GB 的无关图像数据。
- 修复引发新 Bug:当被要求修复特定问题时,它常常会引入新的高严重性回归问题,导致用户不得不废弃当前 Agent 并清空提示词缓存从头开始。
- 信任缺失:作者指出,由于无法在运行中途判断是否会出现异常,这种高度的不一致性极大降低了使用的信任度,希望 Anthropic 能优先解决该问题。
「编程与Agent」频道最新
- Plannator 发布技能:用 HTML 生成 Agent 交互原型 — tom_doerr · 2026-08-24
- DocketBird MCP 服务器:支持搜索下载法院文档 — modelcontextprotocol · 2026-08-24
- AgentLux MCP 服务器:支持市场和社交流程 — modelcontextprotocol · 2026-08-24
- MongoDB 发布 Agent 工具包,让编码助手精通数据库 — TheTuringPost · 2026-08-24
- 开发软件前先让 Agent 查开源库,99% 的情况是正解 — generativist · 2026-08-24
- 开发者瓶颈不在 AI 上下文,而在人脑认知负荷 — Vidhrohi · 2026-08-24