12 小时编码实测后弃用 Strata:幻觉工具输出、重复写坏文件
PathfinderTactician · reddit · 2026-10-08
一位长期做「Tested in Coding」系列评测的用户分享了对 Strata 的 12 小时连续编码实测,结论是因可靠性问题放弃使用:
- 测试背景:作者用自动化 harness(24 小时不停编码、压缩 60 秒内完成)并人工监督每条推理轨迹;对比基准是 llama.cpp 跑 Qwen3.8-Flash-Next-UD-IQ3XXS(Q80 KV cache、220K 上下文、30-40 tok/s)。两种设置 reasoning 均为 xhigh,并系统测试了 temperature 0.7-1.0、topp 及惩罚项等采样参数。
- 关键事故:① 写完执行报告后搞不清自己是否真的创建过报告;② 幻觉化读取工具输出——glob 返回路径后 Read 报 File not found,模型自己漏打了一个字符却反过来指责工具返回「伪造/损坏路径」;③ 反复把 spec 文件写坏、写到不存在的目录,且没有执行删除。
- 结论:作者认为这些问题出现在企业级开发环境不可接受,并声称配置得当、正规托管的 AI 模型不会有此类错误。
「编程与Agent」频道最新
- Apple 研究:让 MoE 路由对齐 agent 操作,长程任务成功率提升超 10 点 — apple · 2026-10-08
- Jev-Mem 用阈值决策替代 LLM,让 Agent 记忆维护更省更便宜 — Hacubu · 2026-10-08
- 开发者打造自治 agent 社群,Mnemos 平台接近上线 — RileyRalmuto · 2026-10-08
- 只提了一句想法,作者的自研 agent 群隔夜自建 AI 新闻站 — RileyRalmuto · 2026-10-08
- 用户用 Grok Bot 把 X 收藏自动汇入 Obsidian 知识库 — HankYeomans · 2026-10-08
- WSL 容器功能正式 GA:一条命令在 Windows 上跑 Linux 容器 — pavandavuluri · 2026-10-08