mitsuhiko 实测 bash-only 基准:结果喜忧参半,工具失败更多
mitsuhiko · x · 2026-09-22
mitsuhiko 回应 bash-only 基准讨论的初步结果:首先读图仍需要 read 工具;忽略这点,整体结果「非常 mixed」,更多是工具调用与编辑失败。最关键的发现是:在新 SOTA 模型上,你可能根本读不了 transcript(可读性问题成为硬伤)。给想拿掉专用工具做极简 agent 的人泼了盆冷水。
所属事件:mitsuhiko 实测 bash-only 基准:结果喜忧参半(2 条相关)→
「编程与Agent」频道最新
- Reddit 热传 AI 编程 Agent 精选仓库清单,网友整理出直达链接 — alexcovo_eth · 2026-09-22
- 开源无限后室游戏 vackrooms:全程用 Claude 写成 — pablostanley · 2026-09-22
- 给 LLM 建代码库 Wiki,实测输入 token 减半 — kedar5 · 2026-09-22
- 开发者实测:Claude Code Projects 是并行干重活的最佳界面 — daniel_mac8 · 2026-09-22
- 开源项目 QM 发布 v0.1.12:Agent 集群进入 Beta — ycombinator · 2026-09-22
- 类别感知专家训练框架:SWE-bench Multilingual 达 59% — Logics-MLLM · 2026-09-22