Pydantic AI 作者晒图:自研Agent SDK跑Terminal-Bench 2.1得76.40%
samuelcolvin · x · 2026-09-15
Pydantic AI 作者 samuel colvin 转发一条 Terminal-Bench 2.1 实测:使用其 Agent SDK 的 Pydantic AI 适配器配合 Luna High 模型,pass@1 得分 76.40%。作者预告下一步将用 LangChain 适配器跑同一实验对比差异,可作为不同 agent 框架效果对比的参考数据点。
「编程与Agent」频道最新
- 同时跑 12 个做市 bot 实测:时间刷新 vs 距离刷新两种报价源对比 — cardosofede · 2026-09-15
- Claude Code被指隐性浪费token,YC工具称可省35-50% — ycombinator · 2026-09-15
- YC 转发 Turnstone:本地第二大脑驱动的持久 AI 工作区 — ycombinator · 2026-09-15
- OpenAI 称 2 名工程师用 Codex 将 habitat 服务重写为 Rust — imjustnewatai · 2026-09-15
- 韩国国家图书馆开放 MCP 服务,可查 1000+ 公共图书馆实时馆藏 — modelcontextprotocol · 2026-09-15
- Kash.click 用 MCP 让 AI 直连 POS:动嘴记账开票管库存 — modelcontextprotocol · 2026-09-15