开源模型对比评测工具
vista8 · x · 2026-07-12
有人用 GPT 5.6 sol 做了一个“模型 PK 擂台”工具,支持用相同提示词对比多个模型输出。 工具支持 Markdown 渲染以及 HTML/SVG 的显示预览,适合比较文本输出和前端网页样式这类相对简单的任务。 目前题目都是 AI 生成的,后续会继续收集整理 X 网友提供的私藏测试 case。项目已开源,并提供在线体验。
「编程与Agent」频道最新
- 苹果用合成轨迹训练 API 智能体,不再依赖真实环境 — apple · 2026-07-21
- FlashRT:利用智能体优化多模态应用部署,B200延迟降低70倍 — Krish Agarwal · 2026-07-21
- 字节 SWE-Pruner Pro 给编码智能体省 39% token 还不掉点 — ByteDance · 2026-07-21
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21
- MIT 博士生称递归语言模型或重塑编码智能体设计 — ctjlewis · 2026-07-21
- Reddit 用户设计四层本地 AI 机房:vLLM 到 OPNsense 全分层 — povedaaqui · 2026-07-21