DeepSeek V4 Flash 自验证扩展跑赢 Claude,成本仅十一分之一
TheZachMueller · x · 2026-08-18
Terminal-Bench 2.1 实测显示,用 DeepSeek V4 Flash 采样 5 个候选解、再由同一模型用 LLM-as-a-Verifier 排序,准确率从 79% 提升到 88%,以低廉成本超越闭源前沿模型 Claude Fable 5,成本约为其 1/11。
@tokenbender 评论指出:这不算 alpha,而是很好的杠杆化 beta——「每美元智能」只有在企业拥有可信的评测集时才有真实价值,而几乎所有企业都没有;因此他与创始人的对话 90% 是先帮忙建一套 100-200 条的代表性评测集。
所属事件:DeepSeek V4 Flash 自验证 scaling 以 1/11 成本胜 Claude Fable 5(5 条相关)→
「编程与Agent」频道最新
- SemiAnalysis 开源 300 万美元 AgentX 基准,百万上下文测 AI 编程 — AccBalanced · 2026-08-24
- AI 智能体前沿:从真实世界经验中自我演化 — sujingshen · 2026-08-24
- 面向小企业的 AI WhatsApp 助手,该选什么技术栈? — aarondiaz92 · 2026-08-24
- RAG 新趋势:双阶段文档处理平衡成本与精度 — llama_index · 2026-08-24
- Fabien 分享 agent.md:改进 LLM 辅助代码质量的工作流 — Thrumpwart · 2026-08-24
- 低显存 Qwen 3.8 27B 用户常用插件与技能讨论 — radlinsky · 2026-08-24