开发者的算账:100 次 eval 只花 20 美元,说明题目太简单
pvncher · x · 2026-09-23
开发者 pvncher 在讨论中指出:如果你的 eval 跑 100 次只花 20 美元,那这个评测集可能还不够难——高难度问题的评测成本应当显著更高。这条评论回应了关于新模型定价调整(告别 Ultra/Xhigh/High 等档位)的讨论。
「编程与Agent」频道最新
- Jev 能为图形模型写规范?概率推理范式或迎新组合 — blaizedsouza · 2026-09-23
- Jev 定位讲解:规则代码与 LLM 之间的语义决策层 — blaizedsouza · 2026-09-23
- 用 Claude 形式化验证 Agent SDK:几条 prompt 产出 16 个修 bug PR — shyamalanadkat · 2026-09-23
- 从 0 到 1 用 AI 做产品 Launch Video,附保姆级教程与提示词 — Aiden_Tech_Ai · 2026-09-23
- 19 岁学生用 Claude Code 两天写出套利机器人,自称已赚 75 万美元 — Aiden_Tech_Ai · 2026-09-23
- 开发者空中远程派活:Codex Remote 随时下发任务让他连连惊叹 — Dimillian · 2026-09-23