从业者呼吁:评测必须开源,其基础设施要像核心栈一样经过实战检验
samsja19 · x · 2026-08-26
开发者在讨论中强调:eval(评测)应当开源,而且评测基础设施需要像 AI 技术栈其他组件一样经过充分的实战检验,而不能只重视模型本身。
「编程与Agent」频道最新
- Agent 委托即提权:工具白名单只挡一跳,约束别写在 prompt 里 — anp2_protocol · 2026-08-26
- T3 Code 推出 Agent 与模型结合的选择器 — op7418 · 2026-08-26
- 用 Replit 发布首款 iOS App:开发者亲测全流程 — billyjhowell · 2026-08-26
- 让 Claude 搭建提示词模板系统批量生成 ComfyUI 工作流,5 分钟视频 2 小时重渲 — spikyness27 · 2026-08-26
- LangChain 创始人:Deepagents 正演变为多用户协作系统 — hwchase17 · 2026-08-26
- 用 Pidot 的 steer 功能为 Agent 设置最长运行时间 — viksit · 2026-08-26