开源 xceval 0.4.0 发布:接管编码智能体完整评估闭环
rudrank · x · 2026-07-31
非官方命令行工具 xceval 发布 0.4.0 版本,专为 Apple Evaluations 框架打造。
该工具旨在为开发者或外部编码智能体提供确定性工具,全面接管评估循环:
- 核心功能:自动发现可运行目标、执行代码、检查证据、隔离失败用例、重跑选定样本、与基线对比并强制执行质量门禁。
- 架构设计:智能体本身留在 CLI 外部,xceval 负责提供超时、日志、数据集版本控制及机器可读错误等确定性接口,而最终“什么是好答案”的判断仍交由开发者的 Swift 代码决定。
所属事件:开发者开源 XCEval 助力 Xcode 27 智能体评估(2 条相关)→
「编程与Agent」频道最新
- 开发者用 Claude Opus 扫描代码库,成功揪出 ColdCard 漏洞 — evilsocket · 2026-07-31
- 医疗场景 AI infra 实践:整合自训练与 Agent 自进化 — aigclink · 2026-07-31
- 开源 AI agent 技能包:让人文学者用 Claude Code 做研究 — JeremyNguyenPhD · 2026-07-31
- 4608次测试仅3.3%无需人工干预,中科大实测AI科学家 — 新智元 · 2026-07-31
- 开发者开源 Zeta:基于 Codex 的常驻 Agent 运行时 — remilouf · 2026-07-31
- 单浏览器会话无缝切换三大 MCP 客户端 — Mean-Standard7390 · 2026-07-31