从业者痛批:AI 评测机构普遍缺乏基本软件工程规范
evijit · x · 2026-08-09
AI 研究者 evijit 在整理评测数据时吐槽,指出当前众多 AI 评测机构普遍存在糟糕的软件工程实践问题。作者强调,尽管评测结果是当前大量 AI 政策讨论的基石,但许多机构连最基本的版本控制和可复现性都未能保证,这严重影响了评测的可靠性。
「研究」频道最新
- 大模型攻克无线通信领域 25 年悬案,AI 证明能力再突破 — DimitrisPapail · 2026-08-09
- SWE-bench 作者复盘:AI 编程正抛弃复杂脚手架 — jyangballin · 2026-08-09
- 开源知识图谱构建工具:支持多模型与可视化 — tom_doerr · 2026-08-09
- 别只顾着写提示词:探讨AI创作的「训练美学」 — pixlpa · 2026-08-09
- ACM 文章探讨 AI 原生系统:核心在于修改权而非含 AI 量 — tianyin_xu · 2026-08-09
- 仅用图像监督训练,确定性模型实现极速原子生成 — pixlpa · 2026-08-09