研究者推自认证训练排行榜,提交者自担验证成本
pratyusha_PS · x · 2026-10-02
作者介绍了一套自调节的 "auto-certified" 训练运行排行榜机制:无需单一机构承担全部认证与审查负担,提交论文或训练运行的主体自行承担验证成本,每次通过认证的运行都可成为公开 baseline。
团队已开放试用入口,希望收集社区反馈。这一思路试图用去中心化的方式解决 AI 研究结果可信度问题。
所属事件:研究者推出自认证训练排行榜 分散验证负担(2 条相关)→
「研究」频道最新
- NVIDIA Mid-Harness 论文:模型与 Harness 之间加验证层,终端 Agent 成功率升至 68% — rohanpaul_ai · 2026-10-02
- NVIDIA 论文:终端 Agent 加个强验证器,成功率从 50% 升至 68% — rohanpaul_ai · 2026-10-02
- JevBench 将扩充评测:LLM 路由、RAG 检索与内容审核任务 incoming — airesearch12 · 2026-10-02
- 新范式神经符号化计算机操作:让 Agent 学会肌肉记忆,成本降 99% — xwang_lk · 2026-10-02
- 「旗帜游戏」论文:智能体群凭碎片协作推理,探索群体动力学 — Hidenori8Tanaka · 2026-10-02
- 从 Spark 到 Databricks:Matei Zaharia 的伯克利创业飞轮 — jfiance · 2026-10-02