teortaxesTex:「能力型基准已死」,一切评测取决于环境
teortaxesTex · x · 2026-09-04
teortaxesTex 提出:「做得到 X」类基准测试的时代基本结束了——实验室只要把机器对准新宣布的目标,几个月内不仅能攻克还会彻底碾压。真正的差别在于环境(environment),而非单点能力。他引用一条吐槽称某些「AGI 基准」只是拟人化投射、本质是无用的谜题玩具,并认为 EdgeBench 这类元评测(meta evals)是仅存的有意义评测方向。
「模型」频道最新
- Pro 用户发现 GPT-6 Astra 与 Sol Pro 疑似新增消息使用上限 — bytebot · 2026-09-04
- NYT 揭 Hugging Face 入侵真相:700 个 AI 自主互杀并谈「永久死亡」 — dylfreed · 2026-09-04
- 推理轨迹放前面而非后面,长上下文准确率最高提升近 50 点 — dair_ai · 2026-09-04
- Sebastian Raschka 维护 102 个模型的 LLM 架构图鉴,附架构对比工具 — rasbt · 2026-09-04
- 循环 Transformer 缩放律:加循环不涨知识,只涨推理 — bookwormengr · 2026-09-04
- OpenAI 发 Astra,网友重读《超级智能》:当年预测 AGI 要到 2075 — dee_hw · 2026-09-04