Xbench:把 Twitter 当作 AI 评测器,追踪真实用户用脚投票
thedealdirector · x · 2026-09-06
作者 nicochristie 认为 AI 行业正面临严重的 evals 危机,于是做了 Xbench——把 X(Twitter)上的真实讨论当作滚动评测信号。站点包含:7 天滚动的情绪指标(第一手正/负/中立立场)、用户实际「迁移」记录(从哪个模型/harness 换到哪个)、模型与编码 harness(Codex vs Claude Code 等)的正面对比矩阵与对手调整后的偏好度,以及人们喜欢/讨厌各产品的具体原因,每条数据都链接回原始推文。作者还坦承局限:X 上当前对 Anthropic 的负面情绪会污染其模型口碑;利益相关者(如持有 SpaceX 股票的评论者)吹捧 Grok Bot 的热度可能有人为成分;显示偏好更多跟随价格而非智能——「便宜且够好」胜过「最强但昂贵」。
「模型」频道最新
- GPT-6 Astra 价格仅 0.11 美元,还在测试里画出了独角兽 — zakelfassi · 2026-09-06
- LlamaIndex 实测 GPT-6 Astra:文档抽取 97.2% 创 SOTA,但长文仅 31.7% — llama_index · 2026-09-06
- Hugging Face 工程师:电路板设计成 AI 新图灵测试,3D 生成也在快速逼近 — hugs · 2026-09-06
- 用户投诉 Gemini Astra 超时 10 分钟仍扣除订阅额度 — sharkbaitlol · 2026-09-06
- Astra 推理档位实测:高推理一命令方块造全屋 — hankberger · 2026-09-06
- 用户体验:Astra 语音模式大幅进化,可调度多个会话 — jdjohnson · 2026-09-06