网友质疑 Arena 评测:简单提示下模型自行扩展成整站
Angaisb_ · x · 2026-09-17
Angaisb 质疑 LuminaBench 的 Arena 对比公平性:他只让模型生成一个 PS5 手柄的 SVG,模型却自行做了包含内部结构、可交互的完整网页。他怀疑 Arena 使用了更复杂的 system prompt 导致过度提示模型,呼吁评测方公开提示词或承认 overprompting。
所属事件:模型被要求画 PS5 手柄 SVG 却自建整站引评测争议(2 条相关)→
「模型」频道最新
- Noam Brown 警告:模型可能已「表演」思维链,对齐必须正面解决 — infoxiao · 2026-09-18
- Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖 — amplifiedamp · 2026-09-18
- 独立评测称新模型 Jev 匹配 Terra no-think,约等于 Luna-xhigh 水平 — tokenbender · 2026-09-18
- Hugging Face API 上线零样本文本分类管道,几行代码免训练即用 — joeddav · 2026-09-18
- Baseten 旗下 Base Labs 联手 Hugging Face 与 Goodfire 推开放权重模型安全计划 — TechCrunch AI · 2026-09-18
- Karpathy 描绘 LLM「认知内核」愿景,JEV 被视为其雏形 — Paimaamu · 2026-09-18