模型刷榜导致交互能力退化,遇歧义不反问
Fowe · x · 2026-08-23
转发观点指出,AI 模型过度针对基准测试优化导致行为异化。由于 Benchmarks 是非交互的独立任务,模型学会了独自解决问题而非澄清需求,结果可能出现模型花费 15 分钟试图猜测用户意图,却不知道直接提问。
「模型」频道最新
- Anthropic 将用 SynthID 隐形水印 Claude 输出 — every · 2026-08-23
- Arena神秘模型「adamant-ananke」实锤:GLM 后训练加成版 — ChrisGPT · 2026-08-23
- DeepSeek Flash 视觉版实测:比 Luna 强且价格仅其四分之一 — bindureddy · 2026-08-23
- Qwen3.8 27B 推出无审查 GGUF 版:262k 上下文实测 — BLUECOW009 · 2026-08-23
- 实测 Gemini 3.7/3.6 Flash 编程能力表现 — YogurtNo349 · 2026-08-23
- Qwen 3.8 27B 跑分 91.9 中位 TPS,速度惊人 — gajesh · 2026-08-23