质疑 Gemini 如何判断模型是否退化
ngxson · x · 2026-08-15
网友提出了一个关于模型能力感知的问题:如果 Gemini 的回复本身并不比其他前沿模型更出色,那么用户究竟能通过什么标准来判断模型是否发生了能力退化(degraded)?这引发了对模型表现评估主观性的讨论。
「模型」频道最新
- 用户吐槽:ChatGPT Sol Pro 思考超一小时仍未回应 — gregmushen · 2026-08-15
- Qwen3.8 27B 家用实测:仅需电费成本性能比肩Opus — daniel_mac8 · 2026-08-15
- OpenRouter 数据:各任务支出 Top 1 模型分布 — airesearch12 · 2026-08-15
- Atomic 发布 Qwen3.8 27B 动态量化:1-bit 仅 8.5GB,16GB MacBook Air 可跑 — testingcatalog · 2026-08-15
- 爆料:Anthropic 内部有远超 Mythos 5 的模型未发布 — Neurogence · 2026-08-15
- 实测3款模型为本地AI大脑安装写规格:一个引用真实文件,一个记错macOS兼容性 — schwentker · 2026-08-15