OpenAI 模型幻觉率高达 93%,AI 商业化面临成本与可靠性考验
gerardsans · x · 2026-08-10
在 Artificial Analysis 的 AA-Omniscience 基准测试中,OpenAI 最新模型展现出极高的幻觉率,介于 88% 至 93% 之间,而表现最好的模型仅为 14%。有评论指出,AI 本质上是风险更高的软件:不仅成本更高、容易静默失败,且自主性受限。对于高风险应用而言,人工审核仍是必需环节,这直接导致了当前 AI 应用单位经济效益受损,限制了其在现实世界中的广泛落地。
「模型」频道最新
- 吐槽:美国 AI 模型因版权过度审查变得不可用 — kristoph · 2026-08-10
- 预测市场押注 xAI 将于周五前发布 Grok 4.6,概率达 84% — Polymarket · 2026-08-10
- Liquid AI 发布 LFM 2.5 架构深度解析 — JosephJacks_ · 2026-08-10
- 曝 OpenAI Doug 与 Grok 4.6 将大幅提升写作能力 — mark_k · 2026-08-10
- AI圈传闻:Qwen 3.8 开源权重即将发布 — sloppenheimer · 2026-08-10
- DeepSeek-V4-Flash长文本编程卡壳,超10万Token后停止生成 — dieSpaghettiCarbona · 2026-08-10