GPT-5.6 Terra 准确率 93.7% 因完整度低排第 10
MaziyarPanahi · x · 2026-08-22
针对 Wisedocs MLCR 医疗长文本推理基准,作者分析了模型表现。虽然 GPT-5.6 Terra 模型在报告内容的准确率达到 93.7%,但由于“完整度”指标较低,导致综合排名仅列第 10。评论指出,在临床 AI 中,遗漏细节与错误的后果同样严重。
「模型」频道最新
- Claude Security 现由 Mythos 5 驱动,支持跨文件漏洞追踪 — claudeai · 2026-08-22
- Ox Alpha 模型实测:在 Pi Harness 中表现惊艳 — omarsar0 · 2026-08-22
- LLM 生成诡异文本,疑是合成数据中的自我对话 — ctjlewis · 2026-08-22
- Ornith 1.5 35B上线RunInfra:缓存后输入约每百万$0.02 — alejandroll10 · 2026-08-22
- 开发者质疑 Ox-alpha 模型表现,或为营销噱头 — bindureddy · 2026-08-22
- SemiAnalysis 深度:开源模型正在追上闭源前沿模型吗? — JosephJacks_ · 2026-08-22