Burkov:处理无人做过的新任务,LLM 欺骗你的概率有多高
burkov · x · 2026-10-02
机器学习畅销书作者 Andriy Burkov 提出一个推断式观点:如果对某个 LLM 输出做错误率测算,再外推到“没有任何人类已有信息可依据”的任务场景,得到的百分比就是你在做前人未曾涉足的工作时,被 LLM 误导的时间比例。核心提醒:LLM 在有大量人类资料支撑的领域表现尚可,但在真正新颖的问题上,幻觉率意味着其输出必须高度存疑。
「模型」频道最新
- 网友观察:Opus 5.5 频繁使用「himbo」一词,系历代 Claude 首见 — repligate · 2026-10-02
- Ramp 数据显示企业 AI 支出首次下降,开源模型占比不足 5% — PaulYacoubian · 2026-10-02
- 神秘新模型 Fledge Alpha 被扒:多项线索指向 Thinking Machines Lab — cephaloform · 2026-10-02
- Ivo 开源合同模型 Sage:从 70% 提到 91%,成本低于竞品 — ibab · 2026-10-02
- 标榜 frontier 的 Gemini 4 Argon,分析榜仅第 48、表达榜第 59 — AbjectMycologist614 · 2026-10-02
- Artificial Analysis 编码 Agent 指数新增安全拒答与降级模型分析 — ArtificialAnlys · 2026-10-02