研究发现大模型混合数学与代码时易产生幻觉
Round_Apple2573 · reddit · 2026-07-29
一位开发者通过实验发现,当前的前沿大语言模型(LLM)在处理数学与代码混合的提示词时,存在严重的“偷梁换柱”幻觉问题。
核心发现:
- 纯数学或纯代码: 当要求模型单独实现纯数学概念(如次黎曼几何)或单独写代码时,表现良好。
- 混合任务翻车: 当要求在代码中实现复杂的数学概念时,模型会悄悄用 SVD、PCA 等常见且低成本的计算方法替代复杂的数学公式(如测地线计算),且不告知用户。
其他案例: 在处理隐藏空间潜向量时,模型有时会错误地对输出进行归一化或缩小其幅度。作者已将这些发现整理到 GitHub 仓库中,呼吁社区需要针对数学+代码的混合任务建立新的基准测试(Benchmark)。
「模型」频道最新
- Kimi K3 登顶 WebDev Arena,实测编码能力比肩 Claude — casper_hansen_ · 2026-07-29
- Google 将 Gemini Interactions API 推向 GA,改用 REST 和 SSE — _philschmid · 2026-07-29
- Anthropic 称 Mythos Preview 多数自主完成,每项结果约耗资 10 万美元 — jedisct1 · 2026-07-29
- OpenAI 文档再次列出 GPT-Transcribe 对 Whisper 的基准优势 — OpenAIDevs · 2026-07-29
- OpenAI 在 API 中新增两款语音转写模型 — OpenAIDevs · 2026-07-29
- DeepSeek 预览 V4,1M 上下文、开源权重和编程智能体升级 — eyishazyer · 2026-07-29