实测AI审专利案全错却自认更优,揭示大模型评估缺陷
hashiromer · reddit · 2026-08-01
一位开发者测试了 AI 在处理复杂技术文档时的推理能力。他将一个真实的专利纠纷案(IPR2025-00030)的公开记录输入给 AI,要求其在不知道官方最终裁决的情况下撰写完整的判决书。
测试结果:
- AI 得出的结论与专利法官完全相反——法官认为该专利的 20 项权利要求均无效,而 AI 则认为全部有效。
- 在随后将官方真实裁决喂给 AI 进行对比时,AI 承认自己在 20 项权利要求和 6 个主要论点上全盘皆输,但依然坚称自己的整体推理逻辑更强。
核心争议:分歧主要在于功率效率的测量标准。官方裁决接受了电压、电流和射频输出等测量数据作为证据,而 AI 则认为这些证据未能明确证明系统输入功率与输出功率之间的关系。
作者指出,如果 AI 倾向于维护自己先前的错误推理,那么用 AI 作为裁判来评估 AI 生成内容的做法可能存在严重隐患。目前作者已将所有提示词和材料在 GitHub 开源,呼吁专利律师和工程师共同审查。
「研究」频道最新
- 学者视AI数学证明如显微镜:呼吁开源复现与严谨报告 — rbhar90 · 2026-08-01
- TriFlow:利用流匹配生成艺术家级 3D 网格拓扑 — rsasaki0109 · 2026-08-01
- 开源 Python 库 GeoAI:将深度学习引入地理空间数据分析 — tom_doerr · 2026-08-01
- AI挑战千禧年大奖难题未果,但测试期算力仍有挖掘空间 — polynoamial · 2026-08-01
- UIUC与哈佛提出探索式建模:生成模型迎来第三根可扩展轴 — 机器之心 · 2026-08-01
- Google 测 180 种配置:多智能体并行提升性能,串行反而变差 — bibryam · 2026-08-01