生物序列 OCR 踩坑:AI 也会把蛋白质序列抄错
iskander · x · 2026-09-07
Boolean Biotech 博主 btnaughton 发文讨论 OCR 处理生物序列(核酸、蛋白质)的坑:
- 生物序列动辄数千字符、重复度高,且常以图片形式嵌入扫描 PDF 或论文图中;一个字符错误就毁掉整条序列,不像自然语言 OCR 错误可容忍。
- 专利是序列最丰富但 OCR 问题最严重的来源:抽样 100 份专利 PDF(四个年代各 25 份),11 份完全无可提取文本(纯图片),且全部是近五年发表的。
- 实例:WO2017040932A1 中 SEQ ID NO: 22 的 Q 被认成 O;US11965030B2 中 Gln 两处被写成 GIn。更意外的是,多数不可能序列的错误其实源自 PDF 原件本身就有 typo,而非 OCR 引入。
- Google Patents 的 HTML OCR 版本同样存在错误,需对照 USPTO 认证的原始 PDF。
「研究」频道最新
- 三篇扩散模型论文将亮相 ECCV:Flash-BoN、PAFM 与 DynEval — RisingSayak · 2026-09-07
- MIT 博士答辩「物理约束生成式设计」,何恺明任答辩委员 — Scobleizer · 2026-09-07
- 咖啡粉变数据集:Doppio 用视频无接触估算下落颗粒重量 — rsasaki0109 · 2026-09-07
- OR-Clarify 基准:优化建模前先向 AI Agent 提问澄清 — AIOR-Research · 2026-09-07
- 学生博主详解关键词唤醒模型:为何不用转写也能低功耗听「Hey Siri」 — cneuralnetwork · 2026-09-07
- 奖励模型太烂是主因:开发者剖析模型作弊源于 eval awareness 与虚假相关 — secemp9 · 2026-09-07