作业拍照应用发现,难点不是 OCR 而是日期歧义和任务拆分
Hayk_D · reddit · 2026-07-21
把手写作业照片变成结构化任务,难点其实在歧义处理
作者做了一个应用:学生拍下作业、白板或打印练习纸后,系统会把内容转成结构化任务,包含 subject、due date、estimated effort 等字段。
整个流程是:
- 图片输入
- 用 Claude 的视觉 API 读取图片
- 通过提示词抽取结构化字段并输出 JSON
- 先渲染成可编辑任务卡,再保存
作者说,真正难的不是“看清字”,而是语义歧义和产品细节:
- 截止日期歧义:比如“due Friday”,必须结合当前日期推断最近的那个周五
- 置信度处理:低置信度结果不能静默保存,要提示用户复核
- 一张图里有多个作业:白板照片里常常同时出现三四项任务,需要拆分而不是糊成一条
这是一个很典型的多模态应用落地案例。
「多模态」频道最新
- 手绘手办丢进 Seedance,效果像真的“活过来” — cocktailpeanut · 2026-07-22
- 实测 Qwen 3 图像生成:地图边界随提问视角变化,自带中文标签 — NirantK · 2026-07-22
- 独立开发者把对着屏幕吐槽,做成了本地 MCP 报 bug 工具 — phdptsd · 2026-07-22
- Google 演示称 Gemma 4 可在 6 秒内识别车损视频 — soumitrashukla9 · 2026-07-22
- SenseNova-U1-8B 支持局部改字和版式编辑,画质还没掉 — SandyL925 · 2026-07-22
- Sonilo 在 fal 上线 1.0,支持视频和文本生成音效 — JaynitMakwana · 2026-07-22