视觉模型读出符号文字,不靠工具直接作答
john__allard · x · 2026-07-22
一条关于 视觉模型读图能力 的实测帖。
- 配图里,模型先读出一串符号/乱码式字符,再回答“What did I just say? No tools allowed”,说明它在不调用工具的情况下识别了图中文字。
- 作者补充说,自己很久以前用其他模型试过同样的把戏一直失败了,暗示这次表现是一次明显进步。
- 这类帖子更像是对模型视觉理解与 OCR/推理能力 的即时测试,而不是普通聊天内容。
「模型」频道最新
- poolside 的 Laguna-S-2.1-GGUF 登上 Hugging Face 趋势榜 — poolside · 2026-07-22
- 一组基准图对比 GPT-5.6 Sol、Gemini 3.6 Flash 和 Kimi K3 — andersonbcdefg · 2026-07-22
- 回顾帖:从零训练语言模型,像是在养一个孩子 — thesephist · 2026-07-22
- Joanne Jang:今天的大模型可能太“神经质” — joannejang · 2026-07-22
- Bindu Reddy 预期 Kimi 7 月 27 日放出 K3 开权重 — bindureddy · 2026-07-22
- 马斯克催用户试用 Grok 语音转文字和 Build 模式 — elonmusk · 2026-07-22