DeepSeek-Vision 实测:千字图片压缩至 330 token 但有词义偏差

多位用户实测 DeepSeek-Vision 的图像压缩与 OCR 能力。对包含约 1000 token(783 词)文本、分辨率为 1544x1630 的图片,模型可压缩至约 330 token,大幅降低 token 消耗。但在代码截图识别测试中,OCR 结果出现 3 处非微小的词义偏差,显示压缩与识别的准确性仍有局限。

2026-08-22 ~ 2026-08-22 · 2 条相关