Gemma 4 31B 单卡 4090 跑结构化带概率判题,typevet 连收据照片一起核账
One_Temperature5983 · reddit · 2026-09-30
作者开源了 typevet(MIT,Python 3.12):不靠采样和解析,直接组合 Gemma 4 的原生对话、用「空思考 prefill」结尾,只读允许答案 token 的下一 token 分布,对是非题/单选/评分题返回每个选项的概率;图片以 base64 走 llama.cpp /completion 的 multimodaldata 字段,vLLM 走 imageurl,另有 JSON Schema 校验路径。
收据实测(CORD v2 的 6 张真实收据 × 3 类合成报销单,「匹配/不匹配/证据不足」三选):
- 金额正确:纯文本 6/6 判对,带照片 6/6
- 两位数字调换:纯文本 0/6(甚至 0.99964 概率说匹配),带照片 6/6 抓出(≥0.99998)
- 数字打码:6/6 正确弃权
- 每张照片使 prompt token 增加 228–1108,并以此校验图片确实送达
托管端:同一代码跑 vLLM 0.30.0 + BF16 Gemma 4 31B(单张 H100),18/18 通过,调换标签顺序零翻转;Banking77 480 条双问题上,单并发中位 0.24s/条,64 并发达 39.6 条/s、零错误。
作者也梳理了先例(TypeLLM、allanbbo 的脚本、VQAScore),差异点在于:做成库、31B 单张 24GB 卡跑通、llama.cpp/vLLM 同代码、图片送达校验。局限:仅 18 条单轮测试,概率未校准。
「编程与Agent」频道最新
- Replit 上线应用漏斗分析,一句话让 Agent 生成数据仪表盘 — amasad · 2026-09-30
- Compound Engineering 3.30 发布:改写 skill 文案抑制模型过度建设 — kieranklaassen · 2026-09-30
- Lovable 应用可部署进企业 Microsoft 租户,直连 M365 数据 — satyanadella · 2026-09-30
- OpenAI Codex 负责人现场按下 Reset 按钮,迎来一次重置 — Xianbao_QIAN · 2026-09-30
- 预测:agent 时代人类不再写代码画画,编辑器没有未来 — akbirthko · 2026-09-30
- 用 vLLM 响应模板把 DiffusionGemma 变成结构化打分器 — bodonoghue85 · 2026-09-30