Gemma 4 31B 单卡 4090 跑结构化带概率判题,typevet 连收据照片一起核账

One_Temperature5983 · reddit · 2026-09-30

作者开源了 typevet(MIT,Python 3.12):不靠采样和解析,直接组合 Gemma 4 的原生对话、用「空思考 prefill」结尾,只读允许答案 token 的下一 token 分布,对是非题/单选/评分题返回每个选项的概率;图片以 base64 走 llama.cpp /completion 的 multimodaldata 字段,vLLM 走 imageurl,另有 JSON Schema 校验路径。

收据实测(CORD v2 的 6 张真实收据 × 3 类合成报销单,「匹配/不匹配/证据不足」三选):

托管端:同一代码跑 vLLM 0.30.0 + BF16 Gemma 4 31B(单张 H100),18/18 通过,调换标签顺序零翻转;Banking77 480 条双问题上,单并发中位 0.24s/条,64 并发达 39.6 条/s、零错误。

作者也梳理了先例(TypeLLM、allanbbo 的脚本、VQAScore),差异点在于:做成库、31B 单张 24GB 卡跑通、llama.cpp/vLLM 同代码、图片送达校验。局限:仅 18 条单轮测试,概率未校准。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →