Jev mode 玩出新花样:让 llama.cpp 直接用图像当提示词做选择

opUserZero · reddit · 2026-09-29

Codacus 为 llama.cpp 实现了 Jev mode(约束解码),作者把这一概念扩展到图像:搭了一个带图像支持的 agent 与 harness,让模型的受约束输出直接是对图像的选择,跳过解码/生成描述的步骤——没有 caption 中间停顿,直接基于单张或一组图像做决策。

典型用法:对一批图像问同一个问题做分类;或给上下文 20 张图,问「哪张里有橡皮鸭」让它挑出来。PR 与 YouTube 演示视频已公开。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →