TensorSharp 开源框架支持单请求混合文档/图像/视频/音频证据
fuzhongkai · reddit · 2026-09-27
作者扩展了开源推理框架 TensorSharp 的 Jev 兼容 /v1/systemone 端点,让一次决策请求可同时携带多种媒介证据——例如事故分诊请求可附带文字报告、仪表盘截图、屏幕录像和来电音频。
帖内给出完整 Python 示例(inline Base64 编码),要点包括:
- files 数组按文件扩展名分类附件,也可用独立的 documents/videos/audios 数组
- 视频被抽帧后送视觉塔;音频由单独配置的语音识别服务转写(TSJEVTRANSCRIPTIONURL),模型不直接处理音频波形;图像/视频需视觉塔支持
- inline Base64 计入 8 MiB 默认请求体上限,更大的媒体应走上传 API + 文件引用
repo 还提供了可直接发送的混合媒体请求示例。
「Infra」频道最新
- 托管推理三大迷思:单价不是账单、端点不可互换、自建未必省 — TangeloOk9486 · 2026-09-27
- Salesforce 提出随机驱逐 KV Cache,不挑不拣反而不输精挑细选 — jiqizhixin · 2026-09-27
- 4GB 显存笔记本靠 SSD 流式跑 35B 模型,反超 GPT-OSS 20B — ImBadGuyInEveryStory · 2026-09-27
- 自研 CUDA kernel 拿下 B200 最快 QR 分解,作者复盘串行依赖破解思路 — A_K_Nain · 2026-09-27
- 智库学者反数据中心抗议者现场交锋,为算力建设辩护 — neil_chilson · 2026-09-27
- Kafka 上生产才见真章:分区倾斜与消费滞后成大坑 — goyalshaliniuk · 2026-09-27