Cactus 用 Gemma 4 置信度分流,云端调用仅占 15%–55%
GlennCameronjr · x · 2026-07-29
Cactus 的做法是给 Gemma 4 做后训练,让它对每个提示词先输出一个置信度分数。
- 置信度高时,本地直接处理。
- 置信度低时,再路由到更大的云端模型。
- 按不同领域基准,实际触发云端路由的比例只有 15%–55%。
这条帖子更像一个实用的混合模型路由思路摘要,不是完整技术细节。
「模型」频道最新
- 研究者实测:ChatGPT Ultra 长任务表现已超越 Pro 模式 — arankomatsuzaki · 2026-08-24
- 吐槽Google:Gemini 3.7发布一周仍未接入自家Jules智能体 — brandon_galang · 2026-08-24
- Qwen 27B 3.8 极低量化实测:Q3 XXS 可用 — jeremyckahn · 2026-08-24
- 用户反馈 GPT-5.6 近期输出质量显著变化 — haider1 · 2026-08-24
- Ramp 统计 Anthropic 模型使用占比:Opus 4.8 最受青睐 — vista8 · 2026-08-24
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24