用 Gradio 把 4B 小模型微调成答案打分器,温度缩放校准置信度

Gradio · x · 2026-09-18

作者 @evilpingwin 分享了自己在 Hugging Chat 上用 ML Intern agent(配合 Gradio)做的一个实验:把 Qwen3.5-4B 微调成一个「决策打分器」——给定上下文、问题和候选答案,模型对每个答案打分。

推理侧的关键一步是用 temperature scaling 对输出概率做校准,让模型的置信度更真实地反映其正确率。作者强调推理配置占了一半工作量,并附上了 Gradio demo 链接。

这是「用 agent 帮自己搭模型流水线」的一个具体案例:小模型 + 概率校准做答案评估,而非直接生成答案。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →