前沿 Agent 当审查员:本地 Qwen 3.6 27B 答案 21 道陷阱题过 17 道

AIForOver50Plus · reddit · 2026-10-05

作者在约 5.9 万个自有文档块上运行本地 Qwen 3.6 27B 模型的 Agent,并让一个前沿模型 Agent 专门做事实核查(只审答案、从不作答),周末人工评级结果:

关键教训不在模型本身:一条答案称某 JSON 文件「无法解析」,实际文件干净,是本地 Agent 猜了而不是去读。于是他把流程改为:所有断言(包括每一个「没找到」)都先经前沿 Agent 核查,他只做最终判断。

流水线每周跑:周五重跑、周六核查,只人工审变化部分,每次纠正都存档留作日后微调。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →