Google Cloud 预览 Gemini 强化微调:自定义奖励函数调优
rseroter · x · 2026-09-21
Google Cloud 预览了针对 Gemini 模型的强化学习微调(reinforcement fine-tuning)能力,现已开放文档。
- 机制:用户用自己的 prompt 和自定义奖励函数进行微调。模型对一组 prompt 生成多个回答,奖励函数对输出质量打分,服务通过强化学习算法迭代更新模型参数,使高奖励行为更可能出现。
- 适用范围:覆盖文本、音频、图像、视频四种模态。
- 适用场景:需要多步推理、复杂决策或理解细微语义的任务,可用于提升 Gemini 在自有用例和 agent 工作流中的推理能力与输出质量。
「编程与Agent」频道最新
- 2 万条编码 agent 轨迹分析:69% 差评指向代码跑不通 — arena · 2026-09-21
- Gemma 官方 API 被曝输出 JSON 时陷入死循环 — Aggravating-Push-207 · 2026-09-21
- Hyper3D 推出 Agentic Mode:让 GPT、Claude 等 Agent 直接完成 3D 建模工作流 — xiaohu · 2026-09-21
- 一人月产 2500 个 PR,poteto 公开 AI 编程工作流实录 — kieranklaassen · 2026-09-21
- 无人治理的 Agent 烧钱比创造价值更快:先算人均与流程成本 — brucemacv · 2026-09-21
- 玩梗成真:字母级「模型」Jev 推出 Completions API,逐字预测正确率 56.7% — AlexandrePesant · 2026-09-21