训练 agent 的诀窍:逼它一直向前倒,代价是学会克制更难
generativist · x · 2026-08-19
作者 generativist 观察到:让模型有 agent 能力的技巧,似乎是迫使它始终「向前倾倒」、不得不持续行动——这确实有效,但副作用是模型更难学会克制、更难停下来。
「模型」频道最新
- Huihui 发布 Qwen3.8-27B 去审查版 GGUF 量化模型 — huihui-ai · 2026-08-19
- 法律AI公司Harvey发布首个自研模型Tenet,基于Kimi K3训练 — meliarobin · 2026-08-19
- 质疑 Qwen3.8 27B 比 Opus 4.5 强,指其为刷榜模型 — scaling01 · 2026-08-19
- Grok 4.6 上线,同性能下价格仅为竞品 20% — kevinnbass · 2026-08-19
- Anthropic 营收涨百倍,老用户吐槽推理稳定性仍无改善 — airkatakana · 2026-08-19
- 「Qwen 3.8 27B 或是迄今最具文明改变力的 20GB 数据」 — IgorCarron · 2026-08-19