一个群聊人格 Agent 会从纠错和反应里自我学习
Xiaole-Dawn · reddit · 2026-07-25
一个会从回复反馈中持续学习的人设群聊 Agent
作者受够了人设 bot 用着用着又退化成“客服口吻”:再怎么调 prompt,聊几轮后还是会变得过于礼貌、爱追问、什么都想兜底。
他的思路不是重新微调模型,而是让 agent 学习“回复之后发生了什么”——
- 如果有人纠正它,纠正内容就可以变成坏例子/好例子
- 如果某次重试效果更好,这轮互动也会被保存
- 如果大家顺着某个梗继续聊,这条回复可能就是一个正向样本
难点在于怎么判断反馈是否可信。作者因此加了一个仲裁层,会看定向反应、反馈来自谁,以及纠正是否合理,再决定是否写入记忆。
这个系统不做微调,而是存例子和偏好对,再在后续对话里以 few-shot 形式检索出来立即生效。
项目还附了一个终端演示,不用先接 QQ/Discord 之类的群聊平台也能试整套流程。
「编程与Agent」频道最新
- img2threejs 让 AI 编程代理直接做程序化 3D 生成 — anselm · 2026-07-25
- Codex 和 Three.js 做出可交互程序化房屋演示 — anselm · 2026-07-25
- Claude Opus 5 提示词经验:旧式 harness 习惯开始浪费 token — tengyanAI · 2026-07-25
- T3 Code 一周合并 76 个 PR,加入 Opus 5 和自动审批 — TAbrodi · 2026-07-25
- 一个编程 agent 跑了两条命令,又把事实存进记忆 — sull · 2026-07-25
- 一个编程 agent 面板追踪 19 亿 token 和 2595 美元支出 — zeeg · 2026-07-25