用 25 年个人文字训练 AI 当「读者」而非模仿者,75 万词语料复盘
UnionPacifik · reddit · 2026-09-25
作者把自己 1995 年以来的全部文字(博客、新闻稿、邮件、Reddit 评论、旧推文、Instagram 文案甚至 ChatGPT 对话)整理成 7.5 万条记录、660 万词的语料库,但不做「模仿自己」的 bot,而是构建一个诚实的「读者」。技术要点:
- 用 RAG 为主、Graph RAG 为主干——平铺切块会丢失相隔多年条目间的关系
- 索引前对私人姓名做匿名化(每人固定一个字母代称,保持 20 年跨度的可识别性)
- 短内容(推文)与长文分开切块,混切检索效果差
最大难点是对抗所有前沿模型默认的「乐于助人」倾向,让它只是客观汇报而非讨好。效果出乎意料:问自己最大的缺点,它直接引用了作者 2019 年写下的一句话并展开他自己都未自觉的论证。作者认为「反思/内省型」AI 是被商业产品忽视的方向。
「编程与Agent」频道最新
- Eleanor Berger 免费课:使用 Agentic Factory 最常犯的五个错误 — intellectronica · 2026-09-25
- aeon 语言用类型与逻辑给 Agent 设护栏,拒跑不合理的计划 — dscape · 2026-09-25
- 独立开发者用 Cloudflare API 给 SaaS 客户自动子域名绑定 — gregmushen · 2026-09-25
- Only Then Labs 推出 ProofPress,让研究证据跨 Agent 交接 — tallmetommy · 2026-09-25
- 开发者开源 Jev 推理实验笔记本:模型路由与对抗性同行评审实验 — arthurcolle · 2026-09-25
- mitsuhiko吐槽Opus 5.5总爱用bash改文件,想写扩展强制阻止 — mitsuhiko · 2026-09-25