提取 500GB 个人数据训练本地模型,作者开源完整工具包
BLUECOW009 · x · 2026-08-21
- 核心实践:作者提取了自己 8 年来的数字足迹(33,000 次 AI 会话、12,000 次聊天、8 年日记、2 万条推文、400 个代码库、浏览器历史等),总计 500GB 数据,用于训练本地模型。
- 工具发布:作者开源了「AI Coding Assistant Training Data Extraction Toolkit」,支持从 Claude Code、Cursor、Codex 等工具中自动提取完整的对话历史、代码上下文、工具调用记录和 Diff 数据。
- 发现与结果:文章描述了在如此庞大的个人数据上训练本地模型后发生的「怪事」,并提供了可复现的流程链接。
「编程与Agent」频道最新
- Anthropic 发新 Cookbook:Claude Managed Agents 接入 AG-UI 协议 — EricBuess · 2026-08-21
- NanoClaw 接入 Slack,支持 Agent 协同与自托管 — rohanpaul_ai · 2026-08-21
- Vercel 揭秘 v0 如何在不暴露令牌的情况下认证 Snowflake — cramforce · 2026-08-21
- 开源 Codex 技能:自动配置安卓掌机模拟器环境 — Dimillian · 2026-08-21
- 实测 Grok Bot 接管 5 家公司业务:能像人一样操作网站 — PrajwalTomar_ · 2026-08-21
- 用 Codex 快速编写 Mac 键位映射工具解决特定痛点 — aniketapanjwani · 2026-08-21