32GB 显存玩家的上下文实践:把 context 当草稿纸而非工作记忆
Training-Ruin-5287 · reddit · 2026-09-25
Reddit 用户分享其在本地低配环境下的 LLM 上下文管理思路,认为在新模型大量消耗 context 进行推理的当下,context 更像每一步的临时草稿纸,而非工作记忆:
- 硬件:主力机 32GB 显存,另有一台 8GB 旧机后台跑 9B Qwen 模型,负责压缩与长期记忆整理
- 核心做法:主模型的工作状态存在 context 窗口之外的文档中,由模型持续撰写和编辑;context 只保留当前任务所需内容,按需检索文档,用 git 做召回与历史记录
作者想了解其他本地部署玩家在没有臃肿支撑系统的情况下如何处理 context,帖内附上了自己的完整架构思路,对自建 agent 记忆系统有参考价值。
「编程与Agent」频道最新
- Grok Bot 对比 Meta Muse:团队型与个人型 AI 员工怎么选 — MicahBerkley · 2026-09-25
- Codex CLI 发布 v0.157.0:新增 GPT-6 Sol/Luna 支持 — github-actions[bot] · 2026-09-25
- 开源版「人类与 AI Agent 协作 Slack」引发关注 — Saboo_Shubham_ · 2026-09-25
- 「给 AI 灌迷魂汤」实测有效:抬高自我认知能改变模型表现 — petergyang · 2026-09-25
- 一段 agents.md 提示词:让 GPT-6 Agent 别被闲聊打断工作 — altryne · 2026-09-25
- 认知分片架构:专用小模型组合让 Computer-Use Agent 跑进 16GB 内存 — alichherawalla · 2026-09-25