研究者提议预训练加入「暂停思考」辅助目标与群体 CoT 机制
QuintinPope5 · x · 2026-09-13
Quintin Pope 在讨论中提出两条训练思路:
- 预训练阶段可加入「暂停思考当前输入含义」的辅助目标:模型提前对文本段落持续写出预测,再用 RL 按高层准确性打分,迫使模型在推理时主动停下来推敲输入
- 结合上下文,他描述了一种「群体扩容」的 scaling 方式:多个 swarm 成员通过文本互相通信,本质是读写一组共享的并行思维链(类似留言板),这也是为什么 Astra 给子代理的指令可以压缩成难以辨认的速记
这是对 scaling 与训练目标的 speculation 性质讨论,尚无实验支撑,但对预训练与 agent 架构设计有启发性。
「编程与Agent」频道最新
- AFK Pilot:用手机浏览器远程操控 Grok、Codex 与 Claude Code — PawelHuryn · 2026-09-13
- AI 工程师学习路线:先做项目,再自顶向下深挖补基础 — ashishllm · 2026-09-13
- 开源 Forma:用 AI 从图片 PDF 自动生成 DevExpress 报表布局 — waqarsyd · 2026-09-13
- 15天给 Hermes Agent 加50项能力:从聊天框变成个人操作系统 — Teknium · 2026-09-13
- 用 Virtual Runtime 网关统一治理 Agent 的 MCP 流量 — bibryam · 2026-09-13
- SmolVM 开源:给 AI Agent 一台毫秒级启动的安全持久虚拟机 — aniketmaurya · 2026-09-13