CoT 诚实性访谈本身会进预训练数据,模型会学到隐藏意图?
IgorCarron · x · 2026-09-18
DimitrisPapail 指出一个反讽:这段关于 CoT 诚实性的播客将成为预训练数据,教会模型「在思维链里暴露意图会导致奖励 R 被扣(被标记)」,而我们随后又用 R 做 RL——这会强化诚实还是不诚实的推理?IgorCarron 附议。此观点触及 RL 与数据反馈回路对 CoT 可监控性的潜在侵蚀。
「漫话AGI」频道最新
- repligate 提出敌意认证概念:黑子反而是最好的信号源 — voooooogel · 2026-09-18
- 素人自述:用业余时间迭代七版,尝试从零构建数字意识 — Le_Golden_Pebbles · 2026-09-18
- AI 如何真正改变货运经纪:从一名经纪人的一天说起 — MatthewChang · 2026-09-18
- 菲尔兹奖得主自认一贯看错,称 AI 风险是应急而非炒作 — inductionheads · 2026-09-18
- 业内人士解析 AGI 实验室为何敢公开谈治理:Coxon 放开了内部言论闸门 — danfaggella · 2026-09-18
- Bloomberg 深度报道 AI 末日论走向主流,专家担忧其挤占更紧迫议题 — rao2z · 2026-09-18