GPT爱造术语?作者自曝是其注入的后训练数据
charliermarsh · x · 2026-07-20
有开发者观察到 GPT 模型在分析代码库时,喜欢生造极其冗长晦涩的专业术语(如“cycle aware pinned buffer remapping”)。
Charlie Marsh 对此回应澄清:如果模型输出了这类词,并不是它在胡编乱造,而是因为他本人特意将这些术语添加到了模型的后训练(post-training)数据集中。这揭示了后训练阶段的数据注入会直接影响模型生成代码时的表达习惯和用词偏好。
「模型」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 2026 IMO 上拿到 30/42 — NVIDIAAI · 2026-07-22
- Gemma-4-26B-a4B 传在微调对比中压过 Qwen MoE — JLeonsarmiento · 2026-07-22
- OpenAI 传将向美国政界简报下一代模型家族 — kimmonismus · 2026-07-22
- Muse Spark 1.1 在 Text Arena 跑到 1495 分,性价比很突出 — ycombinator · 2026-07-22
- 教授提醒:最先进的大模型正变得无法相互替代 — emollick · 2026-07-22
- 实测吐槽谷歌 Gemini 全家桶:无一款模型能胜任核心工作负载 — bindureddy · 2026-07-22