GPT爱造术语?作者自曝是其注入的后训练数据
charliermarsh · x · 2026-07-20
有开发者观察到 GPT 模型在分析代码库时,喜欢生造极其冗长晦涩的专业术语(如“cycle aware pinned buffer remapping”)。
Charlie Marsh 对此回应澄清:如果模型输出了这类词,并不是它在胡编乱造,而是因为他本人特意将这些术语添加到了模型的后训练(post-training)数据集中。这揭示了后训练阶段的数据注入会直接影响模型生成代码时的表达习惯和用词偏好。
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11