研究称文化提示下前沿模型微调后偏向日本
ImaginaryRea1ity · reddit · 2026-07-29
Cardiff University 和巴斯克中心 HiTZ 的研究测试了 24 种语言、31,680 个文化相关提示词,对象包括 GPT、Gemini、Claude 等前沿模型。
- 在询问舞蹈、节日、日常仪式等文化问题时,8 个模型里有 6 个会不自觉地把答案往 日本 上带。
- 这种偏置更像是 监督微调之后 才出现的,不是在原始预训练数据里就固定存在。
- 基础模型对各文化的提及更平均;而经过微调的模型明显更偏向 日本 和 美国。
- 研究者认为,模型会把日本当成一种“安全默认值”:知名、全球可识别、又不太容易引发争议。
「漫话AGI」频道最新
- 贝多芬海利根施塔特遗书被提名为 AI 对齐训练素材 — deanwball · 2026-08-24
- 用户半年消耗千亿 Token,缓存占 98% — DeryaTR_ · 2026-08-24
- 很多人误以为未来百年仍将维持 2010 年代的状态 — AndyMasley · 2026-08-24
- Reddit 实验:人与前沿模型交互能否产生关系相变? — mb3rtheflame · 2026-08-24
- Sam Altman 观点转变:不再视 UBI 为 AI 时代主要解决方案 — sjgadler · 2026-08-24
- 主题 ETF 资金集中押注五大主线,AI 与算力仍是最大仓位 — FinanceYF5 · 2026-08-24