NormViz 基准:最强模型跨16国文化规范理解仅得25.3%
StellaLisy · x · 2026-10-01
- 一项入选 COLM 2026 的论文发布 NormViz,用于衡量多模态模型对各国视觉文化规范的理解,覆盖 16 个国家。
- 测试场景如:在日本送四条锦鲤的盘子属冒犯(4 谐音「死」)、在中国把筷子竖插米饭不合礼仪(形似祭奠香烛)。
- 结果:表现最好的 Gemini 3 Flash 也只拿到 25.3%,说明顶级模型对视觉文化禁忌的理解仍然很差。
「模型」频道最新
- Cloudflare 开源首批自研决策模型 clef 与 clef-flash — ritakozlov · 2026-10-01
- 罕见定价:人类用量不限,反而限制 AI agent 用量 — _philschmid · 2026-10-01
- NPR 深度报道:第三方 AI 模型评测现状与困境 — Miles_Brundage · 2026-10-01
- 给 WIP 模型做简单界面试玩:快速反馈的高杠杆做法 — gowthami_s · 2026-10-01
- Dwarfstar 定制量化:Qwen 在 96GB M3 Ultra 上跑得又快又稳 — TheRealJesus2 · 2026-10-01
- Codex 负责人:主账号用量近乎无限,额度规则急需重设 — taherdhanera · 2026-10-01