TMLR 收录新论文:CQ-Bench 评估模型文化智商
jieyuzhao11 · x · 2026-09-01
一篇关于 CQ-Bench 的论文已被 TMLR 接收。CQ-Bench 是一个专门用于评估大语言模型(LLM)对话中文化智商的基准,旨在测试模型是否像人类一样理解对话中隐含的文化价值观。
「研究」频道最新
- thesephist:贯通数据到 UI 的全栈理解者将发现新生成范式 — thesephist · 2026-09-23
- 微软发布 Taste-Bench:最强模型长程决策判断力仅 59.7% — microsoft · 2026-09-23
- StableVQ 论文拆解向量量化训练不稳根源,提出三项无需新参数的修正 — Kwai-Kolors · 2026-09-23
- Lean Pool:全部由 AI 智能体构建和维护的形式化数学仓库上线 — Vasily Ilin · 2026-09-23
- 用 steering 向量实现 loom:从 n 条补全中提取并引导模型输出 — repligate · 2026-09-23
- 1982 年 Hopfield 网络与现代 LLM 注意力机制数学上等价 — seanmcdonaldxyz · 2026-09-23