所有主流大模型都读不了多调式古希腊语,作者指 RLHF 在系统性摧毁长尾知识
vasilisvj · reddit · 2026-09-02
作者指出:当今所有主流 AI 模型在多调式(polytonic)古希腊语上完全失效——重音混乱、送气符号丢失、用现代希腊语替代古典正字法,导致从亚里士多德全集起的 2400 年哲学文本对「智能」系统不可见。
成因分析:
- 训练数据:古希腊语语料几乎为零;现代希腊语与多调式正字法是两套系统。
- RLHF 加剧问题:人类评估员不懂多调式希腊语,只会奖励「看起来合理」的现代希腊语近似,惩罚真实古典形式——对齐过程系统性摧毁了基座模型仅存的能力。
- 作者称 Qwen、Llama 等基座模型其实能低水平处理多调式字符与变音符号,是上层的 RLHF 把它毁掉:「你无法对齐你无法评估的东西」。
更一般的论点:每次为「有用性/安全性」微调都在压缩推理空间,任何真实推理偏离普通评估员认知的领域都会受损。这不是语料边角案例,而是「对齐在按设计摧毁知识」的证据。
主张的解法:不是更大的模型,而是不同架构——基于数字化校勘本的 RAG 检索系统、自托管模型、真正检查多调式准确率的评估指标。作者团队正在做此事,并警告:当学科主要文本对下一代研究工具不可读时,经典学这一学科会怎样?
「漫话AGI」频道最新
- 审稿人称频频撞上 AI 代写论文,呼吁导师把关学生稿件 — dianarycai · 2026-09-02
- Cohere 研究总监:预训练 ROI 放缓,重心转向推理时计算 — sarahookr · 2026-09-02
- 119 家 neolab 吸走 943 亿美元,风投史上最大「先研究后收入」豪赌 — WhatTheLJW · 2026-09-02
- 学者抱怨 AI 味论文暴增,呼吁导师认真审学生的初稿 — CSProfKGD · 2026-09-02
- Cohere 研究副总裁 Sarah Hooker:推理时代正在改写十年 GPU 设计逻辑 — sarahookr · 2026-09-02
- Sarah Hooker:测试时计算与智能体工作流正迫使 AI 基础设施重构 — sarahookr · 2026-09-02