为何文学 RL 难做:没有 ground truth,谁来给小说打分?
teortaxesTex · x · 2026-09-22
teortaxesTex 回应「AI 为何写不好文学」的讨论:确实有人做过针对性尝试,但并非优先级,而且这活儿真的难——因为缺乏 ground truth。「在线打分怎么打?靠语言模型当裁判吗?」他对比:编程有测试、计算可即时验证、Lean 让数学可验证,而文学创作缺少这样的可验证性,这正是 RL 难以在该领域发力的核心原因。
所属事件:AI 为何写不好严肃文学:品味方差与艺术意图之辩(6 条相关)→
「模型」频道最新
- Claude 再度宕机,用户猜测为新 Opus 调试或算力不足 — CtrlAltDwayne · 2026-09-22
- Grok 4.7 编码评测大涨:CursorBench 40.4%→46.3%,价格不变 — FinanceYF5 · 2026-09-22
- Grok 4.7 模型卡发布:Terminal-Bench 成绩从 20.3% 跳至 38.0% — ns123abc · 2026-09-22
- Anthropic 状态页显示 Claude 多个模型错误率升高 — corvad · 2026-09-22
- antirez 与 tenobrus 联手泼冷水:Jev 演示皆夸大,离真可用还远 — burny_tech · 2026-09-22
- 马斯克确认:Grok 90 天从榜外杀回前三,4.8 下月再战 — elonmusk · 2026-09-22