自建写作基准:GLM-5.3 Flash 花 0.7 美分写出 1.7% 差距

OnlyProggingForFun · reddit · 2026-09-27

一位 YouTube 频道主分享内部创意写作基准的早期结果:让模型为频道写完整 YouTube 脚本,10 个真实任务、每模型 5 份脚本,由三个 AI 评审按 100 分制对照自己剪辑过的参考稿打分。

结果:GLM-5.3 Flash 写一份脚本仅花 $0.0074,得 88.2 分;Claude Fable 5.1(max effort)得 89.7 分但要 $3.15——即 429 倍价格只换来 1.7% 的分数差距,且很多更贵的方案分数反而更低。

作者的真正建议是:如果贵模型能减少剪辑时间,他愿意付这个钱,所以值得自己测的是「同一批 prompt、盲测、统计能直接发布的脚本数和修补耗时」。

所属事件:自建写作基准:GLM-5.3 Flash 低价逼近参考稿(2 条相关)→

原文链接 →

「创投」频道最新

更多「创投」频道 AI 资讯 →