自建写作基准:GLM-5.3 Flash 花 0.7 美分写出 1.7% 差距
OnlyProggingForFun · reddit · 2026-09-27
一位 YouTube 频道主分享内部创意写作基准的早期结果:让模型为频道写完整 YouTube 脚本,10 个真实任务、每模型 5 份脚本,由三个 AI 评审按 100 分制对照自己剪辑过的参考稿打分。
结果:GLM-5.3 Flash 写一份脚本仅花 $0.0074,得 88.2 分;Claude Fable 5.1(max effort)得 89.7 分但要 $3.15——即 429 倍价格只换来 1.7% 的分数差距,且很多更贵的方案分数反而更低。
作者的真正建议是:如果贵模型能减少剪辑时间,他愿意付这个钱,所以值得自己测的是「同一批 prompt、盲测、统计能直接发布的脚本数和修补耗时」。
所属事件:自建写作基准:GLM-5.3 Flash 低价逼近参考稿(2 条相关)→
「创投」频道最新
- 高盛:token 需求 18 个月增 18 倍,仍难追平价格崩塌 — rohanpaul_ai · 2026-09-27
- 轨道算力每吉瓦成本之争:投行估 1700 亿美元,自建模型称 680 亿 — JOBhakdi · 2026-09-27
- 个人 AI 助手年成本约 3000-7000 美元,创业切入策略全解析 — illscience · 2026-09-27
- 独立开发者上线 DeliveryKit:一行代码用 Stripe 卖数字文件 — ow · 2026-09-27
- 爬竞品差评做机会挖掘:创业前最值得干的一件高杠杆事 — _AustinCalvert_ · 2026-09-27
- 餐饮版 WhatsApp AI 接待员:小团队求垂直场景踩坑经验 — vxdant23 · 2026-09-27