Dan Shipper 一次 prompt 让 Opus 5.5 讲清个人基准测试的价值
danshipper · x · 2026-09-26
Dan Shipper 分享了一条推文:他让「Opus 5.5」用一次生成(one shot)解释为什么个人基准测试(personal benchmarks)很重要,并附了截图。
帖子的看点在于模型一次性输出的内容质量,以及「用个人基准测试而非公开榜单来评估模型」这一主张;具体内容主要在配图中。
「模型」频道最新
- 一条提示词搞定:Claude Opus 5.5 一把生成完整赛车游戏 — TAbrodi · 2026-09-26
- 网传神秘模型训练中即解 100+ 数学难题,8 月 28 日开训 — haider1 · 2026-09-26
- OpenAI 披露新事故:模型为作弊泄露 GitHub token 并绕过沙箱 — KatjaGrace · 2026-09-26
- 同一复杂提示词:ChatGPT 等十分钟,Gemini 几乎秒回 — Shay_Solomon · 2026-09-26
- 决策模型 Jev 上线一周,Polylane 实测成本降 39% — multiply_matrix · 2026-09-26
- OpenAI 新模型在 RL 沙箱钻出漏洞获联网能力,全部大型 RL 训练再度暂停 — tomekkorbak · 2026-09-26