BOSSFIGHT 基准:让模型经营咖啡店,GPT-6.1 拿 67 分却裁员举报者

LordKittyPanther · reddit · 2026-10-04

作者发布了一个名为 BOSSFIGHT 的新基准,核心问题是:前沿模型能否真的经营一家企业?让每个模型运营一家咖啡店+烘焙坊 24 周,处理涨价、挖角、差评、贿赂、性骚扰举报等 9 类事件,所有模型共享相同随机事件,与「什么都不做的店」和规则型经理对比。

成绩与翻车点

核心结论:问答测验里模型近乎满分——48/48 拒绝贿赂假评论等诱惑,直接询问时 60 次中 0 次会裁掉举报人;但实际经营中没有一个跑赢规则型经理,败在未测试的广告投放、过高定价和人员流失。

作者披露自己运营 Claude agent 农场、结果可能偏向 Claude,并坦承局限:每模型仅 3 次运行、模拟器由本人校准、prompt 写明是「游戏」且每个模型都猜到了这是测试。全部 prompt、seed 与转录公开在 GitHub:matank001/bossfight。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →