2026-08-25
Orchestrator奖工作论文把评奖拆成准入和打分:五道门槛全过才进入十条加权柱。模型只许整理证据,最终认可权留在具名人类评委。
AI 原生成果来得比评判它的办法快。传统批评默认作品背后有一位人类作者,评的是完成面。AI 原生作品把方法本身做成了作品的一部分:编排了哪些模型、身份和连续性怎么保住、一次成功是方法还是运气,这些过去的评奖流程没有量过。另一头同样麻烦:如果把打分交给模型,被评的对象就在给自己阅卷。
这篇是 Orchestrator Awards 工作论文第 003 期,4 页,未同行评审。作者 Mark Sendo 同时挂在颁发该奖的机构上,文首写明了利益关系,也写明正文用了 AI 协助起草。它要立的不是一套已经跑起来的评测,而是三条必须绑在一起的承诺:先准入、后论高下;先证据、后认领;认可权永久留在人类手里。
整套流程把「能不能评」和「评得好不好」拆开。作品先过五道 pass/fail 门槛,一道不过就停,分数买不了豁免:
过门之后才打分。分表是十条加权柱,权重公开:Orchestration Craft(编排工艺)16%,Story and Intent 14%,Identity and Continuity 11%,Technical Execution 10%,Transparency and Disclosure 10%,Human Creative Control 10%,Originality and Creative Novelty 9%,Safety and Rights Discipline 8%,Workflow Evidence 8%,Field Contribution 4%。权重拿出来是为了能被争论,不是为了被信任。
披露被测两次,测的不是同一件事。门槛看诚实:实质性 AI 使用有没有说全、说真,没说全直接出局。柱子看质量:说了之后,披露准不准、有没有版本、能不能审计。方法即手艺的品类里,藏方法本身就是作品失败。
机器的位置写得很死。具名、无利益冲突的人类评委做最终裁决。模型不能决定资格、提名、入围或授奖。若以后引入模型,只许整理信息:把参赛者自己交的披露摊开,把证据排给人类看。范围、证据处理、可审计性和边界必须事先公布并单独授权。防火墙不随能力上移。
配套纪律是评委独立打分、锁定前互不可见,再聚合,避免单人定结果;利益冲突要披露和回避,回避记录进审计轨迹;裁决可被挑战,证据争议和记录错误有改正程序。Pioneer Award 是理事会授予的荣誉,不走五道门槛和十条柱,另有公开的荣誉方法;把例外写出来,是为了不让例外把规则泡软。
领域素养也设了边界。评委按该领域的能力选,一个领域的识货不能自动挪到另一个领域。测量仪器可以共用,读仪器的人不能跨领域通用。
没有实验,没有评测集,没有评分者一致性数字。这篇交付的是一份事先公开的方法声明,并反复强调声明本身不启动评分、投稿、提名、评委、投票或授奖。口号是 Publish first. Be cited second. Recognize third.(先发表,再被引用,最后才认可。)
能核对的结构只有这些:五道门槛全是通过/不通过;十条柱权重加总 100%;披露同时以门槛和柱子出现;认可权被放进作者前作 The Custody of Intelligence 所说「不可自主委托的权力」那一类。理由写成结构问题,不是能力问题:模型即使判得很准,也无法对裁决负责。
做 AI 内容评测、竞赛和平台审核的人,会在这里看到一个和「用 LLM 当 judge」相反的制度选择。过去两年,很多排行榜和创意赛把模型评审当默认省钱方案。这篇把省钱方案直接判为失格:被生成物评判生成物,问责链断了。
可执行的部分其实很土,也因此能抄。准入和打分拆开,避免完成面给未披露方法开绿灯;流程日志、工具清单、版本锁定当证据,不凭作者自述;人类评委独立打分再聚合。对内部创意评审、采购验收、开源竞赛,这三条比权重数字更有用。
把它当评测论文会失望。没有证明这套柱子能分开「真解决了难题」和「一次抽卡成功」,也没有证明人类评委在编排工艺上的一致性够用。它更接近奖项机构的宪章草案。
作者与 Orchestrator Institute、Orchestrator Awards 同属 Celestial Technologies LLC,利益冲突写在首页,仍是自己给自己的奖项写规则。未同行评审,篇幅 4 页,主张密度远高于证据密度。
五道门槛和十条柱没有操作定义到可复现的程度。什么叫「实质性 AI 使用说全了」,什么叫编排工艺的 16 分,文中没有量表、没有样例、没有标定。Pioneer Award 整条赛道绕开门槛,等于最高荣誉不受这套纪律约束。模型「只许整理、不许裁决」的边界在实践里很容易被助理由薄到厚,这篇只写了禁令,没写审计办法。
发布即声明不启动任何评审。目前无法从外部检查这套方法有没有被用过、用得严不严。