Pangram 检测 Claude Opus 5.5 准确率达 99.7%,「in short」成新口头禅
SuB8u · x · 2026-09-26
AI 内容检测公司 Pangram 用 1000 条 Chatbot Arena 提示词测试 Claude Opus 5.5 的输出,其 Pangram 4 检测准确率达 99.7%:997 条判为纯 AI、2 条混合、仅 1 条判为人类——那条漏网的「人类」是应「以 Ozymandias 风格写企鹅俱乐部诗」生成的戏仿诗。
漏判集中在文学类文本(简·奥斯汀章节解读、修昔底德式演讲)。文章还观察到 Opus 5.5 有新的写作特征——高频使用「in short」,一如当年模型爱用破折号,成了可识别的指纹。作者认为这也是迄今写作质量最好的 Claude。
「模型」频道最新
- System 1 模型一次编码即返回类型化答案,笔记本 CPU 上 45ms 完成工单分类 — ghumare64 · 2026-09-26
- 实测 System 1 模型 Laya:单次编码器输出概率,毫秒级替代 LLM 路由 — ghumare64 · 2026-09-26
- 斯坦福教授:LLM brainstorm 很有用,但会自信地说合法听着的胡话 — anshulkundaje · 2026-09-26
- 研究者晒 Claude 数小时解开困扰数月的多模态光谱混合难题 — jwt0625 · 2026-09-26
- 旧文翻车:ARC Prize 曾坚称普通深度学习不够,需程序合成,随后 o3 出现 — teortaxesTex · 2026-09-26
- 折扣结束用量依然保持:AI 模型折扣带来黏性增长 — zainhas · 2026-09-26