AI 味盲测结果与全部文本已上线 GitHub,含完整复现脚本
PawelHuryn · x · 2026-09-07
Pawel Huryn 将 12 模型「AI 味」盲测的原始数据、脚本与结果发布到 GitHub 的 experiments 仓库。仓库收录其所有实验的可复现材料:每个实验附精确脚本、未编辑日志及含方法、样本量与注意事项的 README,还包含 bug-hunt-bench、五模型三框架、隐藏系统提示指纹等历史实验集。作者并询问是否要把该测试做成类似 Bug Hunt Bench 的实时榜单。
所属事件:12 模型「AI 味」盲测:Gemini 3.8 最易露馅(3 条相关)→
「模型」频道最新
- 博主估算训练数据规模应为 5-7T,认为 8T 已属高估 — scaling01 · 2026-09-07
- 数学家指责 OpenAI Astra 十项数学成果涉研究不端:未引用已有文献 — asusarla · 2026-09-07
- Peter Gostev 辨析模型稀疏度爆料:Kimi 26:1、DeepSeek 32:1,1.2T 激活参数不可信 — inductionheads · 2026-09-07
- OpenAI 新模型在旧 Chat Completions 接口禁用 function tools,迁移二选一 — AI-Specialist-6597 · 2026-09-07
- 开发者实测:Astra 擅长自主目标推进,指令遵循却不及 Sol — MinqiJiang · 2026-09-07
- 美国政府正以 1 美元价格使用三大模型,合同本月到期存续未知 — LuizaJarovsky · 2026-09-07