实测金融分析:小模型排名一致性仅 15%,前沿模型达 75%
Rough_Practice7631 · reddit · 2026-10-07
作者在真实财报数据上对比了 Gemma 3 27B、Qwen3 32B 与 Opus 5、GPT-5.6 Sol 的判断可靠性,核心发现:
- 排名 vs 打分一致性:同一判断用排序和 0-100 打分两种问法,Opus 一致率 75%、GPT 65%,而 Gemma 仅 25%、Qwen 仅 15%。
- 顺序敏感性:Qwen 仅仅调换公司列表顺序,10 组中有 6 组改变首选公司。
- 分析师意见锚定:附上看空研报后 Qwen 81%、Gemma 71% 的情况降低评分;简单要求模型先识别观点再独立推理,可让 Gemma 85%、Qwen 68% 恢复原有评分。
- 摘要 vs 全文:对摘要打分时前沿模型 84% 保持原评级,小模型有 25-31% 会改变判断。
作者强调样本小,应视为方法论演示而非定论。
「模型」频道最新
- 700亿参数数学模型Bel引争论:合成数据还是规模红利 — teortaxesTex · 2026-10-07
- Fable 自评新发布:相当于约 5 个「OpenAI 纳维-斯托克斯」级成果 — willdepue · 2026-10-07
- Reddit 用户发布去审查 27B 红队安全模型,自称零拒绝 — Least_Dog_8556 · 2026-10-07
- OpenAI 研究员惊讶:AI 实验室数学新成果至今没查出硬伤 — willdepue · 2026-10-07
- OpenAI 模型在 ARC 类谜题上输给 Meta 的 Muse — BLUECOW009 · 2026-10-07
- Inception 免费推出 Mercury Decide:每秒 14 次结构化决策,对标 Jev — StefanoErmon · 2026-10-07