Athena 4B 在购物行为预测基准上超越 GPT-5.6 和 Claude
rohanpaul_ai · x · 2026-08-04
Athena 4B 在购物行为预测基准上拿到 24.5%
@markopoloai 新发了一个 4B 参数模型 Athena,定位成“Large Event Model”,核心任务不是生成文本,而是根据用户当前页面和交互历史,预测购物者下一步会做什么浏览器动作。
关键结果
- 在 OPeRA 全量测试集(992 个动作)上,Athena 的 strict exact-match 达到 24.50%。
- 帖子称这一下超过了同场测试中的 GPT-5.6、Claude Opus 4.8 和 Claude Sonnet 5。
- 严格精确匹配要求“下一步动作”和“目标元素”都完全正确,哪怕只差一点也算错。
这个结果的意义
这类预测如果靠谱,下游系统就能在用户还没离开页面前提前响应,比如有人快要放弃结账时及时介入。
所属事件:Markopolo AI 发布 4B 模型 Athena,称购物预测能力超越 GPT-5.6(2 条相关)→
「模型」频道最新
- Kimi K3 在一场奇怪的 canvas 代码评测中跑到 116 tok/s — MaziyarPanahi · 2026-08-04
- OpenAI 重构 ChatGPT Voice,启动往返从 6 次降到 1 次 — OpenAI · 2026-08-04
- 开发者审计 6 个仓库后删掉 71% 的 agent 指令 — JuniorCustard4931 · 2026-08-04
- 榜单显示 Kimi K3 综合 79.2,但 agentic coding 仍是短板 — teortaxesTex · 2026-08-04
- Epoch AI 的 MirrorCode 基准首次见 Claude Fable 解出两项任务 — Jsevillamol · 2026-08-04
- X 帖调侃 Anthropic 年底营收可冲 1000 亿美元 — Jsevillamol · 2026-08-04