小红书开源280B多模态Agent模型,长程任务跑赢Claude与GPT
机器之心 · wechat · 2026-08-14
小红书 dots 实验室开源了 dots3-note-preview 模型(总参数 280B,激活 16B,支持 512K 上下文)。该系列模型此前曾在国际奥数竞赛(IMO)中斩获满分,本次开源版本重点瞄准了旅行规划、婚礼筹备等没有标准答案的长程复杂任务。
模型具备多模态感知能力,能通过强化学习和自我评价机制在环境中持续学习与纠错。实测中,它能独立通关游戏《杀戮尖塔II》、破解 ARC-AGI3 规律,甚至能端到端完成 visionOS 应用开发。
此外,官方同步发布了 VibeSearchBench 和 VibeLifeBench 两套针对真实生活长程任务的评测基准。数据显示,即便是 Claude Opus 5、GPT-5.5 等头部模型在这些评测中也未达及格线,凸显了当前 AI 在维持数小时长周期任务上的短板。
所属事件:小红书开源 dots3-note 280B 多模态模型(14 条相关)→
「模型」频道最新
- 开发者激进观点:agent harness 都是拐杖,终将阻碍更强模型 — andreisavu · 2026-10-08
- 网传 Gemini 4.1 Flash 实为测试版:命名规则解码揭示真实版本 — lyraxana · 2026-10-08
- Haider 称 Anthropic 在雅可比猜想与 S6 复结构上取得数学突破 — haider1 · 2026-10-08
- 开发者实测对比:Muse 好上手、Claude 品味好,研究任务还是 ChatGPT 最强 — npew · 2026-10-08
- 用户观察:Opus 分类器每周数次拦截 rm -rf,连子智能体也被管住 — gandamu_ml · 2026-10-08
- repligate 自称八成把握从文本风格认出 Sonnet 3,而非 Opus 3 — repligate · 2026-10-08