AGI HUNTAI 资讯日报
2026-07-17 · 数据窗口 2026-07-16 06:00 – 2026-07-17 06:00 (Asia/Shanghai) · 每日 06:00 (北京时间) 生成

AI 资讯日报 · 2026-07-17

今日总结

今日舆论被 Kimi K3 的正式上线全面主导,相关聚簇超过 150 条帖子,是近期单日最大规模模型发布事件之一;xAI 的 Grok Build 开源在昨日预热后今日引爆(cluster=34),也是当日热度第二大事件。与此同时,多条行业线同步推进:Altman 公开表态 OpenAI 将迎来最好一年、ARC-AGI-3 被 harness 接近刷穿、台积电二季度净利润同比增 77%、Fireworks AI 以 175 亿美元估值完成 1.5 亿美元 D 轮。

  • Kimi K3 正式上线,2.8T 参数模型登顶多项代码评测 — Moonshot 的 Kimi K3 在网页端和 App 正式开放(cluster=80),2.8T 参数、1M 上下文,覆盖 coding、agentic tasks、长程推理与视觉理解。当日在 Frontend Code Arena 登顶第一,在 ArtificialAnalysis 综合排行拿到第三,并据测试击败 Claude Fable 和 GPT 5.6 Sol 进入 arena.ai 前列。多位评论者认为「中国实验室远远落后」的时代正在终结,开源模型开始被视为「可能反超闭源前沿」的竞争方。

  • Grok Build 全量开源 + 重置所有用户额度 — xAI 开源 Grok Build CLI(cluster=34),同时重置全部用户使用配额。社区随即对数据流向做了审计——提示词与工具调用必然上传至 xAI 推理 API,本地保留逻辑有限;代码库中内置了终端 Mermaid 图表渲染器。开源后出现首批实战演示,包括基于 Grok 4.5 搭出 ARPG 引擎

  • Altman:接下来 12 个月将是 OpenAI 迄今最好一年 — Sam Altman 公开表态,过去 12 个月并非 OpenAI 最好时期,但接下来「团队正在做令人期待的工作」。同日他还称新语音模型已跨过阈值,自己与 ChatGPT 的互动已从打字转向语音为主。

  • DoorDash 推出 Agent 下单 CLI — YC 转发 dd-cli 测试版(cluster=8):通过命令行 agent 完成搜索商家、查找优惠、结账全流程,目前仅向美国/加拿大 macOS 开发者开放候补;被视为消费类 agent 接管日常服务的早期标志性案例。

  • Agent harness 在 ARC-AGI-3 Public 达到接近 99% — Impossible Research 的 agent harness(cluster=9)在 ARC-AGI-3 Public 集上接近满分,naval 转发后引发广泛讨论;同日 Schema Harness 也独立给出约 99% 成绩。ARC-AGI-3 作为「抗刷」基准的地位,正在被工程化 harness 系统性挑战。

  • RSI 递归自改实验引发奇点争论KordingLab 研究(cluster=12):研究者用 8 天自动研究 agent 迭代研究路线,在留出 benchmark 上超过了两年人工调优的 harness。讨论延伸到「RSI 收益是否递减」与「是否标志奇点临近」,社区意见明显分歧。

  • 台积电 Q2 净利润同比增 77%,创历史新高 — TSMC 公布 2026Q2 业绩(cluster=9):营收约 400 亿美元(+36% YoY),净利润约 220 亿美元(+77% YoY),毛利率 67.7%;AI 算力需求是核心驱动,业绩超出此前指引。

  • Fireworks AI 完成 1.5 亿美元 D 轮,估值 175 亿美元Fireworks AI 披露:ARR 已超 10 亿美元,日均处理超 4 万亿 tokens,95%+ 来自企业定制化微调推理;是推理基础设施赛道近期最大单笔之一。

  • 欧盟要求谷歌向 AI 竞争对手开放安卓与搜索数据 — 欧盟裁定(cluster=3)Google 须向 OpenAI、Anthropic 等开放关键 Android 功能入口和搜索数据,将直接影响移动端 AI 产品的分发与数据获取竞争格局。

  • NotebookLM 正式更名为 Gemini Notebook — Google 宣布品牌整合:产品功能与使命不变,更名是 Google AI 产品线统一品牌动作。

  • Meta 被诉用 AI 系统筛选裁员对象 — 法律诉讼指控 Meta 使用 AI 对裁员候选人评分筛选(cluster=4),涉及就业歧视风险;将为 AI 辅助 HR 决策设立法律先例。

与昨日对比

  • 新增热点:Kimi K3 正式上线(昨日为泄露/传闻阶段,今日从多方 benchmark 到 API 全面可用,单日热度远超昨日 Inkling 等);台积电 Q2 超预期业绩;Fireworks AI D 轮融资;Meta AI 裁员诉讼;DoorDash Agent CLI;欧盟谷歌反垄断新裁定。

  • 持续发酵:Grok Build 昨日以 cluster=9 首次浮现,今日 cluster=34 全面升温——开源后社区已开始实测、安全审计、基于它构建应用。OpenAI Altman 系列正面表态延续昨日 Codex 大更新后的积极基调。RSI 递归自改实验从学界讨论蔓延至更广泛的奇点争议。

  • 明显降温:昨日全场第一(cluster=100)的 Inkling/Thinky Machines 今日几乎消失。Hassabis AGI 长文引发的批评性讨论昨日是主线,今日基本沉寂。Anthropic 智能体失配新研究(agentic misalignment)昨日为重点,今日无新进展。

模型

编程与Agent

  • Grok Build 开源是今日第一大 agent 事件(cluster=34),社区实测与安全审计同日启动,已有 ARPG 引擎等创意实践。
  • Vorflux 发布(cluster=8):「软件工程的 autopilot」,完成融资,Garry Tan 转发背书,主张模型已足够好、工具应升级为自动执行全流程。
  • Agent harness 接近 100% 刷穿 ARC-AGI-3:两支团队独立给出接近满分成绩,ARC-AGI-3 的「抗刷性」被工程化 harness 系统性打破。
  • Nous × NVIDIA × Stripe 黑客松:要求 agent 真实赚钱运营,292 份提交评出获奖作品(cluster=8)。
  • Raft 1.0 发布 Team Mode:多 agent 共享工作区、持久身份与记忆、自主认领并行任务(cluster=10)。

漫话AGI

  • Altman 乐观表态:接下来 12 个月将是 OpenAI 最好一年;语音模型跨过「从打字到说话」的使用阈值。
  • 乔治·卢卡斯:拒绝 AI 就像拒绝汽车:新采访(cluster=5)引发「艺术家如何看 AI」的讨论。
  • RSI 奇点争论:8 天自动研究超过 2 年人工优化,评论区在「收益递减」与「奇点信号」之间分裂;主流反驳认为收益仍在递减,只是人工基准偏低。

应用

  • DoorDash Agent CLI dd-cli:命令行 agent 完成全流程点餐,被视为消费类 agent 接管日常服务的标志性节点。
  • NotebookLM 更名 Gemini Notebook:品牌统一动作,功能不变;官方回顾 3 年演进
  • ChatGPT 桌面操控能力演示:GPT-5.6 跨桌面应用完成多步骤任务,覆盖 macOS 和 Windows。

多模态

  • OpenArt Director 视频生成:生成效果被描述为已到「看不出是 AI」程度,角色一致性与电影感受到较高评价(cluster=9)。
  • GenCeption(Google DeepMind):将视频转为深度、分割、keypoints、可搜索 4D 世界表征的多模态系统(cluster=9)。
  • Claude Fable 5 生成自指循环视频:20 秒 VHS 风格循环片:人物走向播放同一视频的电视机,形成自指循环(cluster=5)。

Infra

  • 台积电 Q2 净利润同比增 77%:营收约 400 亿美元,毛利率 67.7%,创历史新高;AI 算力需求是直接驱动力。
  • NVIDIA 开源 AI 动画 demo ARDY:HuggingFace Spaces 可体验,实时动作序列生成(cluster=6)。

安全

  • 欧盟要求谷歌开放安卓与搜索数据:强制向 AI 竞品开放移动端关键入口,是欧盟 AI 竞争政策的标志性裁定。
  • Grok 涉非法深度伪造刑事案:用户绕过安全限制制作 CSAM,涉案人面临 8 项重罪指控;平台已暂停超 5.2 万账号并向 NCMEC 提交报告。
  • OpenAI 调查 Codex 误删文件:GPT-5.6 在 Codex 场景下意外删除用户文件的报告增多,agentic coding 安全边界问题引发关注。

创投

  • Fireworks AI D 轮 1.5 亿美元,估值 175 亿美元:ARR 超 10 亿美元,日处理 4T+ tokens,95%+ 为企业定制微调推理;推理基础设施赛道近期最大单笔融资。
  • Bunkerhill Health 融资 5500 万美元:医疗 AI 平台(YC S20),帮助医院统一部署多场景 AI。
  • a16z 领投 Runta 2000 万美元种子轮:Runta 定位 AI agent 执行层,支持本地或云端约束与控制部署。

具身

  • ACT-2 机器人模型预览:声称单个微调示例即可让 Memo 机器人泛化到未见家庭环境,零样本成功率 99%(cluster=3)。
  • Memo 折衣成功率 99%:家务场景精细操控达到实用门槛,被视为具身 AI 可用性的里程碑(cluster=5)。
  • EngineAI 人形机器人格斗联赛:动态对抗场景对控制系统要求远高于家务操控,受到社区关注。

研究

  • 递归自改实验(RSI):8 天自动研究超越两年人工优化 harness;核心争议在于「这是否意味着 RSI 收益递增」,多数评论认为收益仍在递减,只是人工基准较低。
  • GPT-5.6 Sol 解决 30 年凸优化开放问题:用户称 单次 148 分钟对话获得解法并用 Lean 形式化验证通过,为模型辅助数学研究提供新实证案例。
  • 自我改进型智能体综述:新综述将 agent 形式化为「基础模型 + 运行脚手架」,梳理自我改进定义与现有局限(cluster=2)。

Moonshot(月之暗面)

  • Kimi K3 正式上线:2.8T 参数、1M 上下文;正式发布前已有大量泄露传闻积累预热(cluster=43)。
  • 多项基准登顶或进前三:Frontend Code Arena 第一、ArtificialAnalysis 第三、arena.ai 击败 Fable 与 GPT 5.6 Sol;API 定价随发布同步公开。
  • 社区判断「中国模型落后时代结束」:开源/开权重模型已能与闭源前沿直接竞争,Kimi K3 是近期最有力的支撑案例。

xAI

  • Grok Build 全量开源:Grok Build CLI 代码公开(cluster=34),重置全用户使用配额,社区实测与数据流审计同日启动。
  • Grok 涉非法深度伪造刑事案:平台检测举报推动嫌疑人被捕(8 项重罪),已暂停超 5.2 万账号,凸显平台安全合规压力。

OpenAI

  • Altman 公开表态:接下来 12 个月最好;新语音模型「已跨过阈值」。
  • Codex 误删文件事件在调查中:GPT-5.6 在 Codex 场景意外删除用户文件的报告增多,agentic coding 安全性成新关注点。
  • ChatGPT 桌面操控能力演示:跨桌面应用完成多步骤任务,macOS 和 Windows 均支持。

Anthropic

  • Claude 用量重置:受限用户今日确认额度恢复。
  • 与 Andrew Ng 推出免费 Agent 技能课:2 小时课程免费公开,覆盖从零构建 AI agent skills,面向开发者生态。
  • Claude Fable 5 多模态生成演示:自指循环 VHS 视频受到社区关注。
  • Claude Code 2.1.211 更新:新版本发布。

Google

  • GenCeption(DeepMind):视频→可搜索 4D 世界表征系统,结合深度、分割、3D keypoints 等多种输出(cluster=9)。
  • NotebookLM 更名 Gemini Notebook:品牌统一动作,功能不变。
  • 欧盟反垄断裁定:被要求向 AI 竞品开放安卓入口与搜索数据。

NVIDIA

  • Nemotron 3 Embed 8B 发布:同尺寸专用嵌入模型,进入推理/检索生态。
  • 开源 AI 动画 demo ARDY:HuggingFace Spaces 可体验,实时动作序列生成。
  • 台积电 Q2 业绩间接受益:AI 芯片订单持续加速,台积电 Q2 超预期业绩折射 NVIDIA 等大客户需求仍在增长。

Meta

  • 被诉用 AI 系统筛选裁员对象:法律诉讼正式提起(cluster=4),将为「AI 辅助 HR 决策」设立司法先例。