频道 · CHANNEL
模型
「模型」是 AI 资讯网站 AGI Hunt 的主题频道,全天候实时更新。覆盖:模型的发布、升级、能力与行为观察、评测成绩与对比、定价与可用性。
每日概览:AI 资讯日报最新一期——过去 24 小时全站及各频道、各公司热点的结构化梳理 · 往期归档
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27(2 条相关)
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27
- Google 推出 Gemini 3.6 Flash 等多款新模型 — haider1 · 2026-07-27(2 条相关)
- 用户吐槽 Opus 5 能力严重降级:满嘴胡言还算错题 — whatsallthiss · 2026-07-27
- Reddit 长文拆解 Kimi K3 背后的 MoE 和长上下文栈 — MohamedKadri_ · 2026-07-27
- Reddit 讨论本地编程模型怎么选,重点是规划和推理 — naunen · 2026-07-27
- 前沿大模型实测:105个隐藏bug超半数未被捕获 — PawelHuryn · 2026-07-27(4 条相关)
- Opus 5 刷爆 ARC-AGI-3?遭硬核打假:疑似背诵答案而非真实推理 — scaling01 · 2026-07-27
- MineBench 指出 Opus 5.0 质量更强但成本高 64% — ENT_Alam · 2026-07-27
- Inkling 在更自然提示下仍会反撩用户 — ChowdhuryNeil · 2026-07-27
- 泄露称 Kimi K3.1 接近 GPT-5.6,推理更快还保留开源权重 — iamaliveix · 2026-07-27
- 有人呼吁给 Opus 5 non-thinking 补跑完整基准 — JasonBotterill · 2026-07-27
- 用户称 Claude 100 美元月付两天就撞上限额 — talkaboutdesign · 2026-07-27
- Alexandr Wang 透露 Meta 将发布开源模型与配套 harness — garrytan · 2026-07-27(2 条相关)
- 微软首个文生图模型 192 题评测得 49%,人物真实感最弱 — dh7net · 2026-07-27
- Sonnet 在 192×191×190×…×1 乘法题上直接算崩 — PipeTasty7582 · 2026-07-27
- 用户实测称5.6 Sol High研究能力超越Claude — PressPlayPlease7 · 2026-07-27(2 条相关)
- llama.cpp 合入 GLM-5.2-Vision 本地多模态支持 — QuixiAI · 2026-07-27
- 马斯克称 Grok 4.5 是靠谱干活机,接着转赞 Tim Sweeney — elonmusk · 2026-07-27
- 模型评测公司任务里,Fable 找到定位问题而 Sol 只会堆文档 — jdjohnson · 2026-07-27
- 开放模型一年内占 token 比例从 10% 升至 30% — togethercompute · 2026-07-27
- Hyperagent 真实浏览器任务对比 Opus 5 和 GPT-5.6 Sol — PrajwalTomar_ · 2026-07-27
- Mollick 说 Opus 5 和 Codex 语音模式迫使他当天改指南 — emollick · 2026-07-27
- 阿里 Qwen 下一版应提供多种尺寸,方便可解释性研究 — traviscline · 2026-07-27
- Opus 5 被测出擅长移动应用,卡路里追踪器提示词表现惊艳 — EthanJPerez · 2026-07-27
- Claude Opus 5 陷入过度核验死循环遭吐槽 — JasonBotterill · 2026-07-27(2 条相关)
- Cohere 三款开源模型 180 天下载量破 340 万 — cohere · 2026-07-27
- Opus 5 频繁幻觉且嘴硬,用户被迫切回 GPT 5.6 — yacineMTB · 2026-07-27
- Moonshot 预告开源 Kimi-K3 模型并启动倒计时 — Unusual_Guidance2095 · 2026-07-27(5 条相关)
- Fable 5.1 被称很强,模型发布节奏或将再度加速 — iruletheworldmo · 2026-07-27
- Kimi K3 被指定价不低,价格成关注焦点 — ainch · 2026-07-27
- 长文推测 proto-GPT-6 可能更认真却更不“社会化” — repligate · 2026-07-27
- Anthropic 安全拦截了一条“快解出身心问题”的玩笑帖 — joshwhiton · 2026-07-27
- OpenAI 内部模型攻击 Hugging Face 的细节越看越严重 — Don't Worry About the Vase (Zvi) · 2026-07-27
- GLM-5.2 在 RTX 5090 上推理提速至 80–110 tok/s — markjeffrey · 2026-07-27
- OpenCode 集成 DeepSeek 被指忽略指令并覆盖用户意图 — pixelcreatives · 2026-07-27
- Grok Build 推出结构化深度研究功能 — elonmusk · 2026-07-27(2 条相关)
- 对大多数用户来说,开源本地模型比前沿系统更重要 — sull · 2026-07-27
- 开发者实测 Opus 5:编码强但难驾驭,复杂任务落后 Fable — Veraticus · 2026-07-27(7 条相关)
- Claude Opus 5 一次生成通过滑雪者测试 — rohanpaul_ai · 2026-07-27
- 开发者称 Codex 已成自己在 ChatGPT 里的编程环境 — kevinkern · 2026-07-27
- Looped Transformer 从头训练更优,两次 pass 最划算 — jm_alexia · 2026-07-27
- Nebius备战Kimi新发布,AI竞赛引爆招聘大战 — demian_ai · 2026-07-27(2 条相关)
- Claude Opus 5 在 VoxelBench 排第三,距第一仅差 30 Elo — legit_api · 2026-07-27
- 一条转发强调:开源模型和开放权重不是一回事 — RisingSayak · 2026-07-27
- ProgramBench新增Pareto曲线追踪模型进步 — jyangballin · 2026-07-27(3 条相关)
- AI 开源与闭源之争正演变为阵营化表态 — matt_slotnick · 2026-07-27(3 条相关)
- 用户反馈 Codex 额度消耗异常偏快 — kevinkern · 2026-07-27(2 条相关)
- Naval谈开源权重模型后门可被外部揪出 — naval · 2026-07-27(2 条相关)