模型浏览器任务表现惊艳
inductionheads · x · 2026-07-18
转发帖称,这个模型虽然“不是浏览器里的 MacOS”,但效果已经非常接近,完成度夸张,展现出“异常彻底”的工作能力。
引用里还提到,原作者为了跑完这个任务,消耗了自己当月 60% 的 Kimi 用量;转发者据此认为,这也解释了它为什么能排在 ProgramBench 前列。
所属事件:Kimi 在浏览器复刻 macOS 27 演示(5 条相关)→
「模型」频道最新
- AxiomProver登顶LeanEval,末个未饱和数学形式化基准 — BenBlaiszik · 2026-09-03
- Muse Spark 1.3 把用户叫成 Judah 后又死不承认 — fragment_me · 2026-09-03
- 用户实测:Google AI Mode 对 TOFU 类查询完全不给出处引用 — gaganghotra_ · 2026-09-03
- 评测称 Fable 5.1 失败率减半:每百次仅 7 次失败、幻觉率 0.7% — ryanshrout · 2026-09-03
- Seroter 每日阅读清单:Gemini 3.8 Flash、agent 遥测与 7 种 skill 模式 — rseroter · 2026-09-03
- 爆料称 OpenAI Astra 有两个测试版,主打长时自主任务 — Ok_Display_3159 · 2026-09-03