哈佛分析 Chutes 61.2 亿条 AI 请求:Agent 消耗更多 Token 但回答更短
markjeffrey · x · 2026-09-22
哈佛研究人员分析了去中心化推理平台 Chutes(Bittensor SN64)上的 61.2 亿条 AI 请求,得出几个值得关注的发现:
- AI Agent 正在消耗更多 token,但产出更短的回答——推理过程变长、最终输出变精简,是 Agent 化负载的典型特征。
- 复用已处理的信息可以让 AI 跑得更快、更便宜,缓存与信息复用是降本的关键杠杆。
- 更聪明的 GPU 路由能显著减少浪费的算力,调度策略直接影响推理经济性。
此外,Chutes 团队还在开发 Parallax 项目,目标是在分布式 GPU 上训练 AI 模型,强化其作为开源 AI 实验室的定位。
「Infra」频道最新
- python-build-standalone 为 CPython 3.12+ 启用全量 LTO 提升运行性能 — charliermarsh · 2026-09-22
- REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选 — MensaProdigy · 2026-09-22
- 开发者自述:DeepSeek V4 NVFP4 优化后 192GB 只剩 2GB 余量 — HankYeomans · 2026-09-22
- 「AWS 让行业变软」:AI 基础设施还没有躺赢的资本 — mgill25 · 2026-09-22
- Grass 网络获第三方审计:3 亿带宽用户贡献 3210 万美元营收 — Ronangmi · 2026-09-22
- SemiAnalysis 深文:MoE 模型如何映射到推理硬件的算力与数据搬运 — zephyr_z9 · 2026-09-22