修复 Agent 上下文丢失问题,模型评测得分实现跨越式提升
rajistics · x · 2026-08-05
近期 OpenAI 和 Fireworks AI 在各自的 Agent 测试框架中,均发现并修复了导致模型推理上下文丢失的严重 Bug,评测成绩随之大幅飙升。
- OpenAI:其 ARC-AGI-3 测试框架错误地在多轮对话间丢弃了模型的推理过程,修复后得分从 13.3% 跃升至 38.3%。
- Fireworks AI:在通过 OpenHands 运行 CyberGym 测试时,发现存在非原生工具调用、推理状态丢失及参数未透传等问题。修复这些框架缺陷后,成绩从 40.7% 飙升至 70.0%。
「编程与Agent」频道最新
- 用 ChatGPT 语音驱动 Codex 实战:边想边改的编程工作流 — dfinke · 2026-08-05
- 当资深工程师遇到四个卡在 localhost 的 vibe coder — venturetwins · 2026-08-05
- 实操教程:用Hermes多智能体搭建自动化内容工厂 — VibeMarketer_ · 2026-08-05
- 斯坦福Hazy Research:AI智能体正在让CUDA传统抽象层走向消亡 — HazyResearch · 2026-08-05
- Greptile v5发布:代码审查智能体全面重构,速度与精度双升 — garrytan · 2026-08-05
- 用多智能体编排自动化产品演示视频 — rohanpaul_ai · 2026-08-05