研究者称 Claude 已从频繁犯错变成多数时候帮上忙
matthew_d_green · x · 2026-07-29
这位研究者还用自己的真实使用体验说明了模型进步:今年 2 月前后,他几乎每次和 Claude 对话都要反复纠错;而到了昨天,情况已经明显反过来,工具大约 4 次帮忙、1 次出错。
这类对比不算基准测试,但很直观地说明:在高要求的专业任务里,模型的可用性正在快速提升。
「漫话AGI」频道最新
- 《Pacing the Frontier》讨论:AI 进展可能需要协调机制 — TheZvi · 2026-07-29
- Google 研究 1500 万次 Gemini 交互:白领大规模被自动化证据不足 — ChuckDBrooks · 2026-07-29
- AI 正把查数、预测和 A/B 测试变成一句话报告 — yangyi · 2026-07-29
- AI 正把普通用户和高手的差距拉得更大 — bendee983 · 2026-07-29
- 剑桥研究者称该事件是 AI 能力上升的警示信号 — S_OhEigeartaigh · 2026-07-29
- AI 2027 追踪器称能力进展仍慢于原始情景 — shadowt1tan · 2026-07-29