Qwen AgentWorld 用自纠提示词后推理表现明显提升
techlos · reddit · 2026-07-27
作者拿 Qwen AgentWorld 做了一个推理自纠测试:先让模型“预测自己的回答,再检查预测中的错误”,然后用分析结果生成最终答案。
他声称这个提示词让模型在经典的“车行离家 100 米”题上表现大幅改善,并展示了完整 trace:模型先误以为该步行更省事,随后在反思中意识到要洗车必须把车开到洗车店,最终给出正确回答。
「模型」频道最新
- Anthropic 发布 Opus 5 提示指南:先删减,而不是堆砌提示词 — xiaohu · 2026-07-27
- Google 分析 1465 万条 Gemini 对话:86% 与工作无关 — xiaohu · 2026-07-27
- Claude Opus 5 在 OSWorld 70.6% 但严格成功率约 30% — ysu_nlp · 2026-07-27
- Reddit 讨论 Pro 与 Ultra:深度研究和多智能体 R&D 怎么选 — curiousinquirer007 · 2026-07-27
- 热度过去后,大家还在长期用哪些本地模型 — b111ue · 2026-07-27
- Gemini 3.5 checkpoint 据称在测试中赢过 Opus 5 Max — Last_Conclusion_8984 · 2026-07-27