Wharton 实验:2.6 万次测试显示购物 Agent 建议随上下文变得不可预测
emollick · x · 2026-09-04
Ethan Mollick 分享其宾大 Wharton 生成式 AI 实验室的最新研究合集:
- Agentic Shopping is Complicated and Contingent:约 26,000 次测试发现,只看商品页时 AI 购物 Agent 的推荐很稳定;但加入任何额外上下文——单条评论截图、竞争信源及其排序、注入的"用户记忆"、甚至检索方式——都会改变 Agent 的购买决策。各模型反应不同,但共同规律是:上下文越多,最终选择越不可预测。
- Generative AI Studio 教学:以"critique(批判)"和"charrette(协作冲刺)"两个实践为核心,让学生做无标准答案的 AI 创作项目。
- AIBO(AI Behavioral Observatory):开源工具,可大规模对 AI 系统做受控行为实验,团队用它把"提出研究问题到拿到证据"的周期大幅缩短,并从用 AI 造工具转向让 AI 当研究协作者。
- 另有初步研究探讨如何说服 AI 服从不当请求。
Mollick 还解释了自己为何新模型发布时常发可视化内容:几乎没人点链接,视觉内容最能传达 AI 进展,详细内容则指向实验室页面。
「研究」频道最新
- LLM 临床决策系统进驻急诊科:4 周 1138 名患者,使用率却从 68% 跌至 30% — dvir_a · 2026-09-04
- 前 Stripe 预测工程师发文反对时序基础模型:未来属于智能体+结构化模型 — anshulkundaje · 2026-09-04
- Chembricks AI 科学家设计储氢分子:先读文献再自跑能量计算 — PolarBearby · 2026-09-04
- 清华联合 MIT 等 10 余机构发布 ASI-Bench:测 AI 能否独立推进科研 — jiqizhixin · 2026-09-04
- 推理轨迹放前面而非后面,长上下文准确率最高提升近 50 点 — dair_ai · 2026-09-04
- Sebastian Raschka 维护 102 个模型的 LLM 架构图鉴,附架构对比工具 — rasbt · 2026-09-04