两项研究:AI 聊天机器人理财建议错误率高达 57%-85%
PtrPomorski · x · 2026-09-23
两项相隔两个月、分别在英国和美国进行的研究得出相同结论:通用 AI 聊天机器人的金融建议错多对少。
- 英国 Saturn 研究:整体失败率 57%,复杂问题失败率 88%
- 美国 DeepVest 研究:投资组合计算类问题失败率 85%
- 即使是无需计算的「简单」问题,准确率也仅 54%
- 还存在不一致问题:同一模型在不同时间回答相同问题会给出明显不同答案
- DeepVest CEO 总结:「通用模型被训练得听起来自信,而非正确」——与金融专业需求根本错配
「模型」频道最新
- 用户实测 Sol 6:推理时间减半,额度比 Astra 更宽松 — Simple-Diver-2192 · 2026-09-23
- 创始人建议:OpenAI 应放出更强的内部模型并给 Astra 降价 — bindureddy · 2026-09-23
- Quintin Pope 疑问:Claude 是否出现了上下文内涌现式失范 — QuintinPope5 · 2026-09-23
- Opus 5.5 全基准碾压 GPT-6 Sol,但后者每任务成本仅 1.06 美元 — Vast-Grapefruits · 2026-09-23
- 大模型发布间隔从 73 天缩至 18 天,AI 进步快 4 倍 — tristanbob · 2026-09-23
- 一句 Prompt 让 Opus 5.5 生成半人马座α 3D 模拟 — Angaisb_ · 2026-09-23