AI 把 Sora 视频当证据,数据污染担忧浮出水面
blacklotusmag · reddit · 2026-07-23
作者讲了一个令人不安的例子:自己让 AI 解释某个动物行为并要求给出来源时,模型竟然把 Sora 生成的视频 当成了“证据”;即使被指出问题后,它仍然继续链接同一个视频。
帖子由此引申到更大的担忧:当网上越来越多的图文视频都是 AI 生成、却又被当成真实来源时,未来训练数据会被“合成垃圾”污染,搜索与引用可信度会下降,模型也可能因为反复学习机器生成内容而变得更差、更爱幻觉。
作者特别担心:
- 搜索结果会越来越像“机器总结机器”
- 小众文化、罕见疾病、稀有语言等信息可能被统计平均淹没
- 训练数据到底如何保证“人类生成”也许会成为长期问题
「漫话AGI」频道最新
- 想在 AI 之上保持优势,人类需要休息睡眠和独处 — dosco · 2026-07-23
- 播客讨论单细胞能否学习、记忆与自主行动 — arjunrajlab · 2026-07-23
- FAccT 讨论:政策没变,不代表研究本身失败 — o_saja · 2026-07-23
- Anthropic 争论升级为模型行为、蒸馏与监管之争 — rickasaurus · 2026-07-23
- 3132 人研究发现,AI 建议会让人更少说「我不知道」 — 量子位 · 2026-07-23
- LLM 时代的 STEM,低垂果实依然值得先摘 — littmath · 2026-07-23