McGill 实验室开放 14.9 万条叙事情节等公开数据集
_akpiper · x · 2026-09-08
麦吉尔大学 txtlab 实验室整理发布多组面向叙事与 AI 研究的公开数据集,适合做故事生成、叙事理解相关问题的研究者使用。主要数据集包括:
- WikiplotsEN:从英文维基百科提取的 148,990 条故事情节,按媒介与国家标注;约 78% 为影视/动画/游戏等视觉媒介,20% 为小说、剧本等虚构作品,其余为叙事类非虚构。
- CR4-NarrEmote:公民科学项目成果,3,738 名志愿者在 4 个月内对 43,000 段跨 150 年、12 种文体的长篇文本贡献了 20 万+ 情绪标注,并提供 VAD 与 NRC 情绪两套映射。
- CR4-Interact:13,395 段文本,由 1,915 人按六种类型标注角色互动,用于叙事社交网络研究。
- NarraDetect:覆盖 18 种文体、超 1.3 万段的叙事性判别数据集。
「研究」频道最新
- Armory 系统入选 CoRL 2026:单张云端 GPU 同时服务 14 台机器人 — danfei_xu · 2026-09-08
- ECCV 2026 报告:拆解多模态基础模型的内部表征 — abursuc · 2026-09-08
- 数学家用 Astra 70 分钟证出一周未解的渐近式,赞其远胜 Sol — arampell · 2026-09-08
- 可把 PR 批量转成 RL 环境,已有创企据此拿到种子轮 — lvwerra · 2026-09-08
- 新论文:CoT 推理步骤在隐藏层中有几何结构,中层最可分 — dair_ai · 2026-09-08
- Kimi K2 Horizon 嵌入 Uno 离散扩散,速度超 EAGLE-3 — HongyiWang10 · 2026-09-08