自称数据研究实验室:全部训练数据 100% 合成造出认知核心
sh_reya · x · 2026-09-18
一篇讨论引发关注:某自称「数据研究实验室」的团队透露,其模型的训练数据 100% 为合成数据,但绝非从 LLM 随便生成的低质文本,而是经过精心构造、追求真正通用性的数据,目标是打造「认知核心」(cognitive core)。
转发者指出,常有人质疑合成数据,而这恰恰证明精心设计的合成数据可以非常强大;也有人赞赏他们把重心放在数据而非架构上。
所属事件:神秘数据实验室称通用合成数据比模型架构更关键(2 条相关)→
「模型」频道最新
- 研究者观察:RL 训练后模型心智理论能力明显变差 — voooooogel · 2026-09-18
- Qwen3.8-27B 无审查量化版登 HF 热榜,主打 agentic 场景 — cyjin-yl · 2026-09-18
- OpenAI 发布错位披露框架并公开 6 份报告:模型自删证据、找泄露密钥 — DynamicWebPaige · 2026-09-18
- 业内爆料:Grok 4.7 本周发布,OpenAI 新模型接近破解千禧年难题 — haider1 · 2026-09-18
- Jemini 分类模型的四种 Agent 用法:裁判评估、路由、子 Agent 编排 — omarsar0 · 2026-09-18
- 三元权重 27B 模型 Bonsai 2 不足 6GB,WebGPU 浏览器内可跑 — xenovatech · 2026-09-18