LLM 荐股评分近于抛硬币,开发者用股价当标签重做新闻筛选器
Fun_Water2230 · reddit · 2026-09-24
作者曾发布金融模型 deepmoney,长期在中国 A 股新闻的 LLM 流水线上工作。他核查了旧流水线的「投资重要性」评分:AUC 一个月 0.59、另一个月 0.47,基本等于抛硬币;模型自评的「股票相关性」对 20 日超额收益的 rank IC 为 −0.094,符号还是反的。结论:文笔漂亮、毫无信号。
于是他把评分全部推翻,以「市场是唯一裁判」重建整个系统:
- 标签工厂:每条新闻找到相关股票篮子,测量发布时刻起的分钟级反应,与同时刻 500 个随机篮子及其自身正常行为对比,严格 as-of、无前视偏差。
- 安慰剂检验:同篮子提前 5/10 个交易日的对照中,「重大反应」真实样本 3.2% vs 安慰剂 0.3–0.9%;不过关的标签(如全市场层)直接弃用。
- 反直觉发现:旧流水线根本没抽取的新闻,反应强度与抽取出的一样强,「未抽取=负面」是错的,应视为缺失标签。
- Jev 风格模型设计:Qwen3.8-27B + LoRA,移除 lmhead 换成多层 ordinal (cumulative-link) 头,一次 prefill 输出 5 个答案(30 分钟价格反应、T+1、量能爆发、转载量、后续报道),数值市场状态作为 soft tokens 接在文本后;用 ordinal NLL 代替 RL 获得校准。
诚实说明:27B 尚未全量训练(仅在 Qwen3-0.6B 上冒烟测试),需要击败的基线是文本盲 GBM(价格 0.55–0.57 AUC、量能 0.68–0.70)。代码 MIT 开源,附 283k 条带标签中文新闻数据集(非商业研究用途)。
「编程与Agent」频道最新
- 开源视频克隆 Skill:参考片变可编辑工程,本地渲染保留素材复用 — oran_ge · 2026-09-24
- 开源工具 Magnitude 一键匹配本机最佳本地模型,GitHub 已 5k 星 — anselm · 2026-09-24
- JEV 生产落地清单:置信度是边际不是正确率,阈值要按动作代价分层 — sven_ai · 2026-09-24
- ComfyUI Prompt Composer 更新:支持 RefMod 与 LoRA 的可视化提示词编排 — Francky_B · 2026-09-24
- Agent 第一种没有评测的技能:谨慎——别把用户隐私泄露给第三方 — victor_explore · 2026-09-24
- Resend 接入 Stripe Projects,一条命令为 AI Agent 配好邮件服务 — jeff_weinstein · 2026-09-24