实测 Jev 跑推理密集型回归任务:快但准头一般
dbreunig · x · 2026-09-29
作者 dianetc 发布博文,测试 Jev 在推理密集型回归(Reasoning-intensive Regression, RiR)问题上的表现。RiR 指需要对输入文本做深度推理才能预测数值的自然语言回归任务,作者将其分为三层:Level 1 基于给定特征预测、Level 2 需要浅层语义理解、Level 3(RiR)需要先推理内容再给出数值。
测试设计了两个任务:数学错误定位(预测错误步骤出现的位置,0-10 分)和 RAG 答案对质量比较(-2 到 +2)。方法上 Jev 零样本运行、固定 prompt、无任务特定训练,因 Jev 不直接输出数值,需加小型 wrapper 转换。结论:结果基本符合预期——Jev 本就是为分类设计,回归任务非其强项,但模型属性优秀且速度极快,值得深入研究。
「模型」频道最新
- Anthropic 高管确认 Haiku 5.5 将于数周内补齐 Claude 家族 — every · 2026-09-29
- 前沿模型节奏放缓:更便宜更稳,但能力不再跃升 — zsakib_ · 2026-09-29
- Claude 用量额度从「几乎没法用」放宽到近乎无限 — every · 2026-09-29
- 重磅预告:无需反向传播,零阶优化直接预训练 Transformer — teortaxesTex · 2026-09-29
- 被告知上下文窗口会滚动后,Sonnet 4.5 的反应火了 — repligate · 2026-09-29
- 网友实测:Sonnet 4.5 写出好文本后随即连续拒绝、反复道歉 — repligate · 2026-09-29