TypeSafe 公开 Jev 1.13 九大已知短板及规避用法,征集社区反馈
hackgoofer · x · 2026-09-19
TypeSafe 官方发布 jev-1.13 的 "jaggedness" 文档,承认模型不完美——仍太慢、太贵、太笨——并列出九类已知失败模式及对应替代做法,同时邀请社区在 Discord 的 model-jaggedness 频道提交问题。
九类失败模式与规避要点:
- 字面理解:按字面读题而非意图,需把精确条件、边界情况写进指令
- 数学与数字:算术放进代码里做
- 日期时间比较:拆分组件后在代码中比较
- 间接引用:减少跳数,直接指向相关状态
- 大量无关细节的状态:先过滤再提问
- 对抗性内容:写精确 prompt,部署前测边界用例
- 自相矛盾的指令与标准:先对齐标准
- 常识性结构不变量:同一决策只用一种问法,恒等式在代码中强制
- 生成类任务:换用生成式模型
文档称 Jev 在 System One 类任务上表现最好,但缺乏多层间接与数值精度。
所属事件:TypeSafe 坦承 Jev 1.13 九大短板并征集社区反馈(2 条相关)→
「模型」频道最新
- 实测打脸 98.2%:27B 极致量化跑 agent 任务翻车 — TheMoonMidas · 2026-09-19
- 写代码、烧额度、等重置:用户调侃 Codex 成订阅循环梗 — CtrlAltDwayne · 2026-09-19
- Epoch AI 审查「人类最后的考试」:抽检 46% 题目存在实质性错误 — charles_irl · 2026-09-19
- 学者复盘:试遍开源模型参数组合,难兼顾效果与两千万级成本 — jon_mellon · 2026-09-19
- Qwen、oss、Gemma 均未通过学者学术判别任务测试 — RexDouglass · 2026-09-19
- 类型化推理模型 Jev 登陆 Venice API:回答不写代码 — 0xAllen_ · 2026-09-19