买更强模型前先问是不是用错了活:Jev 实测全记录与上线守则
mikegiannulis · x · 2026-09-18
作者 12 连贴的收官:核心观点是「在买更聪明的模型之前,先检查是不是让它干了错误的活」。后续计划包括给重排器上影子模式、门户路由、「已做过」检测和联系人偏好识别;上线守则是双记录决策、检查分歧、保留 kill switch——离线验证的收益只换来一次生产环境小规模测试,而不是整个业务的钥匙。文中还链接了 TypeSafe AI 的文档:Jev 是首个 System One 模型,接收状态和类型化问题,直接返回 choice/score/noul 等结构化结果与概率分布,所有问题并行独立评估、不产生 context-rot。整个测试只花了一个下午和 20 美分。
所属事件:小模型实测:重排与路由胜出,延迟而非账单是真收益(8 条相关)→
「编程与Agent」频道最新
- 一图流:四种部署策略可视化讲解 — _jaydeepkarale · 2026-09-18
- 开源面板 ServerKit 获 1.3k 星:一键管 VPS 应用与数据库 — tom_doerr · 2026-09-18
- Gary Marcus:Agent 安全没人管,它只是个会说话的未审计服务账号 — GaryMarcus · 2026-09-18
- Amp 创始人谈设计哲学:不做技巧堆砌,让模型用好简单原语 — HankYeomans · 2026-09-18
- You.com 办 AI Agentic 黑客松,挑战自进化学习智能体 — PolarBearby · 2026-09-18
- Muse Mac 版上线:可跨应用读取文件并接入 Perplexity 深度研究 — ChrisUniverse · 2026-09-18