自建向量数据库实测:Fable-5.1 夺冠但波动超 50%,GPT6-Astra 最稳
karminski3 · x · 2026-09-14
博主用「让大模型从零实现向量数据库、按数据库性能计分」的方式,连测三次对比多款模型写后端 Agentic 代码的实测结果:
- Fable-5.1 仍是 SOTA:最高分 21191.51,几乎是第二名的 2 倍,但三次得分(21191.51 / 11915.19 / 7998.93)差距超过 50%,需要经验丰富的工程师写好提示词再用。
- GPT6-Astra 极其稳定:三次得分 12985.28 / 12134.83 / 10676.74,波动很小,作者认为其后训练非常稳定;从省 token(不用反复抽卡)角度更推荐它。
- 国产模型局面类似:Hy4-dev 分数高但三次波动巨大(10778.51 / 6011.78 / 4915.22);Kimi-K3 相对稳定。
- 性价比之选 DeepSeek-V4.1-Flash:得分几乎与 Kimi-K3 相当且波动 <20%,非复杂代码任务可无脑选它;复杂任务再上 GPT6-Astra 和 Fable-5.1。
所属事件:实测大模型从零写向量数据库:Fable-5.1 峰值最高但波动大(2 条相关)→
「编程与Agent」频道最新
- Skill 不是文档:用元编程让 LLM 动态生成 Micro-Skill 处理任意格式发票 — karminski3 · 2026-09-14
- 别让 AI 一次生成的代码超过你一次能改完的量 — cthechartreuse · 2026-09-14
- 开源 Claude skill 一键做 App Store 竞品调研 — iamdsvs · 2026-09-14
- 一条落地页被三个 AI Agent 同时改动怎么办 — OwlZealousideal4779 · 2026-09-14
- Cognition 全球招募 Devin 大使,覆盖近 40 个城市 — cyrus_zei · 2026-09-14
- 给 agent 装上情绪表达引擎:基于 Plutchik 情绪轮的微妙文字动效 — RileyRalmuto · 2026-09-14