通过推理 traces 发现模型能力差距
himanshustwts · x · 2026-09-02
分享了一个评估模型能力的方法:当模型无法直接提取摘要而需要运行终端命令时,通过分析其推理过程(reasoning traces)和报错日志,可以直观地测量模型的能力边界和缺陷。
「模型」频道最新
- RWKV-7 G1j 发布:纯 RNN 架构在 agent 与编码任务大幅增强 — jeremyphoward · 2026-09-02
- Fable 5.1 自选目标解开 373 年历史密码 — rickasaurus · 2026-09-02
- Fable 5.1 模型展示:单次生成的高质量角色渲染 — TAbrodi · 2026-09-02
- Anthropic 安全机制误判:Fable 5.1 测试遭拦截 — GregKamradt · 2026-09-02
- OpenAI 重启大型前沿 RL 训练,Astra 实测获满分 — haider1 · 2026-09-02
- Fable 5.1 生物推理强但拒答频繁影响实用 — kenbwork · 2026-09-02