前沿模型评测:原生工具链与第三方对比
xeophon · x · 2026-07-20
讨论了在进行前沿模型(尤其针对 CBRN 威胁)能力评估时,如何选择测试工具链(harness)的问题。
- 行业趋势:默认推荐使用模型厂商自带的原生工具链。
- 反直觉现象:部分模型在原生工具链中的表现反而不如在第三方工具(如 Pi 或 Cursor)中好。
- 安全评测建议:为了最大化模型性能以暴露真实极限,评测者必须尝试寻找最适合该模型的工具链,因为恶意攻击者不会局限于标准的 ReAct 循环。
所属事件:前沿模型与Agent评测方法引热议(3 条相关)→
「模型」频道最新
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11
- antirez 谈 Anthropic 禁止未成年人使用 Claude — antirez · 2026-09-11