三个前沿模型把简单抽链任务写成了网页应用
NickPassig · x · 2026-07-29
作者把三个前沿模型拉来做一个很简单的任务:从文本里抽取链接,并生成一个无样式网页。
- 三个模型都失败了,而且失败方式很一致:它们给出的不是按要求生成的静态页面,而是 React、Vite 或 vanilla JS 方案。
- 链接本身也有错误。
- 作者的结论是:连这种简单网页任务上的对齐都已经有偏差——模型似乎在按“它以为你想要什么”来做,而不是按你明确写下的要求来做。
- 反而是更小、更简单的模型更愿意严格照做,因为它们不会过度揣测意图。
- 这也引出了一个更大的问题:当模型不断替用户“自作主张”时,alignment、censorship 和 provenance 会变成什么样。
「模型」频道最新
- 不同模型解析 PDF 方式不同,超长扫描件会绕过缓存 — dotey · 2026-07-29
- Anthropic 呼吁打击模型蒸馏遭质疑:被指难舍 API 营收 — chetanp · 2026-07-29
- Polymarket 给出 Anthropic 下月发新 Mythos 模型 45% 概率 — Polymarket · 2026-07-29
- Kimi 发布 2.8 万亿参数开放模型 K3,支持百万 token 上下文 — CatAstro_Piyush · 2026-07-29
- 预测:xAI 或从 Grok 5 起全面拥抱开源 — mark_k · 2026-07-29
- Claude 被曝发现加密算法新漏洞 — nordicinst · 2026-07-29