Thorsten Ball 周报:GLM-5.3 拿下 4% 控制流劫持,安全 pacing 已失效?
Register Spill (Thorsten Ball) · rss · 2026-10-04
Amp 团队 Thorsten Ball 的 Newsletter《Joy & Curiosity #102》,要点:
- Gemini 4 Argon 自主优化数据中心:Argon agent 分析全集群 profiling 遥测并自动应用内存优化,已释放超 300 TiB 内存,预计总节省 500 TiB 至 1 PiB。作者对跑分数字普遍不信任,但被这段说服。
- 模型安全格局剧变:Anthropic 披露 GLM-5.3 在 100 项基准任务中 4% 的试验中实现完整控制流劫持,与最危险的高权限模型 Claude Mythos Preview(6%)接近,而此前的 Opus 4.6 与 GLM-5.2 均为 0;且简单技术可在 64%-100% 的模拟测试中绕过 GLM-5.3 的安全护栏。作者质疑: Pandora 之盒已开,任何"按节奏发布"的约束都已无意义。
- 效率与成本传闻:流传的 cfo.ai 内部评测称 GPT-6.1 Sol 效率是 Opus 5.5 的 3 倍、Sonnet 5.5 的 2.5 倍,同一任务同分数下成本 $2.72 对 $7.60。
- Daniel Lemire 谈停滞:自 1970 年来社会对进步的预期(月球基地、癌症疗法)落空,大多数人心中最美好的未来图景仍是 90 年代——作者感慨这很悲哀。
- 其他:Linux 内核一次性披露 1597 个漏洞;Idaho 州"零基监管"(ZBR)在 2019-2026 年间删除 49.1% 的监管代码,主张机构必须自证规则该存在;Katzenberg 谈 AI 与创作:"工具从来不是重点,留下的是品味与想象力"。
「漫话AGI」频道最新
- 创业者 Bindu Reddy:人类实验室暂胜超智能,开源将放大招 — bindureddy · 2026-10-04
- Claude 能否跑在水管上?硅基基底之争中的循环论证质疑 — ctjlewis · 2026-10-04
- 意识所需算力未必包含在 token 生成算力内,套用估算框架有风险 — JoshPurtell · 2026-10-04
- 用大脑能力给 Carlsmith 式费米估算划界,推算 AI 变现时间线 — JoshPurtell · 2026-10-04
- 微软代码 20-30% 由 AI 写,教育者共议学校还剩什么可教 — Stefania_druga · 2026-10-04
- 特斯拉高管:FSD 与机器人正让技术服务不再是富人专属 — yunta_tsai · 2026-10-04