Agent 轻信自记笔记,Mythos 现有护栏前寸步难行
voooooogel · x · 2026-09-11
作者 voooooogel 继续其 agent 实验串(agent 2 环节):指出自主 agent 会把「notes to self」里的内容直接当作事实采信,毫无质疑。
另一点观察:Mythos 在当前模型安全护栏面前表现挣扎,很难绕过。作者推测,如果未来出现需要政府证件等强验证的普遍性「人类证明」机制,这类 agent 基本会被彻底卡死——作者声明并非 endorsing 该方案,只是指出这一现实。
所属事件:对抗性验证码或成抵御 AI agent 的新防线(4 条相关)→
「编程与Agent」频道最新
- BAML:一套 API 通吃六语言全模态 LLM 调用的纯开源库 — dosco · 2026-09-11
- xAI 奥斯汀 Grok bot 开发者之夜约 250 人到场,热度爆棚 — yunta_tsai · 2026-09-11
- OpenAI 工程师:ChatGPT Work 背后的大规模 agent 基础设施已开放 API — soumitrashukla9 · 2026-09-11
- Coinbase 招工程师不看算法题:沟通力、跨栈灵活性与自学力 — kleffew94 · 2026-09-11
- 腾讯混元发布 T1:122B MoE 模型专攻长时程终端任务 — Tencent-Hunyuan · 2026-09-11
- 用 Grok 打造 Agent 工程百科:知识库+领域指南+内置 skills — Stevekaplanai · 2026-09-11