密码专家实测大模型解密,暴露AI工具链短板

密码学专家 Matthew Green 近期发起了一项业余项目,测试前沿大语言模型(LLM)与编码智能体在破解历史古典密码方面的实际能力。这项测试不仅揭示了当前 AI 在密码分析上的潜力与局限,更意外暴露了现有 AI 工具链的深层短板,引发了关于未来软件开发范式转变的深刻讨论。

实测细节与能力边界

Green 发现,尽管大模型本身储备了大量密码学知识,但很难将其直接转化为实际的解密操作。如果没有外部工具辅助,即使是顶级的编码智能体也会陷入缓慢的尝试并最终放弃。目前可行的解法是为特定密码暴力创建专属工具,并严格约束 Agent 进行多假设验证和自我评分。在经过大量基于 Claude 和 Codex 的开发后,他认为 AI 编程工具在破解替换密码、同音密码及部分多表密码方面表现出色,堪称目前最佳工具之一,但这种方式整体依然难以泛化。

工具链短板与 Agent 偏好

在实际操作中,Green 观察到当前 AI 编程智能体处理特定任务时存在盲目性,往往会随意抓取质量不佳的开源项目进行尝试,成功与否极具随机性。他批评了目前设计者推崇的本地 MCP 服务器方案,认为其缺乏实际测试(dogfooding)且过于笨重。由于面临供应链风险和可用性障碍,AI Agent 对运行具备各种能力的本地服务器感到警惕,反而更倾向于直接下载并运行命令行(CLI)工具。

软件开发范式转变

基于上述痛点,Green 提出了一个值得关注的新趋势:软件开发者的首要考量正在从“让人类舒适”转向“让 AI 编程智能体舒适”。例如,在 README 中加入针对 Agent 的指令反而会触发安全警告让 Agent 望而却步。他认为未来的目标是构建高质量的、允许智能体自主发现和调用的工具生态。这一观点也得到了其他从业者的呼应,@Financial_Ad_7297 和 @TheZachMueller 均指出,随着 AI 普及,软件界面会逐渐更偏向 Agent 使用,强调 API、结构化数据和权限控制,人类将更多扮演监督者角色。

2026-07-19 ~ 2026-07-20 · 13 条相关