Grok 4.7 上手首日:严格遵循 system prompt,实测优于 4.5
elonmusk · x · 2026-09-22
一位开发者在 Grok 4.7 发布首日分享了一整天重度使用体验,反驳「公开基准太差」的负面报道,认为基准和 3D 游戏演示都不能反映真实工作能力。
核心观察:Grok 4.7 对 system prompt 的遵循度显著提升,出现了他从未见过的行为——比如要求用户指明可以绕过哪些红色 CI 检查,并拒绝简单的「yolo」放行指令;他溯源后确认这些行为正是自己 system prompt 中的要求,而其他模型不会这样执行。
总体判断:作为他的 firstmate 编码助手,Grok 4.7 相比 4.5 有可见进步(他跳过了体验不佳的 4.6)。该帖被 Elon Musk 转发。
「编程与Agent」频道最新
- 开源 mcp-server-s3 发布:让 Agent 直接管理 S3 文件与预签名链接 — modelcontextprotocol · 2026-09-22
- apibase 一个 MCP 端点聚合 327 个工具、92 家服务商,按调用付费 — modelcontextprotocol · 2026-09-22
- 开发者自曝:AI 玩游戏插件因视觉模型太慢太贵一直没发布 — ezshine · 2026-09-22
- Agent 跨任务文件怎么存?Reddit 开发者讨论持久化存储方案 — OwlZealousideal4779 · 2026-09-22
- 开源项目 Laya:单次前向 33ms 输出结构化决策,支持 100+ 语言 — pandeyparul · 2026-09-22
- 开发者开源 Jev 搜索 CLI,用概率模型替 LLM 省下解析网页的 token — gaganghotra_ · 2026-09-22