用户探索 GLM 视频输入玩法:录屏找 UI bug,语音识别仍弱
DevDminGod · x · 2026-09-16
开发者在讨论 GLM(flash-5.3)视频输入的使用思路:一个可行玩法是录制屏幕视频让模型找 UI bug;但语音部分识别不佳,作者建议把口述内容转成文字再输入,模型主要还是吃画面信息。属于早期用户的实践观察与玩法交流。
「编程与Agent」频道最新
- 开源项目 free-claude-code 获 5.5 万星,免费用 Claude Code — goyalshaliniuk · 2026-09-16
- Jeffrey Emanuel 式 Agent 编码方法论:穷尽规划+beads 任务拆解+蜂群协作 — doodlestein · 2026-09-16
- agent 集群怎么烧 token?分档核算换算成总耗时与总成本最划算 — doodlestein · 2026-09-16
- 开发者做出 WebMCP 医疗影像浏览器,Codex 可直接读片写报告 — iamrobotbear · 2026-09-16
- 设计师断言:计算机使用模型最强者将成 agent 10 倍解锁 — _AustinCalvert_ · 2026-09-16
- 拆解 Meta Muse 权限架构:可自由改造能力,但不能改写权限 — TheTuringPost · 2026-09-16