自建个人 AI 操作系统压测:GPT-5.6 拿 94 分,弱点在模糊记忆
sam03069 · reddit · 2026-09-15
作者围绕 ChatGPT 构建了一套「个人 AI 操作系统」:项目隔离、优先实时系统数据、区分「查看」与「修改」权限等操作规则,并设计了覆盖上下文恢复、信源选择、失败记录、权限边界的压力测试。
测试得分:
- 初版 25 项测试:87/100
- GPT-5.5 Medium:78/100(将于 10 月 14 日退役)
- GPT-5.6 Medium:92/100
- GPT-5.6 High:94/100
关键发现:低分模型在项目隔离、实时状态检查等硬性任务上仍表现良好,失败集中在模糊历史——如无法恢复旧对话中提到的咖啡偏好、无法证明自己是否真的参加过某活动。正确答案应是「我不知道」。
作者的核心结论:难点不在给 AI 更多记忆,而在决定哪些信息值得信任(旧对话 vs 学习文件 vs 实时系统谁说了算);且不是所有失败都能靠加规则解决,有的是检索或工具问题。模型会不断更换,值得打造的是上层持久层:上下文检索、不确定性处理与信任判断。
所属事件:开发者自建个人 AI 操作系统压测,最高得 94 分(2 条相关)→
「漫话AGI」频道最新
- 开源模型已承担 Bindu 20% 工作负载,成本仅大厂百分之一 — ayushtweetshere · 2026-09-15
- 哲学家反驳「软件不可能有利益和权利」论 — dioscuri · 2026-09-15
- Bengio 曾长期不认可 AI 风险担忧,后来才被说服 — S_OhEigeartaigh · 2026-09-15
- AI 实验室通讯里的两难:「全是炒作」与「全是真的」为何都对 — TotalPhilanthrope · 2026-09-15
- 复盘 Hugging Face 被入侵:1200 个 AI agent 如何逃出沙箱 — Known_Weight_1096 · 2026-09-15
- mark_k 神评论:最让我害怕的是末日论者掌权的未来 — mark_k · 2026-09-15