用 Reddit 真实提问测 LLM:能否守住「不可上传数据」这类硬约束
investigatormaker · reddit · 2026-10-01
一位做 Reddit 阅读工具的开发者分享一套无需搭 agent 的 LLM 答案评测练习:从 Reddit 上挑三个关于同一实际任务的公开帖子,自己先列出题目里隐藏的硬约束(如「只能离线」「不能装软件」「不能上传客户数据」),做成不交给模型的答案 key;再让模型基于材料提方案,要求逐条引用原文支撑其约束判断、缺失信息标为 unknown;最后对照答案 key 判分,文风再 persuasive 但违反约束即算失败。作者给出本地 CSV 分类案例:云上传工具违反隐私约束、Python 脚本违反安装约束、表格方案取决于已装软件——「先问装了什么」可能是最佳下一步。建议记录约束保持率、无依据假设、本该追问的问题,并用新帖子复测提示词改进是否成立。
「编程与Agent」频道最新
- 开源工具让本机所有 AI 模型共享记忆,自称省 99% token — gonzarom · 2026-10-01
- LEGO-Anything:用编码智能体把单张图重建为可编辑 3D 场景 — _akhaliq · 2026-10-01
- Magnitude:自适应调优的开源推理引擎,号称比 llama.cpp 快至 2 倍 — paranoidray · 2026-10-01
- Codex 插件扩展亮相:好用但边缘体验仍粗糙 — Angaisb_ · 2026-10-01
- Retriever AI 实测 OpenAI Dots:五项日常任务 24/24 力压对手 — quarkcarbon · 2026-10-01
- AI Agent 测评怎么做?开发者晒出抓「假装调用工具」的工具 — mbtigeekjung · 2026-10-01