o3-mini 编制的试题质量对标高利害考试
eldonredwards · x · 2026-08-16
Ethan Mollick 分享了一项关于 AI 生成试题的研究。研究显示,即使是“过时”的 o3-mini 模型,在 agentic loop 中也能生成心理测量学属性与高利害标准化测试相当的试题。该研究是迄今为止 AI 生成试题的最大规模实地研究之一。
「应用」频道最新
- Foilwick 应用集成 MCP,支持 AI 智能体构建卡组 — tristanbob · 2026-08-16
- SkillForge:统一管理 Claude/Cursor 编码技能的开源工具 — tguructa · 2026-08-16
- Sistava 对比 OpenClaw:云端托管与本地自选之争 — Mahmoud_Zalt · 2026-08-16
- 不仅是写作:用 Claude 进行深度思考的 7 个提示词 — hey_abusiddik · 2026-08-16
- 5 个让 ChatGPT 规划旅行胜过代理人的 Prompt — TawohAwa · 2026-08-16
- 开源个人网站构建器 btw:几分钟搭建博客,支持自托管 — tom_doerr · 2026-08-16