AI Benchmarks Now Test Real Lab Science Skills, Not Just QA
141_1337 · reddit · 2026-09-25
Reddit 帖子指出,AI 正在从答题式基准转向实验室科学能力评测:模型需要实际运行实验、操作实验设备、读取仪器读数,并在出错后自主恢复。视频展示了相关评测场景。
More from AGI Musings
- Anthropic: AI agents now do 26% of its internal research, up from under 1% — mtizard · 2026-09-25
- Commenter argues AI safety discourse is kayfabe, masking money and power questions — LesaunH · 2026-09-25
- Economist Study: AI Boosts Homework Scores 18% but Exam Scores Fall 20% — robleclerc · 2026-09-25
- Andy Matuschak: Modern Chips Are Too Durable for Compute-Control-Based AI Governance to Hold — andy_matuschak · 2026-09-25
- 2027 Will Bring a Wave of Humanoid Robot Panic Coverage, Blogger Predicts — Dr_Singularity · 2026-09-25
- AI safety professor admits EA funding, argues everyone in AI has conflicts of interest — DavidSKrueger · 2026-09-25