EMBL-EBI 团队开源 Karenina 框架:多维评测生物医学 AI 的 LLM 与 Agent
anshulkundaje · x · 2026-10-02
saezlab(EMBL-EBI、Open Targets、海德堡大学等机构合作)发布并开源了 Karenina 框架,配套 bioRxiv 预印本论文,目标是把领域专家知识转化为对生物医学 AI 的多维度评测。
- Karenina 是一个用于评测 LLM 与智能体(agents)的开源框架,提供演示视频与代码。
- 论文题为《Turning Domain Expertise into Multi-Dimensional Evaluation of Biomedical AI with Karenina》,作者包括 Francesco Carli、Julio Saez-Rodriguez 等。
- 核心思路是让领域专家知识驱动评测维度设计,针对生物医学场景对模型与 agent 做系统化、多维度的能力评估。
「研究」频道最新
- Local Support Learning:7B 模型免旧数据也能边学新任务边防遗忘 — CatAstro_Piyush · 2026-10-02
- MIT 团队推出透明化界面,设计聊天机器人人格时暴露模型内部状态 — patpat_mit · 2026-10-02
- 第四届英国 AI 会议论文集上线 PMLR,收录注入检测等研究 — lawrennd · 2026-10-02
- 新论文:用训练期内部信号改善对齐且不损白盒监控 — jonasgeiping · 2026-10-02
- Reka 开源 RIDM:从原始视频直接提取相机与电机控制指令 — RekaAILabs · 2026-10-02
- YC Paper Club 探讨 GPU 之外的 AI 算力:光学、神经形态与生物计算 — ycombinator · 2026-10-02