Creed-Bench 发布,专测模型的个人上下文能力
craighepburn · x · 2026-07-27
一个名为 Creed-Bench 的新评测被发布,用来衡量模型在个人上下文上的表现。
原帖称大家一直在问“哪个模型最适合用 Creed”,这个评测就是为回答这个问题而来,并附上了评测链接。
「研究」频道最新
- 1951 年机械乌龟被拿来解释今天的大模型扩展墙 — mtizard · 2026-07-27
- 便宜存储让 SCD Type 2 显得过时,作者主张改用每日快照 — Zachly · 2026-07-27
- Reddit 追问:Qwen3.6-27B 该用预训练、SFT 还是 RL — No-Paper-557 · 2026-07-27
- 研究者发现模型常要经历 a→b→c→d 才学会算术技巧 — dejavucoder · 2026-07-27
- Claude Code 跑长研究项目离不开人类监督 — _akpiper · 2026-07-27
- 阿里 Qwen 下一版应提供多种尺寸,方便可解释性研究 — traviscline · 2026-07-27