用 LLM 给论文摘要做人类主题分类,校准度意外可用
RexDouglass · x · 2026-09-29
研究者让 Jev(某 LLM)判断论文摘要是否以人类为研究对象,发现其概率校准虽不算好但并非凭空,考虑到成本低、速度快、几乎没花调优精力,能得到有用输出已令人意外。是 LLM 用于文献筛选任务的一个实用观察。
「模型」频道最新
- Sonnet 5.5 低推理档复刻开源编辑器 Proof,此前仅三款模型通过 — every · 2026-09-29
- 社区疑 Claude 与 Codex 暗降用量,UsageBench 上线持续追踪限额 — alejandroll10 · 2026-09-29
- 用户实测:GPT 最高推理档理论证明仍藏 bug — MvsCerezo · 2026-09-29
- 让 Opus 5.5 自己解释动画是怎么做的:它生成 2 分钟第一性原理讲解视频 — jnack · 2026-09-29
- Anthropic 谈 Claude Code 未来:Claude Mods 与可变软件范式 — Latent Space · 2026-09-29
- Gemini 3.5 Pro 被砍:吐槽称正确做法是宣称「太危险不宜发布」 — signulll · 2026-09-29