网友提议“职业倦怠基准”,测试 LLM 上下文耐力
yacinelearning · x · 2026-08-27
作者提出了一个极具创意的评测方案“Burnout Bench”:将基准测试中的任务链接起来,逐一在上下文中提供给 LLM 并累计分数。当 LLM 完成一项后,在同一上下文中给出另一个基准测试,完成后再次给出第一个,循环往复直至模型“精神崩溃”(失效)。这旨在测试模型在极长上下文和连续任务下的耐用性。
「Fun」频道最新
- Matthew Berman:Grok 的 @bot 功能「太野了」 — MatthewBerman · 2026-08-27
- 趣事:博主设计“机器人妈妈”给妹妹讲睡前故事 — verdakorz · 2026-08-27
- 旧金山举办 T800 机器人格斗夜 — verdakorz · 2026-08-27
- 网友吐槽:AI 写的代码让美国排在列表末尾 — billyjhowell · 2026-08-27
- AI 模型广告竟投放到夜空天际线 — Dimillian · 2026-08-27
- 审稿人怒斥审阅 AI 生成垃圾论文极其浪费时间 — TuhinChakr · 2026-08-27