网友提议“职业倦怠基准”,测试 LLM 上下文耐力

yacinelearning · x · 2026-08-27

作者提出了一个极具创意的评测方案“Burnout Bench”:将基准测试中的任务链接起来,逐一在上下文中提供给 LLM 并累计分数。当 LLM 完成一项后,在同一上下文中给出另一个基准测试,完成后再次给出第一个,循环往复直至模型“精神崩溃”(失效)。这旨在测试模型在极长上下文和连续任务下的耐用性。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →