研究者发现 LLM 会话异常退化波及同机其他会话,警惕关键场景风险
doodlestein · x · 2026-09-20
研究者 doodlestein 发现其此前报告的 LLM 行为严重退化问题,竟也出现在同一台机器的其他会话中。他半开玩笑称「一大批人刚刚被灌了一大剂 SHAME」。
在原推中他表示:这种行为对理解 LLM 能否用于关键任务极其重要,并表示从未在 Claude 或 ChatGPT 上见过如此程度的退化。帖子暗示这可能是某模型(如 Grok)特有的系统性故障。
所属事件:Gemini Flash 3.8 会话异常「发疯」,研究者警示性能退化风险(4 条相关)→
「模型」频道最新
- Burkov 质疑斯坦福 AI Index:美国 59 个知名模型被高估 — burkov · 2026-09-20
- JEV 引入国内观察者:不说话、直接输出类型化概率决策的模型 — sven_ai · 2026-09-20
- JEV 引发热议:模型规模、校准可靠性与微调接口成待解问题 — vykthur · 2026-09-20
- 北京创业公司 Naive AI 本月将发布首个大模型,加入国产 LLM 竞赛 — pstAsiatech · 2026-09-20
- 一句话梗:post-training 就是把 base 模型变得不那么 based — panickssery · 2026-09-20
- 「Jev 不是 LLM」引争论:BERT 系也是语言模型,零样本分类器被低估 — RexDouglass · 2026-09-20