Goodfire 称可解释性进展顺利,本月起发布模型监控新成果
burny_tech · x · 2026-09-11
Goodfire 研究员 Eric Ho 表示,公司在基础可解释性研究和短期用于监控的 interp 两条线上都进展很快,本月和下月将发布监控方向的成果。他对当前 AI 圈的悲观情绪感到困惑,称 Goodfire 研究员整体对可解释性、对未来的判断「远比外界乐观」,并欢迎外界交流讨论。
「公司和人」频道最新
- 前 OpenAI/Anthropic 研究员辞职:两厂正鲁莽冲刺自我改进超级智能 — csuwildcat · 2026-09-11
- Richard Ngo 长文:AI 安全议程已被 OpenAI 与 Anthropic 收编 — RichardMCNgo · 2026-09-11
- Nathan Lambert:呼吁更多 AI 研究员公开写作锤炼观点 — natolambert · 2026-09-11
- 前 Anthropic+OpenAI 研究员 Jacob Coxon 接受 NBC News 专访 — rohanpaul_ai · 2026-09-11
- Gauntlet AI 推出 10 周免费全职 AI 工程训练营,食宿算力全包 — petrusenko_max · 2026-09-11
- YC 2026 冬季 Demo Day 开幕,现场人气爆棚 — ycombinator · 2026-09-11