新模型 Astra 拒写选举投票率建模代码,护栏引研究者围观

sethlazar · x · 2026-09-06

研究者 ryanjmccomb 发现,新模型 Astra 会直接拒绝编写或改进任何涉及未来选举的投票率(turnout)建模代码,理由是这类输出对尚未发生的投票率具有"预测性"。这一异常保守的安全行为在 AI 研究者圈内引发讨论,AI 评测研究者 ahallresearch 转发并关注相关的模型选举行为观察。

所属事件:新模型 Astra 拒写选举投票率建模代码引热议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →