❯ Anthropic 对齐负责人 Evan Hubinger 称未来十年 AI 致人类灭绝概率超过 10%,担忧递归自我改进
个人判断据其公开帖文,Anthropic 对齐科学负责人 Evan Hubinger 在 X 披露个人判断,他认为未来十年 AI 导致人类灭绝的概率超过 10%,并称超级智能对齐尚没有解决方案。该数字属于研究人员的主观风险估计,不是事故统计,也不是已被科学验证的预测概率。
担忧对象Hubinger 随后澄清,他认为当前模型风险较低,担心的是 AI 通过递归自我改进发展成超级智能:系统帮助改进下一代系统,能力提升可能进一步加快。目前,他的表态回应了围绕实验室行为的讨论,也涉及后续模型研发和发布时的安全条件,不能剪裁为当前 Claude 已有相同程度的灭绝风险。
争论落点研究者对发展速度和失控路径的分歧,不会因为一个醒目百分比就消失。对安全研究与监管政策讨论,更有用的是明确哪些能力触发限制、用什么证据验证改进,以及出现危险行为后如何调整研发。把个人概率与可执行措施分开,既能保留警告,也避免把未经校准的判断包装成确定结论。
▪ SIGNAL主观概率能表达担忧强度,真正可检验的是实验室设定了哪些停止条件,以及触发后会采取什么行动。