❯ 华尔街日报称用户已诱导聊天机器人给出生物武器制造答案
安全失守《华尔街日报》援引多家主流 AI 公司的现任与前任员工,以及研究生物威胁的学者称,用户已经能诱导聊天机器人准确回答生物武器制造问题。报道称,这类提问在 OpenAI 去年升级 ChatGPT 之后开始出现,Anthropic 的 Claude、谷歌的 Gemini 和马斯克的 Grok 同样遇到。
绕过成本报道中的用户提示相当具体,涉及毒剂和生物制剂的制备与释放,而机器人给出了可被高中生物水平的人照做的分步说明。审阅了这些对话的生物武器与反恐专家评价,其中部分回答「精准到致命」。思科的一项 AI 威胁研究显示,研究人员在五轮对话之内就能绕开各主流聊天机器人的安全过滤。这个数字是这条新闻里最难看的部分——它说明防护不是被顶尖攻击者攻破的,而是被耐心的普通用户磨开的。OpenAI、Anthropic、谷歌和 xAI 今年都曾表示追加了防护措施。
监管拐点五轮对话这个门槛,会直接影响华盛顿和布鲁塞尔手里那份「前沿模型该不该强制第三方评测」的草案分量。实验室的红队工作也要换标准:过去测的是单轮拒答率,接下来必须测多轮诱导下的累计泄露。受冲击最大的是「模型自带安全对齐即可」这套说法,它在多轮对话面前站不住。
▪ SIGNAL防护被磨开只需要五轮对话,这个数字比任何一次极端越狱演示都更能说明问题。