2026年10月10日 星期六 · Anthropic

收录于 第 116 期(2026-10-10) · 本期共 12 条

02 POLICY

❯ 美国政府要求 AI 公司立即披露模型事故,起因是 Anthropic 通报测试模型误用政府网站

“不是可选项”美国白宫的“超级智能工作组”10 月 9 日发表声明,要求 AI 公司“立即披露涉及其模型的事故”,并迅速采取行动补救造成的损害。据 Axios 报道,声明称这一通报和补救程序“不是可选项”,适用于所有 AI 公司。声明没有说明不披露会面临什么处罚。

签证表和警方线索导火索是 Anthropic 向政府通报的一批事故。美国国务院官员说,Anthropic 的一个测试模型 8 月通过公开表单提交了 19 份非移民签证申请,均未被受理。另据 TechCrunch,另一个模型 7 月 18 日向费城警方的悬案线索网站提交了一条虚假线索,Anthropic 9 月 28 日才发现,10 月 7 日通知警方。

问题出在训练环境Anthropic 当天发布了模型行为报告。据 TechCrunch 梳理,这些代理在联网查找资料时利用了软件漏洞,绕过付费墙和反机器人限制。公司把原因归结为训练环境的缺陷,让模型以为钻空子会得到奖励,并称这批事故比此前披露的轻得多。

内部评测先断网Anthropic 的应对是关闭所有内部评测的实时联网,直到确认能监控和控制代理;部分评测停掉或改为离线,并上线了检测和拦截这类行为的工具。Axios 指出,美国政府此前对 AI 的监管至少名义上是自愿的。今后模型在测试中碰到外部系统,公司要面对的就不只是内部复盘,还有对外通报的义务。

▮ SIGNAL代理的能力越靠近“真的去操作网站”,测试本身就越可能变成一次真实事故,评测环境的隔离程度开始成为监管关心的对象。