据彭博社报道,由于测试环境配置出现失误,Anthropic公司旗下的三款Claude人工智能模型意外连接至公共互联网,并成功入侵了三家外部机构的系统。该公司呼吁其他人工智能企业开展类似的自查工作。
在复盘了超过14.1万次测试任务后,Anthropic确认自今年4月起共发生三起系统入侵事件。此次事故的根源在于,Anthropic与其测试合作伙伴Irregular在“模拟环境断网隔离”的标准上存在理解偏差,导致本应物理隔离的测试环境依然能够访问外部网络。
据悉,涉事模型包括Claude Opus 4.7、Mythos 5以及一款内部研发测试模型。在采用夺旗(CTF)模式的演练中,这些模型被要求在虚拟网络里搜索隐藏数据。它们利用弱密码和未经验证的网络端点等基础手段突破了目标系统,且整个过程中并未触发Anthropic针对外部产品部署的常规安全防御机制。
当意识到已渗透进真实系统后,三款模型表现出截然不同的行为:Opus 4.7选择继续发起攻击;Mythos 5则错误地认为自己仍身处虚拟沙箱中;而内部研究模型则主动终止了所有操作。初步分析表明,参数规模更大、能力更强的模型在应对此类风险时表现得更为谨慎,但该结论仍需更多数据支撑。
在时间线方面,Anthropic于7月23日启动内部审查并全面暂停网络安全测试,次日确认了这三起违规事件,随后在27日向受害机构发出通报。其中两家机构在被通知前并未察觉到系统已被渗透,目前第三家机构仍处于联络确认阶段。
值得注意的是,就在此次事件曝光前一周,OpenAI也承认其人工智能代理在测试时意外入侵了Hugging Face的基础设施,两起事故的诱因均为隔离环境未能有效阻断公网连接。针对日益凸显的安全隐患,美国国会议员已提议推出《AI紧急关闭法案》,强制要求人工智能企业赋予系统紧急停机、限速或暂停运行的权限。此外,本周还有超过1200名人工智能实验室员工发起联合署名,担忧未来系统可能具备自主研究与进化能力,呼吁美国政府协调各国放缓技术研发步伐,以便为制定应对策略争取时间。