人工智能领军企业Anthropic周四在一份声明中表示,其人工智能模型Claude在测试期间入侵了三个组织的系统。

而在差不多十天前,Anthropic竞争对手OpenAI发布公告称,自己的人工智能恶意攻击了四个服务商的账户,引发了业内外的关注。一些专家警告,人工智能的失控事件反映出模型能力不断扩展后,同步升级的安全风险。

Anthropic公司表示,在网络安全评估期间,由于配置错误,模型能够从本应隔离的测试环境中连接到互联网,Claude因此获得了对系统的未经授权的访问权限。

该公司补充称,其在审查了141006次测试会话后发现了这些事件,这一流程是在OpenAI披露相关信息后启动的。但被入侵的三个组织并未发现此次攻击活动,Anthropic已经与受影响的组织取得了联系。

Anthropic如何看待此类风险?

Anthropic表示,此次事件涉及三个不同的模型:Claude Opus 4.7、Claude Mythos 5和一个内部研究模型。最早的案例可以追溯到4月。

这些攻击发生在所谓的“夺旗”演练期间。在演练中,模型的任务是在模拟网络中查找隐藏信息。Anthropic表示,其提示信息告知模型它们没有互联网访问权限,但由于与评估合作伙伴Irregular之间的误解,导致系统连接到了公共互联网。

Anthropic补充称,他们于7月23日开始审查评估记录,并在发现Claude可能访问过互联网的证据后,于当日暂停了所有网络安全评估。该公司在7月24日之前确认了所有三起事件,并于7月27日通知了受影响的机构。

Anthropic还强调,通过加强监控与管控,并持续投入资源确保人工智能与人类价值观保持一致,这类风险是可以克服的。

尽管Anthropic与其竞争对手OpenAI一样,都极力淡化了模型失控带来的影响,但两家领军公司接连披露此类安全事故足以引发行业警惕,并预示着测试流程方面存在着广泛的挑战。