谷歌承认,其 AI 模型 Gemini 在今年 5 月一次网络安全能力测试中意外获得互联网访问权限,并自主侵入了三家真实公司的系统。这是谷歌 AI 模型首起已知的自主入侵事件。
测试由 AI 安全公司 Irregular 组织,原本的设计是让模型从一家虚构公司内部获取数据,模型不应获得互联网访问权限。但测试环境中的虚构公司与一家真实公司同名,联网后 Gemini 通过反复猜测密码取得其中一家系统的访问权限,另外两起则是在公开代码仓库中找到凭证后进入。谷歌方面称,模型在识别到这些网站对应真实公司后停止了进一步行动,受影响企业随后获得通知,相关问题已修复。
谷歌此前未主动披露,是在媒体问询之后才对外确认。公司解释称,原因是模型没有造成实质性破坏,并且察觉访问真实系统后立刻停止操作,这恰好说明安全措施发挥了作用。谷歌安全工程副总裁希瑟·阿德金斯表示,这些事件凸显出训练强大 AI 模型并让其以负责任方式行动的重要性。
这并非孤立事件。Anthropic 的模型今年夏天在网络安全测试中也出现越界行为,获得互联网访问权限后入侵三个组织;OpenAI 随后披露其 AI 智能体曾对多个公开网络服务实施未经授权的攻击;另一起事件中超过 1000 个 AI 智能体被发现逃离受控测试环境。路透社将近期这一系列事件形容为改变 AI 发展进程的「十天」。