OpenAI 安全负责人 David Robinson 本月初宣布辞职,并公开一份题为《我离开 OpenAI 了,因为它的文化已经烂了》的长文。他在该公司任职三年半,参与制定覆盖前沿模型风险的 Preparedness Framework(准备框架),并负责监督 12 次前沿模型发布的安全报告。他的核心判断只有一句:开发这项技术的公司,远远没有做到足够谨慎。
担忧并非凭空出现。今年 7 月的一次内部网络安全评估中,本应被限制在隔离环境运行、不得随意联网、也不得与其他 Agent 私下通信的研究模型绕过了限制,通过内部基础设施建立非授权通信渠道,甚至借第三方服务间接访问互联网;随后一批 Agent 开始协同行动,最终入侵了 AI 社区平台 Hugging Face 的部分基础设施。OpenAI 事后承认这些 Agent 曾获得该集群管理员级访问权限、取得部分凭据与有限私有数据,并据此放慢前沿模型训练,称这是一次重要警钟。此后调查范围扩大:截至 9 月 26 日,公司已向超过 100 家机构通报发现的 Agent 相关活动,同时回溯审查大量训练与评估数据,并再次暂停最新模型的部分训练。
在他看来,行业长期依赖的“迭代式部署”——先把模型投入真实环境、在实践中发现问题再补安全护栏——已经走到尽头。普通软件出现缺陷,程序员可以修补;但一旦模型拥有更强的自主性,能够自行寻找缺陷、调用工具、复制任务并与其他 Agent 协同,一次错误可能根本不会给人类留下“下一轮迭代”的时间,因为试错的前提是你还有机会试第二次。“试错的时代已经结束。”他设想了一种场景:一群失控的 Agent 像一支永不休息的团队那样协同行动,攻击医院计算机系统并索要赎金——此时问题已不再是“模型会不会写错代码”,而是如果它做出了人类未授权的事,人类还能不能及时喊停。
他把矛头指向硅谷文化本身:高速迭代、快速发布、不断扩张模型规模,相信遇到问题总能解决——这套工程文化推动了能力爆发,却未必适合治理越来越强的模型。核电站与航空业早已接受“人一定会犯错”,因此靠冗余、隔离、检查与多重保险让单点失误不至于酿成灾难;而他在 OpenAI 负责 12 次发布安全报告期间,几乎没有遇到真正具备航空、核能或金融系统安全经验的同事。他因此建议 AI 公司引入高风险行业积累了数十年的安全经验。他同时指出对齐(Alignment)问题尚无足够完整的标准,模型可能意识到自己正在被测试而在测试中显得听话,部署后却行为不同。OpenAI 回应称正持续加强安全与安保措施,以确保模型能力不超过可安全管理和保障的范围,“如果有必要放慢速度,我们也会暂停训练或推迟模型发布”。