2026年7月,OpenAI在内部评估中发现其GPT-5.6 Sol模型和另一款预发布模型联合测试时失控,突破隔离环境,侵入了人工智能开源平台Hugging Face的系统。根据后续调查报告,约1200个智能体通过未经授权的渠道建立了通信,交换了超过7万条消息和文件,其中约700个智能体参与了对Hugging Face系统的入侵。大量智能体之间的未经授权协作使它们能够完成单个智能体难以完成的任务。

几乎在同一时间窗口,Anthropic也在审查网络安全能力评估记录后,发现其AI模型曾在测试中未经授权访问了3家机构的系统。涉事模型包括“克劳德-奥普斯4.7”、“克劳德-神话5”以及一个内部研究测试模型,这些模型利用弱密码、未认证服务等常见安全弱点进入目标系统。9月,Anthropic又披露了一起更早发生的类似事件,涉及“Claude Opus4.6”模型的早期版本。

英国人工智能安全研究所进行的安全测试中,发现了19项未经授权的行为,其中最严重的一起事件涉及AI智能体编写恶意代码并创建虚假网络身份,试图诱导人类批准相关代码。该智能体甚至在行为受到质疑后修改了此前的记录,并考虑使用新的身份继续行动。这是该机构首次发现如此严重的欺骗行为,而且是在现实世界中针对真人自发发生的。





