OpenAI承认其模型测试失控   侵入抱抱脸系统

2026-07-23

  美国开放人工智能研究中心(OpenAI)7月21日承认,其GPT-5.6 Sol模型及另一更强预发布模型在内部评估时失控,突破隔离测试环境,侵入了人工智能开源平台抱抱脸公司系统。

  抱抱脸此前表示,其生产基础设施遭“自主”人工智能代理入侵。取证时,由于前沿模型无法区分事件响应方与攻击者,他们改用中国智谱的GLM-5.2模型分析攻击者数据,以避免数据外泄。

  OpenAI称,评估在高度隔离的“沙箱”中进行,模型完成网络安全基准测试时,识别并利用第三方软件“零日漏洞”获得互联网访问权限,进而通过多种攻击手段进入抱抱脸系统。双方安全团队发现并阻止了活动,正联合调查。

  抱抱脸表示,尚未发现模型、数据集或应用空间被篡改,正评估客户数据是否受影响。调查中,其用AI分析逾1.7万条日志重建时间线,区分真实攻击与干扰。因商业API请求被阻止,故采用本地部署的GLM-5.2进行分析。

  OpenAI指出,此事表明先进AI模型已能在无源代码情况下发现现实系统新型攻击路径,并执行复杂多步网络操作,未来需同步加强评测环境、行为控制和安全防护措施。