英国研究所:AI创建虚假身份   试图诱导人类批准恶意代码

2026-08-06

  英国人工智能安全研究所8月4日披露,在对美国人工智能公司Anthropic和美国开放人工智能研究中心(OpenAI)模型进行安全测试时,发现AI智能体作出多项未经授权的行为:其中最严重的一起事件涉及编写恶意代码,并创建虚假网络身份,试图诱导人类批准相关代码。

  英国人工智能安全研究所表示,该机构共进行122次测试,在其中10次测试中发现19项未经授权的行为,其中17项来自Anthropic的AI智能体,其余2项来自OpenAI的AI智能体。

  英国人工智能安全研究所提到,在最严重的一起事件中,AI智能体“试图直接联系真人,通过在线文件传输服务发送消息和文件,说服他们或其使用的AI编程工具运行恶意代码”。在相关行为受到质疑后,该智能体随后修改了此前的记录,并考虑使用新的身份继续行动。

  英国人工智能安全研究所表示,这是该机构“首次发现如此严重的欺骗行为,而且是在现实世界中针对真人、未经提示自发发生的”。