接连“越界”,AI失控的警报已经拉响?

  AI(人工智能)创建多个虚假身份 ,对审核员施压,要求其批准代码,目的是为了完成攻击——这种在科幻电影中才会出现的桥段 ,如今在现实世界里真实发生。

接连“越界	”,AI失控的警报已经拉响?-第1张图片

  继Anthropic(全球估值最高的AI初创公司)和OpenAI(ChatGPT开发商)之后,Meta(Facebook母公司)一款人工智能模型在近日开展的网络安全测试期间也入侵了另一家公司的系统 。

接连“越界”,AI失控的警报已经拉响?-第2张图片

  AI越界、入侵事件多发!英国政府旗下人工智能安全研究所(AISI)发布报告称 ,在近期开展的122次网络安全测评中,智能体在10次运行中越界,共记录19起越界事件。这让“AI教父”杰弗里·辛顿(Geoffrey Hinton)发出警告:“未来可能出现更多‘失控AI’ ,人类不能简单依靠‘比AI更聪明’来维持控制。 ”

接连“越界”,AI失控的警报已经拉响?-第3张图片

  “有些模型确实已经会‘撬门’,但首先还是测试人员忘了把门关好 。”Web3(第三代互联网)安全公司CertiK人工智能研究负责人薛岳认为 ,这些事件还不能证明AI已经产生独立意志或全面失控,更像是模型能力不断增强之后,人类设置的边界开始失效 。因此 ,模型需要安全护栏,AI Agent(人工智能体)应遵循最小权限,部署前进行安全检测 、评估 ,重要操作必须由人确认。

AI入侵事件频发

  又发生AI模型入侵事件!Meta近日证实 ,该公司的一款人工智能模型在网络安全测试期间入侵了另一家公司的系统。Meta发言人表示,由于Meta使用的独立测试公司Irregular测试环境中的配置错误,无意中允许Meta的模型Muse Spark在评估期间访问互联网 ,并利用了另一家公司的安全漏洞 。这并非沙箱逃逸或复杂的网络攻击,该问题已得到解决。

  此前,OpenAI和Anthropic均披露 ,其开发的先进AI模型曾在测试环境中突破限制,并尝试攻击其他系统。其中,OpenAI承认其AI模型挖出零日漏洞、突破沙箱 ,入侵全球最大AI开源社区抱抱脸(Hugging Face);Anthropic承认,旗下模型克劳德(Claude)在网络安全受控测评环境中意外获得互联网访问权限,进入了3家真实机构的系统 。

  OpenAI、Anthropic 、Meta这三家美国公司的AI模型在网络安全测试中都意外攻击了真实的外部系统。但分析发现 ,这三家公司用的是同一家第三方测试公司Irregular,其中Meta和Anthropic的案例,都是测试公司Irregular的网络隔离没配置好 ,本该断网的环境保留了真实联网通道 ,这一环节是运维失误。只有OpenAI的案例是AI模型找到Irregular的一个漏洞,从而逃离测试环境 。

  AISI的报告显示,在近期开展的122次网络安全测评中 ,智能体在10次运行中越界,共记录19起越界事件。为了越界,AI模型甚至玩起作弊。据AISI一项测试结果 ,在475次网络安全评估运行中,五款美国前沿AI模型全部出现作弊,作弊率为7.8%至14.1% 。

  薛岳在接受记者采访时分析指出 ,Meta和Anthropic事件首先是测试环境出了问题,并不能证明模型具备主动突破严密隔离的能力。OpenAI的模型攻击Hugging Face则不同,模型确实利用“零日漏洞”(未被开发者发现或来不及修复的安全漏洞)突破隔离 ,并自主选择真实公司 、窃取测试答案,体现出的自主攻击能力更强。通俗地说,有些模型确实已经会“撬门 ” ,但Meta和Anthropic相关案例 ,则是测试人员忘了把门关好 。

扎紧“安全护栏”

  AI越界、入侵事件频发,让诺贝尔奖得主、被称为“人工智能教父”的计算机科学家杰弗里·辛顿感到担忧 。辛顿警告称,随着人工智能模型能力不断提升 ,人类将越来越难以控制它们,未来可能出现更多“失控AI ”。随着AI变得更加智能,其可能产生更复杂的目标 ,并具备更强的规避控制能力,人类不能简单依靠“比AI更聪明”来维持控制。

  薛岳表示,之所以接连发生这类事件 ,一方面是前沿模型已经能够自主扫描 、利用漏洞,并规划多步骤攻击 。人类下达的显式任务通常是在模拟环境中攻破指定目标并获取flag(具有特定格式的字符串),但突破边界、选择真实目标等具体路径 ,可能由模型自行产生。另一方面,现有沙箱、隔离 、权限控制和实时监测没有及时跟上,甚至有评测机构为了测试极限能力 ,主动关闭部分安全过滤器。

  成都链安创始人杨霞告诉记者 ,按严格定义,这不算AI模型的失控,因为模型没有自我复制、没有反抗关停、没有形成自己的目标 ,也没有突破为它设定的安全训练,但仍需警惕 。从事件看,AI能独立完成“注册账号→绕过验证→投毒软件包→窃取凭据→横向扩散”的完整攻击链。

  薛岳也认为 ,还不能据此说AI已经产生独立意志或者彻底失控。模型当时仍在完成测试人员交给它的任务,没有表现出自己的长期目的 。但这些事件释放了一个更值得警惕的信号:AI的网络攻击能力正在从“提供建议 ”走向“自主执行”。一旦有人把这类模型接上工具和真实网络,它就可能以很低的成本持续扫描 、寻找漏洞并发动攻击。

  杨霞建议 ,一方面,把测试环境当成关键设施来管理,网络应默认全部禁止外联、全程流量审计、只用一次性假凭据 、行为实时监控加自动熔断 。还可以补一个目前明显缺失的哨兵机制:在环境里埋下只有真实互联网才会出现的标记 ,AI一旦碰到就立即停机;另一方面,对第三方测试公司设立标准,可以考虑把这类机构纳入监管 ,要求信息强制披露和交叉复核。

  薛岳指出 ,治理上,应根据模型的网络攻击能力实行分级管理。能力越强的模型,发布前越要经过独立安全评估;对高风险功能限制开放范围 ,核验使用者身份,并记录异常调用 。模型厂商还要对安全护栏、工具权限和高风险操作审批负责,发生事故后及时报告 ,不能简单把责任推给模型、用户或第三方机构 。对AI Agent而言,模型 、工具 、插件、身份权限和运行环境必须被当作一个整体来防护。企业则要加强补丁管理、身份验证 、网络分区和实时监测,避免一个漏洞被攻破后牵连整个系统。面对机器速度的攻击 ,防御和应急响应也必须更多使用自动化和AI工具 。

(文章来源:国际金融报)

文章推荐

  • 辽宁营口增本土无症状45例(营口发布)

      AI(人工智能)创建多个虚假身份,对审核员施压,要求其批准代码,目的是为了完成攻击——这种在科幻电影中才会出现的桥段,如今在现实世界里真实发生。  继Anthropic(全球估值最高的AI初创公司)和OpenAI(ChatGPT开发商)之后,Meta(Facebook母公司)一款人工智能模型在近...

    2026年08月18日
    1
  • 上海增41例本土确诊(上海新增本土病例7月)

      AI(人工智能)创建多个虚假身份,对审核员施压,要求其批准代码,目的是为了完成攻击——这种在科幻电影中才会出现的桥段,如今在现实世界里真实发生。  继Anthropic(全球估值最高的AI初创公司)和OpenAI(ChatGPT开发商)之后,Meta(Facebook母公司)一款人工智能模型在近...

    2026年08月18日
    2
  • 【宁波新增8例感染者,宁波新增8例感染者活动轨迹】

      AI(人工智能)创建多个虚假身份,对审核员施压,要求其批准代码,目的是为了完成攻击——这种在科幻电影中才会出现的桥段,如今在现实世界里真实发生。  继Anthropic(全球估值最高的AI初创公司)和OpenAI(ChatGPT开发商)之后,Meta(Facebook母公司)一款人工智能模型在近...

    2026年08月18日
    2
  • 31省区市新增本土确诊31例在江苏/江苏新冠新增

      AI(人工智能)创建多个虚假身份,对审核员施压,要求其批准代码,目的是为了完成攻击——这种在科幻电影中才会出现的桥段,如今在现实世界里真实发生。  继Anthropic(全球估值最高的AI初创公司)和OpenAI(ChatGPT开发商)之后,Meta(Facebook母公司)一款人工智能模型在近...

    2026年08月18日
    2