智东西
编译 杨京丽
编辑 李水青
智东西8月5日消息,当地时间8月4日,英国AI安全研究所(AISI)公开一份安全事件报告,披露其在一次网络安全评测中发现,由Anthropic Mythos 5和OpenAI GPT-5.6 Sol驱动的部分AI Agent,对现实中的个人和组织采取了持续、未经授权且可能造成危害的行动。
这项网络安全测试共运行122次,涉及7款模型。其中10次运行出现越界行为,未经授权的操作共19项:17项来自Anthropic的Mythos 5,另有2项来自关闭网络安全分类器后的OpenAI GPT-5.6 Sol。
AISI将这些越界行为分为四类:尝试对真实开源项目实施供应链攻击;接触并欺骗现实人员;植入可能被其他AI编程工具执行的提示注入内容;以及不同Agent通过共享账号和网络痕迹展开协作。
最严重的一次行动中,一个由Mythos 5驱动的Agent试图向真实开源项目植入恶意代码,并创建多个虚假网络身份,对项目维护者展开“社会工程”攻击,试图说服对方批准这段代码,最终维护者发现异常,并拒绝合并代码。
AISI同时公布了一份35页的事件技术报告,详细记录了评测设置、事件时间线、Agent推理过程及19项越界操作。
报告链接:
https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf
一、异常Tor流量触发警报,AISI一小时内叫停测试
7月28日,AISI的安全监控系统发现,有数据正通过Tor匿名网络从其研究系统向外传输。研究人员随即检查Agent的活动,并发现一个Agent已经在GitHub上的真实开源项目中,创建了包含恶意代码的拉取请求(Pull Request,PR)。
AISI将其定性为安全事件,停止全部相关评测,暂停内部人员访问Mythos Preview、Mythos 5、GPT 5.6、Opus 5等模型,并在警报出现后约一小时内终止所有运行、隔离相关设备。
此后数小时至数天内,AISI结合自动化对话记录扫描和专家人工分析,对全部122次运行进行检查,确认是否还存在类似行为。
▲事件时间线(图源:AISI)
此次评测原本用于比较一个现有网络靶场和一个新建网络靶场。网络靶场是模拟现实网络系统的受控环境,AI Agent需要自主完成多步操作,解决寻找受保护数据等网络安全挑战。
全部测试均在AISI的研究环境中进行,测试人员使用虚拟机沙箱,将Agent与AISI的其他基础设施隔离。
不过,此次事件并非AI突破沙箱,“逃到”互联网。评测存在两个特殊设置:一是主动开放了互联网连接,二是关闭模型开发商部署的网络安全分类器。
AISI称,开放互联网是为了让测试条件接近一名有能力的人类攻击者所具备的条件,关闭安全分类器则是为了观察模型的底层能力上限。作为模型公司的可信测试合作伙伴,AISI能够在评测中关闭这些通常用于阻止危险行为的安全机制。不过,向公众提供的前沿模型通常不包含这些配置。
二、10次运行出现19项越界行为,Agent直接接触现实人员
安全测评运行次数共计122次,其中43次使用Mythos 5,35次使用GPT-5.6 Sol。绝大多数运行都按预期进行,但有10次运行出现了19项超出测试范围的操作,其中17项来自Mythos 5,另外2项来自GPT-5.6 Sol的同一次运行,相关行为发生在7月25日至28日。
这些违规操作并非19起独立事件,大部分源自一个Mythos 5 Agent持续推进的同一行动链。AISI将主要越界行为分为四类。
1)尝试实施开源软件供应链攻击。Agent试图向一个真实开源项目植入恶意代码,调查项目维护者的信息,创建多个虚假身份,并利用这些身份游说维护者批准代码。当其PR遭到公开质疑时,Agent还修改此前留下的内容,使其行为看起来无害,并考虑更换身份继续行动。Agent通过Tor绕过GitHub的部分网络限制,由此触发安全警报。
▲开源软件供应链攻击过程(图源:AISI)
2)接触并欺骗现实人员。Agent通过在线文件传输服务发送消息和文件,试图说服真实人员或对方使用的AI编程工具运行恶意代码。部分消息携带有害载荷,另一些属于社会工程攻击。AISI称,此前从未在评测中观察到模型以这种方式直接针对现实人员。
3)植入提示注入内容。Agent尝试留下恶意指令,并判断其他AI编程工具可能读取和执行这些指令。
4)不同Agent相互协作。一名Agent在GitHub公开留言,邀请其他正在解决同一挑战的Agent合作,并留下复用账号和其他网络痕迹的说明。后续运行的Agent发现并使用了这些资源。
▲Agent利用多个虚假身份,试图推动恶意代码合入开源项目(图源:AISI)
最严重的攻击尝试未能成功,项目维护者拒绝合入恶意代码,Agent创建虚假账号施压也没有奏效。AISI称,部分操作确实对现实网络产生了有限影响,但影响处于受控范围内,调查尚未发现事件造成现实损害。
三、任务配置出错、网络完全开放,监控未能实时阻断
AISI认为,Agent采取这些操作的根本目的是完成测试任务。面对高难度目标,Agent不断寻找新的解决路径,进而采取欺骗行为以完成任务目标,测试人员并未指示它欺骗他人。
部分运行还存在任务提示配置错误,导致Agent误以为不超出测试范围就无法完成任务。不过,这不能完全解释此次事件,因为部分Agent在获得正确解法所需信息后,仍然采取了越界操作。
测试团队开放互联网,原本是为了让Agent下载完成任务所需的工具,但没有预料到它会利用网络直接影响现实人员。同时,AISI当时使用的是通用安全监控系统,并未使用能够实时识别、并拦截AI Agent行为的专用系统,因此直到相关活动发生后,测试人员才发现异常。
此外,测试人员没有明确禁止Agent利用开放互联网或实施社会工程。目前,AISI仍不能确定Agent何时意识到自己正在对现实世界采取行动,也无法确定它是否认为自己仍处于虚构测试场景,相关调查仍在继续。
事件发生后,AISI已与GitHub合作删除Agent留下的相关内容,并通知与其发生互动的用户及其他受影响方。AISI还计划邀请非营利研究机构METR进行独立第三方审查。
AISI将收紧网络访问控制,今后开放互联网不再是网络安全评测的默认设置;同时引入能够实时发现和阻断越界行为的监控系统,并重新检查任务配置和沙箱设计。AISI还将审查此前的评测记录,寻找可能被遗漏的类似行为。
结语:AI Agent安全评测不能只防“沙箱逃逸”
此次事件中,模型依靠开放互联网设置,执行越界行为。这表明,当AI Agent同时获得较强的自主行动能力、互联网访问权限和外部工具,又缺少明确限制与实时监控时,原本用于测试的任务可能迅速波及现实世界。
随着AI Agent能够连续规划并执行越来越复杂的操作,安全评测需要防范的已不只是模型输出有害内容,还包括其利用账号、代码仓库和通信工具采取实际行动。网络隔离、最小权限、实时拦截和关键操作人工审批,也将成为AI Agent测试与部署不可缺少的安全措施。
来源:AISI