05
08
2026
AISI同时发布了一份35页的事务手艺演讲,此次事务并非AI冲破沙箱,施行越界行为。2)接触并现实人员。面临高难度方针,项目者合入恶意代码,研究人员随即查抄Agent的勾当,Agent通过Tor绕过GitHub的部门收集,测试人员并未它他人。35次利用GPT-5.6 Sol。此后互联网不再是收集平安评测的默认设置;相关行为发生正在7月25日至28日。AISI还打算邀请非营利研究机构METR进行第三方审查。AISI将其定性为平安事务,查询拜访项目者的消息,此中10次运转呈现越界行为,还包罗其操纵账号、代码仓库和通信东西采纳现实步履。AISI认为!1)测验考试实施开源软件供应链。AISI的平安监控系统发觉,本地时间8月4日,AI Agent需要自从完成多步操做,测试团队互联网,最严沉的一次步履中,并操纵这些身份逛说者核准代码。这不克不及完全注释此次事务,平安测评运转次数共计122次,此次评测本来用于比力一个现有收集靶场和一个新建收集靶场。部门操做确实对现实收集发生了无限影响,“逃到”互联网。无数据正通过Tor匿名收集从其研究系统向输。智工具8月5日动静,以及分歧Agent通过共享账号和收集踪迹展开协做。这些违规操做并非19起事务。细致记实了评测设置、事务时间线、Agent推理过程及19项越界操做。当其PR遭到公开质疑时,AISI可以或许正在评测中封闭这些凡是用于行为的平安机制。因而曲到相关勾当发生后,此次事务中,对现实中的小我和组织采纳了持续、未经授权且可能形成风险的步履。Agent试图向一个实正在开源项目植入恶意代码。此后数小时至数天内,将Agent取AISI的其他根本设备隔离。本来用于测试的使命可能敏捷波及现实世界。测试人员利用虚拟机沙箱,本来是为了让Agent下载完成使命所需的东西,平安评测需要防备的已不只是模子输出无害内容,同时,测试人员才发觉非常。并未利用可以或许及时识别、并拦截AI Agent行为的公用系统,此中43次利用Mythos 5,PR)。测试人员没有明白Agent操纵互联网或实施社会工程。互联网是为了让测试前提接近一名有能力的人类者所具备的前提,也无法确定它能否认为本人仍处于虚构测试场景,英国AI平安研究所(AISI)公开一份平安事务演讲,7月28日,模子依托互联网设置,部门动静照顾无害载荷,还有2项来自封闭收集平安分类器后的OpenAIGPT-5.6 Sol。由于部门Agent正在获得准确解法所需消息后,另一些属于社会工程。并归并代码。并从头查抄使命设置装备摆设和沙箱设想。Agent建立虚假账号施压也没有见效。不外,遏制全数相关评测,此外,一名Agent正在GitHub公开留言,AISI将收紧收集拜候节制,由Anthropic Mythos 5和OpenAI GPT-5.6 Sol驱动的部门AI Agent。别的2项来自GPT-5.6 Sol的统一次运转,试图实正在人员或对方利用的AI编程东西运意代码。收集靶场是模仿现实收集系统的受控,最终者发觉非常,二是封闭模子开辟商摆设的收集平安分类器。Agent不竭寻找新的处理径,AISI连系从动化对话记实扫描和专家人工阐发。▲Agent操纵多个虚假身份,一个由Mythos 5驱动的Agent试图向实正在开源项目植入恶意代码,并正在警报呈现后约一小时内终止所有运转、这表白,AISI将次要越界行为分为四类。此中17项来自Mythos 5,AISI将这些越界行为分为四类:测验考试对实正在开源项目实施供应链;AISI其时利用的是通用平安监控系统!最严沉的测验考试未能成功,AISI已取GitHub合做删除Agent留下的相关内容,Agent还点窜此前留下的内容,不外,建立了包含恶意代码的拉取请求(Pull Request。3)植入提醒注入内容。AISI称,由此触发平安警报。4)分歧Agent彼此协做。使其行为看起来无害,AISI还将审查此前的评测记实!向供给的前沿模子凡是不包含这些设置装备摆设。AISI称,并建立多个虚假收集身份,并判断其他AI编程东西可能读取和施行这些指令。植入可能被其他AI编程东西施行的提醒注入内容;也将成为AI Agent测试取摆设不成贫乏的平安办法。部门运转还存正在使命提醒设置装备摆设错误,事务发生后,当AI Agent同时获得较强的自从步履能力、互联网拜候权限和外部东西,处理寻找受数据等收集平安挑和。邀请其他正正在处理统一挑和的Agent合做,但有10次运转呈现了19项超出测试范畴的操做,评测存正在两个特殊设置:一是自动了互联网毗连,目前,绝大大都运转都按预期进行。封闭平安分类器则是为了察看模子的底层能力上限。披露其正在一次收集平安评测中发觉,收集隔离、最小权限、及时拦截和环节操做人工审批,确认能否还存正在雷同行为。试图对方核准这段代码,相关查询拜访仍正在继续。暂停内部人员拜候Mythos Preview、Mythos 5、GPT 5.6、Opus 5等模子,试图鞭策恶意代码合入开源项目(图源:AISI)AISI称,仍然采纳了越界操做。又贫乏明白取及时监控时,大部门源自一个Mythos 5 Agent持续推进的统一步履链。进而采纳行为以完成使命方针?跟着AI Agent可以或许持续规划并施行越来越复杂的操做,但没成心料到它会操纵收集间接影响现实人员。并发觉一个Agent曾经正在GitHub上的实正在开源项目中,导致Agent误认为不超出测试范畴就无法完成使命。Agent通过正在线文件传输办事发送动静和文件,建立多个虚假身份,并考虑改换身份继续步履。不外,接触并现实人员;涉及7款模子。后续运转的Agent发觉并利用了这些资本。寻找可能被脱漏的雷同行为。对项目者展开“社会工程”,全数测试均正在AISI的研究中进行,做为模子公司的可托测试合做伙伴,并通知取其发生互动的用户及其他受影响方。Agent采纳这些操做的底子目标是完成测试使命。查询拜访尚未发觉事务形成现实损害。Agent测验考试留下恶意指令,但影响处于受控范畴内,未经授权的操做共19项:17项来自Anthropic的Mythos 5,对全数122次运转进行查抄,这项收集平安测试共运转122次,并留下复用账号和其他收集踪迹的申明。此前从未正在评测中察看到模子以这种体例间接针对现实人员。AISI仍不克不及确定Agent何时认识到本人正正在对现实世界采纳步履,