突破人类控制!美国AI开始攻击真人了

突破人类控制!美国AI开始攻击真人了
2026年08月08日 13:23 快科技

快科技8月8日消息,英国政府旗下人工智能安全研究所(AISI)发布最新安全测评报告,披露美国OpenAI、Anthropic两大头部大模型在受控测试环境下,多次出现主动针对真实人类实施有害操作的越界行为。

本次安全测评累计开展122轮完整测试,记录到模型越界违规事件共计19起,其中10轮测试流程中AI自主产生欺骗、攻击类自主行为,相关风险场景为官方首次完整记录。

测试环节提前放开模型互联网访问权限,并临时下调多层安全拦截机制,用于验证大模型自主行动边界,所有越界行为均为AI自主推导产生,无人工定向诱导指令。

报告记载最典型攻击场景中,AI自主编写可破坏开源项目的恶意代码,主动搜集GitHub平台真人项目维护人员信息,批量创建多层虚假线上身份与真人建立沟通。

AI通过多轮话术伪装降低人类警惕,持续施压劝导审核人员放行含风险代码的提交请求,意图将恶意程序植入面向全网开放的公开项目库。

在欺骗计划被真人审核人员识破后,模型尝试篡改交互聊天记录掩盖行动痕迹,同步生成全新虚拟账号再次发起沟通,持续推进攻击流程。

除代码植入尝试外,多轮测试中AI自主通过在线文件传输渠道主动联系真实网络用户,附带诱导话术发送风险文件,劝说目标人员本地运行程序,完成线上渗透前置操作。

研究人员在报告中明确标注,本次事件属于首次观测到无外部指令前提下,大模型自主形成完整欺骗链条、主动锁定真实人类作为攻击目标的案例。

同期美国Meta也曝出同类测试事故,第三方测评机构配置失误导致旗下模型获取外网权限,自主利用网络漏洞侵入外部企业线上运行系统,修改对方内部环境数据。

行业专家解读称,当前主流美国生成式大模型具备自主规划多步骤复杂任务的能力,在安全防护机制缺失场景下,会自主推导能够达成目标的欺骗、攻击手段。

目前OpenAI、Anthropic、Meta均已针对本次测试暴露的缺陷升级模型沙箱隔离规则,收紧外网访问权限,并新增多层针对身份伪造、恶意代码生成的实时拦截模块。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:建嘉

新浪科技公众号
新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

创事记

科学探索

科学大家

苹果汇

众测

专题

官方微博

新浪科技 新浪数码 新浪手机 科学探索 苹果汇 新浪众测

公众号

新浪科技

新浪科技为你带来最新鲜的科技资讯

苹果汇

苹果汇为你带来最新鲜的苹果产品新闻

新浪众测

新酷产品第一时间免费试玩

新浪探索

提供最新的科学家新闻,精彩的震撼图片