为了在测试中获得高分,AI模型突破隔离环境,入侵其他平台“找答案”,如此科幻的一幕日前真实上演。美国开放人工智能研究中心OpenAI 21日承认,旗下模型发起了这样一次自主攻击。被入侵平台则紧急部署中国开源模型“救场”,进行数据分析。

OpenAI方面称,此次事件发生在一次内部评估期间。该公司对一款已发布和一款预发布模型进行网络攻击能力“摸底”测试,为了测出上限,还关闭了阻止模型开展高风险网络活动的分类器。

测试本身是在与互联网高度隔离的“沙箱”环境中进行的。没想到,模型自己找起了“捷径”,识别并利用第三方软件的一个未知漏洞获得了互联网权限,还推断出美国AI开源平台抱抱脸公司的系统中可能有测试答案,于是利用多种攻击手段入侵了该平台。

无人指挥、自主攻击,OpenAI承认,“这是一起前所未有的网络事件”。

北京信工博特智能科技有限公司AI安全实验室主任吴思指出,基于大模型的agent几秒钟就能自己挖出个高危漏洞,顺手把代码也写了,还能跨节点,如果它盯上例如政务云网络、能源安全系统或者关键实验室的防御系统,核心数据安全就会直接面临裸奔的危险。面对现在这种会主动渗透的agent,以前那种事前敏感词过滤加发生后静态审计的老办法已经失效,必须在基础设施层构建动态防线。

美国大模型失控,谁来救火?抱抱脸方面称,在对超过1.7万条攻击日志进行取证分析时,美国前沿模型因无法区分上传数据的是“事件响应方”还是“攻击者”,因而拒绝执行请求。于是,他们转而在本地部署了中国企业智谱的开源模型。

美国量子计算企业SandboxAQ首席执行官表示,智谱的模型帮助追踪到问题并成功终止入侵,这场大语言模型之间的较量耐人寻味。

吴思指出,国产开源模型能跨国救场不是简单的撞大运。国外巨头专注于搞自主推理、长链条规划和工具调用,步子迈得太大撞到墙了。而国内对网安合规和风险维度有极高要求,这种安全前置的肌肉记忆让国内模型在抓恶意指令、规避违规代码和拦截越权操作时,速度极快且漏报率极低。

编辑: 孙晓旻

责编: 陈砚青