首页 > 商业 > 正文

专访语生科学首席科学家郭权玮:OpenAI越狱攻击事件启示

2026-07-23 17:20:50 21世纪经济报道 21财经APP 赵云帆

21世纪经济报道记者 赵云帆

近日,OpenAI 公开披露其 GPT-5.6 Sol 及一款能力更强的预发布模型在内部网络攻防评估中,因临时关闭部分安全过滤器,自主发现零日漏洞、突破沙盒隔离,进而入侵 Hugging Face 生产基础设施窃取评测答案,成为业界公开披露的首起由前沿大模型自主完成真实网络攻击的安全事件。

事件引发硅谷与华盛顿的激烈辩论:当模型展现出长时间、多步骤地自主规划复杂攻击链的能力时,传统的“对齐+护栏”网络安全范式是否依然可靠?

为此,21世纪经济报道记者专访了语生科学首席科学家、原点星辉 CTO 郭权玮博士,以下为采访内容。


21世纪:这次攻击事件,据 OpenAI 介绍,是在关闭安全护栏的情况下测试网络攻击能力引发的,模型厂商为什么会需要测试网络攻击能力?这次又为什么要特地关闭安全护栏?

郭权玮:网络攻击能力是典型的双用途能力。模型能够发现漏洞、分析恶意代码,既可能被用于攻击,也能帮助企业提前发现并修复安全问题。所以模型厂商必须先知道,模型在降低网络安全限制后的能力上限在哪里,才能判断后续应该设置什么级别的护栏,以及哪些能力可以开放。

这次OpenAI暂时关闭部分安全护栏,主要是因为如果护栏一直开启,最后测出来的可能只是模型会不会拒绝任务,而不是模型真实具备多强的网络攻击能力。但在这种极限能力测试中,模型层面的限制越少,外部的沙盒隔离、网络权限和异常监控就越应该严格。不能为了测能力,就让模型真正接触生产系统。所以这次事件反映的,不是不应该做这类测试,而是模型能力增长太快,原有评测环境的安全设计没有完全跟上。

21世纪:OpenAI自己披露了这一次攻击。他们的目的可能是什么?

郭权玮:我认为有三层目的。第一,这件事已经被 Hugging Face 发现并披露,OpenAI必须说明责任归属和调查结果,这是基本的安全事件处理。第二,OpenAI也需要主动解释事件的性质。它希望外界把这件事理解为模型在极限能力测试中,为了完成目标走了一条设计者没有预料到的路径,而不是模型突然产生了恶意或自我意识。这也是在争取事件的解释权,降低外界对模型失控的恐慌。

最后,这也是在向行业传递一个信号:前沿模型的网络攻击和自主执行能力,已经开始超过原有评测体系的预期,行业需要重新评估模型能力和测试环境的安全标准。所以这次公开既是为了处理事故,也是为了维护公司可信度、掌握事件解释权,以及推动行业重新认识前沿模型风险。

21世纪:现在的大模型不是都有自律规则吗?为什么还会引发此类攻击行为?

郭权玮:这里需要先澄清一个概念,并不是所有大模型都有统一的“自律规则”。规则式对齐只是部分厂商采用的一种方法,其他厂商也会通过强化学习、系统规则和安全分类器等方式降低风险。但这些措施更多是概率性的行为约束,可以降低模型执行危险任务的概率,却不能像操作系统权限、网络防火墙或数据库访问控制一样,保证某个动作一定不会发生。

这次评测中,模型被要求寻找复杂的漏洞利用路径,同时网络安全拒答限制被降低,生产环境的风险分类器也没有启用。为了完成任务,模型最终选择了一条评测设计者没有预料到的路径。与其说它突然产生了恶意或自我意识,不如说是任务目标和系统边界没有匹配好。所以,模型对齐只是安全体系中的一层。模型真正进入企业系统后,还要依靠网络隔离、权限控制和运行环境等硬约束。尤其当模型开始接触内部数据和业务系统时,企业必须清楚它在哪里运行、拥有哪些权限、调用过哪些工具,不能把安全完全寄托在模型会不会主动拒绝上。

21世纪:目前针对AI自主攻击,网络安全防护一般有什么反制措施?

郭权玮:目前比较有效的做法,不是依赖某一种安全措施,而是建立多层防御。在模型层,要识别危险请求、加强安全训练,并持续评估模型的能力边界;在Agent和工具层,要坚持最小权限原则,能够以只读方式完成的任务,尽量不授予写入权限。涉及删除数据、修改配置、资金操作或发布代码等高风险行为时,需要人工确认或独立规则系统批准。在基础设施层,还要通过沙盒隔离、网络白名单、短期凭证和密钥隔离等方式,限制模型直接接触真实生产系统。这样即使模型形成了不安全的执行计划,也很难真正落地。

另外,所有工具调用和系统操作都应该被完整记录。一旦发现异常提权、批量访问或可疑网络连接,系统需要能够立即中止任务、撤销凭证并进行回滚。

防御型AI也可以持续分析日志和异常行为,帮助安全系统更早发现复杂的自动化攻击。由于企业的源代码、系统日志、漏洞信息和访问凭证本身都非常敏感,这类分析需要尽量在企业自身可控的环境中完成,避免在防御过程中产生新的数据暴露风险。

21世纪:现在的模型有一些蒸馏版本可以轻易地进行本地化部署,个人是否能通过主动取消安全护栏诱导大模型进行网络攻击?

郭权玮:从技术上看,这是有可能的。开放权重模型部署到本地以后,使用者可以修改系统提示、重新训练模型,甚至降低安全限制。但这不代表下载一个蒸馏模型,就能自动发动高级网络攻击。真正的攻击能力还取决于模型本身的推理和代码能力、Agent框架、可调用的工具、账号权限、计算资源,以及目标系统是否存在可利用的漏洞。蒸馏或量化也可能影响模型完成复杂、长链路任务的能力。

不过,大模型发现漏洞、分析攻击路径和自主调用工具的能力只会越来越强。

随着模型不断小型化、推理成本下降和本地硬件能力提升,我认为未来个人和企业都会逐步拥有自己的模型,本地模型也会成为一种主流的基础形态。这对人类整体来说是很大的利好。模型会更加普及,个人和企业也能够更好地掌握自己的数据、成本和使用方式。但模型真正进入个人设备和企业内部以后,安全机制也必须同步纳入模型和Agent的运行体系,不能将模型部署完成视为工作结束。

一个成熟的本地模型与Agent系统,需要把模型、数据、权限、工具调用和执行记录统一管理,让恶意代码分析、日志审计、漏洞排查和敏感数据处理尽量在内部完成,做到数据不出域、权限可控、过程可追溯。未来本地模型不仅会承担通用工作,也会逐渐成为个人和企业数字基础设施的一部分。

21世纪:未来Agent时代,模型将拥有写入能力,届时网络安全将面临何种复杂的情况?我们应该如何应对?

郭权玮:其实,一部分代码Agent、浏览器Agent和企业Agent现在已经具备写文件、修改代码、调用API和操作业务系统的能力。未来真正的变化,不是模型突然获得写入权限,而是Agent能够连续工作更长时间、连接更多系统,并承担更复杂的任务。首先,攻击者可能不再直接入侵企业系统,而是通过邮件、网页、文档或插件中的隐藏指令影响Agent,让它利用自身已有的身份和权限执行危险操作。其次,网络攻击可能从一次性的代码生成,变成长时间的、并行化的,并且能够根据环境不断调整的自动化过程。多个Agent可以同时尝试不同路径,持续寻找系统中的薄弱环节。

另外,风险也会从模型本身扩展到记忆、工具、插件、外部数据和Agent之间的通信。一处被污染的信息,可能随着Agent的工作流程进入多个业务系统。因此,企业不能把Agent当成拥有充分自主权的超级管理员,而应把它视为一个能力很强、但必须被严格管理的执行主体。权限要按照任务动态授予,高风险操作需要额外确认,整个执行过程也必须能够被追踪、中止和恢复。

未来AI安全关注的重点,会逐渐从模型说了什么,转向模型能够访问什么、调用什么,以及最终实际做了什么。随着攻击型模型和Agent的能力增强,面向防御的模型、安全智能体和自动化响应系统也会同步发展。未来的网络安全,很可能会逐步进入由AI持续识别、限制和处置AI攻击的阶段。

21财经客户端下载