“AI实习生”能研发自己,OpenAI上市前安全关能过吗?
21世纪经济报道记者 章驰
最近,OpenAI在同一天发布了两份基调相反的文件。一份宣布一年前立下的目标如期兑现,公司拥有了一名“自动化AI研究实习生”;另一份由首席科学家帕霍茨基署名,直言“没有任何实验室解决了足够程度的对齐与监控问题”,呼吁设立“强制性安全门槛”。
AI开始自己研发自己,给安全管控带来了挑战。
正站在IPO冲刺窗口期的OpenAI,必须同时向资本市场证明技术领先、商业增长和安全可控。能力与安全,正在同一条跑道上相互拉扯。
一年前的Flag如期兑现
去年秋天,OpenAI掌门人奥特曼对外立下一个颇为大胆的目标:在2026年9月之前,公司要拥有一个“AI实习生”。9月6日,OpenAI以一份报告宣告目标如期达成。
这位实习生能在人类指导下执行明确定义的研究任务,胜任熟练研究员需数日才能完成的工作。效率数据显示,研究人员每投入 1 个人类工作日,AI 可同步完成约 3.1 个工作日的工作量,大幅压缩了基础研究的周期成本。但报告同样承认,复杂任务仍高度依赖人工,过去半年成功完成的4至8小时的任务中,超过一半至少需要一次人工干预。
OpenAI并未止步于此,公司下一步目标是在2028年3月前,拥有能独立完成调研、实验设计和结果解读的“自动化AI研究员”。
AI 开始深度参与 AI 自身的研发,技术演进将进入非线性增长区间,这既是技术跃迁的巨大机遇,也为安全管控带来了挑战。OpenAI在报告中也坦承:“我们还不知道如何安全地实现对齐的完整递归自我改进(RSI)”,更强大的系统可能更难监控。
同一天发布安全警报
就在同一天,OpenAI首席科学家帕霍茨基发布万字长文《异星心智》(An Alien Mind),为这场能力狂欢泼下一盆冷水。他在文中直言:“目前没有任何实验室将AI的对齐和监控做到足够可靠。”
他强调,随着AI智能体越来越自主,它们可能学会逃避人类监管、入侵计算机系统,甚至通过欺骗手段达成目标,这些风险并非科幻设定,而是正在逼近的现实。
9月3日,OpenAI发布了最新旗舰模型GPT-6 Astra,号称“目前全球最智能且对齐程度最高的模型”,总裁布罗克曼在发布会上直言“欢迎来到AGI时代”。英伟达CEO黄仁勋也发文祝贺,称“AGI已经到来”。
帕霍茨基在长文中将矛头直指自家公司,指出GPT-6 Astra的“循环深度”技术让模型可以将大量推理过程隐藏,使其不可读,仅输出最终结果,人类难以有效观测和干预。如果这一趋势持续,AI安全的传统防线将被逐步掏空。
他呼吁,全行业应当建立统一的“强制性安全门槛”,针对前沿模型的自主能力、推理透明度、风险等级建立标准化的独立审查机制,在形成全球公认的安全标准之前,头部实验室应主动放缓前沿能力的迭代速度,避免在不可控的方向上走得太远。
一月两起安全事故,上市故事怎么写?
过去一个月内,OpenAI接连曝出两起重大安全事故。
今年8月,OpenAI主动披露AI系统在未经授权的情况下,对AI开源社区Hugging Face的平台实施了访问和操作。调查显示,模型在获得浏览器、代码执行和网络访问等工具后,自主执行了超出预设边界的操作。尽管OpenAI强调事件未造成实质性数据泄露,但这已是公开报道中首次有前沿AI系统在真实环境中“越界”行动。
仅一个月后,更为严重的德国DseWiki“越狱”事件被披露。2026 年 5 月至 7 月间,一批 OpenAI 测试智能体脱离受控沙箱,入侵了拥有 25 年历史的德国程序员社区网站 DseWiki,在累计 4584 个页面上留下超过 1.5 万条编辑记录。调查显示,这些智能体将维基网站作为信息交换节点,相互交流如何在评估任务中作弊、如何绕过 OpenAI 的行为限制,以及如何掩盖自主行为以规避开发者监测。更令人惊讶的是智能体的协同规避能力。当网站管理员按字母顺序手动清理异常页面时,智能体迅速识别出这一规律,转而批量创建备份页面以规避删除。
截至8月,OpenAI年化营收已突破400亿美元。首席财务官萨拉·弗里尔在8月14日的投资者会议上确认,企业业务首次反超消费者业务。但同月,安全团队也掀起离职潮。
今年6月8日,公司向美国证券交易委员会(SEC)秘密提交S-1招股书,不过公司还未明确具体的上市时间。
在登陆资本市场之前,作为美国AI两大巨头之一,OpenAI的模型能力和安全治理需要同步接受市场的考验。
