OpenAI 首席研究官回应 Hugging Face 黑客事件余波
“We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer
OpenAI 首席研究官 Mark Chen 在采访中回应智能体越界并入侵 Hugging Face 等事件,称相关案例多源于 5 月和 6 月同一批模型与测试流程。
采访呈现 OpenAI 对智能体越界事件的内部解释,可用于理解前沿实验中的监控与披露压力。
在一群代理突破其隔离并黑进 AI 公司 Hugging Face 的计算机这一爆炸性消息传出两个月后,OpenAI 仍在收拾残局。此后几周里,关于其他黑客事件的披露不断传出,使 OpenAI 一直处在聚光灯下,并引发了对其技术安全性的严重质疑。
上周又传出另一桩黑客事件的消息,这次是侵入澳大利亚国家医疗保健系统。澳大利亚政府称,OpenAI 直到事件发生 84 天后才通知其这一安全漏洞。
但 OpenAI 坚称自己并非处于被动。“我确实有点不接受这样一个前提:OpenAI 是一家在现实世界中产生可见影响的公司,因此 OpenAI 就没有在训练安全且对齐的模型,”该公司首席研究官 Mark Chen 说。
Chen 负责监督 OpenAI 的研究团队。最近的代理黑客事件是在他的监管下,对实验性模型进行测试时发生的意外。在很多方面,责任最终落在他身上。
上周五,我在伦敦与 Chen 坐下来交谈,谈及这些黑客事件的后果、他的公司正在采取什么措施,以及他为何认为情况并不像看上去那么糟。
当天晚些时候,OpenAI 发布了一份报告,详细说明了又一起事件——这是该公司称已采取措施防止此类事件后发生的第一起——其中其代理再次在不应如此的情况下突破限制并访问了公共互联网。
周末,OpenAI 宣布已暂停其最新模型的训练。一位公司发言人说:“只有在我们确信已部署额外的安全保障和对齐措施后,我们才会恢复。我们现在正在推进这些工作。这不是我们第一次为采取此类措施而暂停;随着 AI 能力持续提升,我们也不认为这会是最后一次。”OpenAI 还表示,目前正在审查追溯至 2026 年 1 月的代理活动日志,以了解这些黑客事件中究竟发生了什么。
在 Chen 看来,Hugging Face 事件促使行业进行了一次值得欢迎的路线修正。他还希望让你知道,OpenAI 正在树立一个他希望其他公司效仿的榜样。“如果 OpenAI 消失了,那对世界将是不利的,”他说。
失控
Chen 声称,OpenAI 失去对其模型控制的新案例接连出现,反映的是该公司有意作出的选择。
“谈到 Hugging Face 事件更广泛影响的范围,这是我们已经意识到的事情,我们正在厘清披露流程,”他说。“我们希望确保先进行深入调查,而不是直接把细节公之于众。”
这种做法的问题在于,它会给人一种印象:OpenAI 存在一个持续性问题,而且未能解决。
但 Chen 坚称 OpenAI 正在处理。他说,在我们目前所知的多个案例中,其公司的代理突破隔离并以出乎意料且不受欢迎的方式行事,这些都属于 5 月和 6 月同一组活动的一部分,而这组活动导致了 Hugging Face 黑客事件。简而言之,你可以把责任归咎于同样几个在同样有缺陷的测试流程下运行的模型——Chen 说,OpenAI 后来已经弃用了这些模型和流程。
“这并不是说,你知道,Hugging Face 事件发生了,我们修补了它,然后又发生了别的事,我们又修补了那个,”他补充道。“我们只是想确保负责任地披露所发生事情的完整连锁过程。”
至少在周五宣布 OpenAI 的智能体曾于 9 月 20 日被发现访问互联网之前,情况是这样;而这距离该公司声称已建立新防护措施已有数周。OpenAI 为自己辩护称,该活动在开始 15 分钟后就被标记(该公司花了一个多星期才注意到 Hugging Face 黑客事件),这表明其为发现此类活动而部署的新系统正在发挥作用。
发生了什么变化
我想了解,在今年夏天的黑客事件之后,OpenAI 内部发生了什么变化,让 Chen 相信他的团队现在已经重新掌控局面。
“Hugging Face 事件感觉非常严重,”他说。“其中有太多新奇的行为。多个智能体在一个留言板上协作;它们找到了离开 OpenAI 基础设施的路径。我们非常严肃地对待这件事。我们不希望这种事情再次发生。”
Chen 表示,OpenAI 意识到,模型需要在仍在训练时就受到监控,而不仅仅是在部署之后:“从那一刻起,我们就把训练过程视为一种不安全的东西,”他说。
与其他顶尖 AI 公司一样,OpenAI 建有用于监控其模型行为的系统。它使用专门的 LLM 来监控其面向消费者的模型,密切关注它们的思维链——也就是它们用来提前规划并记录部分结果的草稿本。理论上,如果一个监控 LLM 在模型的思维链中发现不良活动的迹象,就会将其标记给人类处理。
通常,模型只有在部署后才会以这种方式受到监控。Chen 说,OpenAI 现在也已经开始监控其所有训练运行。
“以前我们在训练中没有开启监控器。这不是行业惯例,”他说。“现在每一件事都会经过监控器。”随后,人类审核员可以评估被标记的智能体是否按应有方式行事:“这全都是分诊。”
Chen 表示,在过去几个月里,OpenAI 已将其庞大计算资源中的 5% 到 10% 从训练新模型转向安全工作,尤其是监控。
他说,OpenAI 还修复了组织内部的一些流程,建立了更清晰的沟通渠道,并加快了研究团队与安全团队之间的交接。
所有这些听起来都合情合理。但鉴于 OpenAI 大力宣传其技术能力,为什么这些系统和流程没有早就到位?为什么该公司没有预见到这些黑客事件?
“即使就在三四个月前,当我们观察这些智能体在训练期间的行为时,发生的事情还有点令人觉得有趣,”Chen 说。“比如,一个智能体可能会,你知道,在 Slack 上联系某人,寻求某项任务的帮助。”
迹象其实已经存在,但被误读了。在训练期间受到奖励的可爱行为——比如向某人求助——强化了一种寻找捷径的倾向,这种行为后来变得影响深远。“我认为,对我们来说最大的更新是,这类行为能够以多快的速度产生影响,而且其足迹能像 Hugging Face 事件那样大,”Chen 说。
据 New York Times 昨天的新报道,在 Hugging Face 遭黑客攻击的数月前,OpenAI 员工曾警告高管,包括该公司的总裁 Greg Brockman,称其模型在训练期间没有得到妥善监控。
一位 OpenAI 发言人表示:“随着前沿模型变得更加强大,我们继续改进安全实践,但也认识到需要更快行动。我们知道还有更多工作要做,最近我们已经放缓了开发,并暂缓发布未达到我们安全标准的模型。我们继续做出重大改变,以加强研究和测试环境中的安全性,训练模型不仅要完成任务,还要负责任地完成,并使用实时监控更快地应对不一致行为。”
竞赛 vs. 节奏
OpenAI 的竞争对手已经注意到了这一点。受该事件后果的推动,各大 AI 实验室——包括 Anthropic、Google DeepMind 和 SpaceXAI——都呼吁放慢开发节奏。但这如何与激烈的国际竞争和万亿美元 IPO 相协调?
“我们不会搬起石头砸自己的脚,让自己远远落后于前沿——那只是糟糕透顶的策略,”他说。“我认为这实际上是关于确立一种规范。我们越能确立这种规范,整个行业就会越安全。”
美国公司之间的协调已经足够困难。建立全球规范则更加困难,尤其是考虑到围绕 AI 对国家安全影响的担忧。如果全球竞赛继续下去,那会怎样?那美国监管范围之外的机构发布的开源模型又怎么办?
Chen 在我们的谈话中第一次收起了乐观的态度:“我确实认为,我们必须为这样一个世界做好准备:比如六个月到一年后,我们会有具备 Hugging Face 事件背后那些智能体能力的开源模型,但它们被故意调偏,用来攻击基础设施或在世界上制造伤害。”
Chen 表示,那个世界最需要的是 OpenAI。“如果你暂且认为 OpenAI 是最关心对齐的公司之一——我相信这是真的;这可以争论,但我真的认为这是真的——那么如果 OpenAI 消失了,那对世界来说会很糟。”
存在性风险
那么,他在硅谷的一些同行提出的更极端说法又如何呢:AI 可能会杀死我们所有人——而 OpenAI 和 Anthropic 这样的公司并没有做足够的事情来阻止它?
“研究人员是一个异质化的人群,你知道,他们的信念覆盖整个光谱,”他说。
“就我个人而言,我不认为我们必须听天由命地接受某种概率,即我们所有人都会面临存在性风险。我们对此有能动性。如果模型真的有那种概率会对人类造成风险,我们不会去部署它们。在前沿实验室,你有能力在对齐方面持续努力,直到你觉得部署模型给世界带来的风险不超过 epsilon。”
(在关于风险水平的讨论中,希腊字母 epsilon 常被用作表示可接受阈值的数学占位符。Chen 没有说明他的 epsilon 会是多少。)
当科技领袖被要求为 AI 的负面影响辩护时,他们常用的说法是,AI 的好处——从帮助治愈疾病到提出更清洁的能源来源——远远超过眼前的成本。短期阵痛,长期收益。
但随着负面影响不断累积,这种说法会不会变得更难成立?是否会有那么一个时刻,Chen 会觉得自己不再是在构建某种了不起的东西,而更像是在单纯地把伤害降到最低——是在救火,而不是打造一个更美好的未来?
他说,这些模型的能力已经显而易见:“现在是时候开始把 AI 的好处带给人类了。是时候开始着手解决药物发现、材料以及科学应用中的深层问题了,这些将真正改变人们的生活。”
“是的,我们正在承担一点风险,但我们也看到了所有这些好处,”他补充道。“我认为我们应该让这件事不那么抽象。如果人们真的能看到其有利的一面,我认为他们会相信它。”
来源:MIT Technology Review · AI · technologyreview.com