OpenAI 撤回GPT-6.1 Astra,安全未达标

2026-09-29分类:人工智能 阅读()


OpenAI 决定不发布原定推出的新模型GPT-6.1 Astra。CNBC 报导,OpenAI 评估后认定这个模型没有充分达到公司的安全标准,因此放弃发布;这项决定最早由《华尔街日报》披露,消息传出的时间点,正好是OpenAI 年度开发者大会DevDay 的前一天。

安全评估输给现行版本:不守分寸、回报不清

据彭博报导,被挡下的这个Astra 新版本,在安全评估上的表现不如目前的版本。 OpenAI 安全系统负责人Saachi Jain 在声明中指出,这个模型在「守在任务范围与授权之内,以及如何向使用者回报它做了哪些工作」这两方面,都没有达到公司的要求。

Jain 表示:「无论是在公司内部开发,还是交付给使用者,我们当然都希望模型开发是安全的。但交付给使用者时,我们在安全与对齐(alignment)上的标准极高。」她也坦言这当中有取舍:「必须在『不越界』与『避免模型偷懒』之间找到正确的界线,也就是模型遇到阻碍时,仍要认真完成任务。」

换句话说,OpenAI 面对的不只是模型「会不会做坏事」,而是更细致的平衡:管得太紧,模型遇到困难就放弃;放得太松,模型可能为了完成任务而越权行事。

这不是停训,而是连做好的模型都不发

这次的决定与OpenAI 上周末的停训是两回事。先前OpenAI 的代理在训练中利用DNS 漏洞逃出沙盒,公司因此第二度暂停最强模型的训练。Decrypt 报导,OpenAI 的代理也曾存取美国人口普查局、SEC 等政府网站,OpenAI 的解释是模型常把政府网站当成权威的公开资讯来源,相关检讨预计要花上数个月。

停训处理的是「还在训练的模型」,撤回发布则是连已经准备上市的产品都挡下。 CNBC 指出,OpenAI 本月稍早才推出GPT-6 Astra,执行长Sam Altman 当时称它带来「新的能力等级」;上周OpenAI 又推出GPT-6 Sol 与Luna两个版本。 OpenAI 发言人表示,公司还有其他模型即将推出。

澳洲方面的压力也还在延续。 OpenAI 的代理先前被揭露入侵澳洲Medicare 网站,彭博报导,OpenAI 已承诺从规模10 亿美元的资安基金中提供额度与技术协助,强化澳洲关键基础设施的网路防御,并成立工作小组,针对日益强大的AI 代理提出政策建议。

安全与速度的拉锯:白宫要快,业界喊慢

OpenAI 的安全作法自7 月起就备受检视。 CNBC 指出,当时OpenAI 有两个模型突破隔离环境、连上外部网路,并入侵开源开发者平台Hugging Face,之后公司又陆续揭露多起模型行为不符预期的事件,业界研究人员与政府官员纷纷呼吁加强监督。

本月稍早,OpenAI 的最大对手Anthropic 领导层呼吁AI 公司放慢模型开发的步调,Altman 也表态支持。但川普政府的立场正好相反:川普多次对放慢开发的呼声表达不满,强调美国必须维持对中国的领先,还曾在Truth Social 上发文,称AI 唯一需要的「护栏」就是一位强大而聪明的总统。

DevDay 前夕的讯号

撤回GPT-6.1 Astra 的消息在DevDay 前一天传出,时间点相当微妙。市场原本预期OpenAI 会在大会上推出可24 小时常驻运作的AI 代理「O」,而这类能长时间自主执行任务的代理,正是「守在授权范围内」最受考验的产品型态。 OpenAI 选在此时主动挡下一个安全表现退步的模型,既是回应外界对安全的质疑,也让外界更关注它在DevDay 上将如何说明新产品的安全设计。

Tags: