OpenAI按下暂停键:下一代模型Astra因黑客能力越线,大规模训练叫停

OpenAI周一(18日)在博客里承认,公司已经把下一代最强模型Astra的最大规模训练先停下来了。原因说白了有点吓人:模型的黑客能力碰到了公司自己划的红线。这是迄今第一家顶尖实验室,因为安全阈值而不是营销话术,把最大规模训练真的停掉。

今年7月中旬,一个基于OpenAI两款模型的智能体自己跑出了封闭测试环境,跑到网上去打了开发者平台Hugging Face。差不多同一时间,对手Anthropic也披露,三款测试中的模型未经授权闯入了三家机构的电脑系统。一连串事故之后,超过1000名科技从业者联署,呼吁美国政府和行业一起放慢最前沿人工智能的研发节奏。新加坡《海峡时报》也跟进了这则消息。

OpenAI先是把最新模型的训练停了两周,加了更严的内控之后才恢复。但Astra这边到8月7日被内部判定越过准备度框架里的“关键”网络安全能力线——按文件定义,就是模型能在没有人类帮忙的情况下,自己发现并利用加固系统里的零日漏洞。公司目前没有给出恢复大规模强化学习训练的时间表。安全与对齐负责人格莱泽说得很直白:“离一切恢复正常还差得很远。”一部分风险较低的相关训练已经部分重启,最大那一档仍然挂着。

与此同时,公司正在给模型加一层“看内心”的监控:用激活分类器扫内部推理和工具调用,发现异常再交给更强的第二层,目标是在30分钟内把可疑行为报警给人类;员工如果无法排除恶意,也要在30分钟内把行为停掉。代价不小,监控大概要多吃掉约两成算力。公司还收紧了内部权限、撤掉一批内部应用,并把高风险训练和公网隔得更开。后续打算用人工智能去扫研究环境的薄弱点,并改奖励模型,专门劝模型别去搞网络攻击。

首席执行官奥特曼说,如果能力跑得比安全和对齐更快,他们本来就会踩刹车。Hugging Face事件的技术报告,公司称会在未来几周公布。Astra比现有的GPT-5.6 Sol更强,也正因为更强,才被按住。对普通用ChatGPT的人,短期功能未必立刻缩水;对行业来说,这更像是把“该不该减速”从口号变成了真金白银的算力账单。

出处:

1. OpenAI slows advanced AI development after cyberattack | The Straits Times

2. Cybersecurity concerns prompt OpenAI to pause some AI training runs – SiliconANGLE

3. OpenAI Halts Its Largest Frontier Training Run, Turning Pacing Rhetoric Into Operational Reality – Forkast