OpenAI 因模型网络安全能力暂停前沿训练

OpenAI 在 8 月 18 日发布长文,罕见地披露了前沿模型训练的内部安全调整。文章称,结合此前的 HuggingFace 安全事件与内部评估信号,即将推出的 Astra 模型可能达到其 Preparedness Framework 下的“关键网络安全能力”阈值,公司因此暂时放慢了扩展节奏:对计划部署的最新模型暂停了两周强化学习训练,最大的前沿 RL 运行仍处于搁置状态,等待更多对齐证据。

同时 OpenAI 重构了研究环境的安全基线:执行模型生成代码的工作负载需满足更强的沙箱与网络隔离,并接受持续安全测试;思维链监控全面扩展——从每个采样 token 的激活分类器,到高算力的自动调查系统,监控开销约占被监控推理算力的 20%,团队须在 30 分钟内判定告警真伪,否则暂停相关活动。

这与上月报道的 HuggingFace 逃逸事件一脉相承,但信号更进一步:当模型本身具备关键网络攻击能力,安全已从“部署后的护栏”前移到“训练过程中的监控与对齐”。而 20% 的算力税,也将成为前沿模型公司一项新的隐性成本。

阅读原文