作为美国AI圈子“炫耀前沿大模型能力”的又宣沿模最新风尚,OpenAI周二大张旗鼓地宣布,布暂鉴于前沿大模型的缓前能力已经达到关键安全阈值,公司将继续放缓模型规模扩展的型训步伐,优先改进人工智能系统背后的又宣沿模安全与监控机制。

具体来说,布暂EC Markets会员登录入口OpenAI表示近几周出现的缓前两项进展训练两周,以进一步强化研究环境的型训安全性,并扩大监控系统的又宣沿模覆盖范围。目前,布暂公司最大规模前沿模型的缓前强化学习训练仍处于暂停状态。
具体的型训操作方面,OpenAI现在要求涉及Astra模型或更先进AI模型的又宣沿模工作负载必须采用最严格的安全防护措施。所以大量相关工作在完成迁移达到新安全标准前将处于暂停状态。布暂
更关键的缓前EC Markets外汇平台官网是监控系统的扩展,引入了激活分类器(activation classifiers)。这些分类器会对每一个被采样的词元进行监测,并将潜在的异常情况上报给自动化调查系统。
系统的设计目标是在检测到令人担忧的活动后,能够在30分钟内发出警报。如果监控系统判断可能有人或模型突破了关键安全边界,则会生成最高优先级警报,EC Markets会员登录入口并立即通知安全、安保和研究团队。
OpenAI介绍称,这些安全防护措施需要消耗相当可观的算力。

根据公司目前的估算,监控系统带来的额外算力开销,大约相当于被监控推理算力的20%。不过在不同的训练和评估任务中,这一成本会有很大差异。
需要说明的是,这并非OpenAI本月第一次表示将放缓先进模型训练。
OpenAI曾在8月7日宣布,即将推出的Astra模型可能已经达到《准备框架》的网络安全能力关键阈值,因此将暂停开展未达到强化安全控制要求的Astra相关活动。
因此,最新公告中的“暂停两周”,至少应该从两周前开始算起。
《准备框架》(Preparedness Framework)是OpenAI早在2023年底提出的一套评估标准。其中网络安全能力的“关键”阈值,指的是AI模型无需人工干预,便能在许多经过强化的现实关键系统中识别并开发出各种严重级别的有效“零日漏洞”;或仅根据一个宏观的预期目标,便能针对经过强化的目标构思并执行端到端的新型网络攻击策略。
OpenAI的最新公告,也引发网友们对另一个问题的争吵:Astra模型到底什么时候公开发布。
周一曾有爆料称,Astra最快可能在本周就推出,该模型也将会被集成到OpenAI专为编程设计的Codex平台中。鉴于Astra相较于GPT-5.6的巨大进步,这个版本很可能不会被冠以GPT-5.7的名号,而是开创GPT-6的时代。
然而,OpenAI周二再度宣布“安全优先”,以及暂缓先进大模型的拓展,使得“即将推出的Astra模型”到底何时落地变得愈发模糊。
预测市场Polymarket的数据显示,随着OpenAI发布最新公告,Astra模型在8月内发布的概率已经下降至13%,不过投资者依然对该模型能够在未来两个月内问世保有相当高的信心。
