本文目錄

Critical 門檻改變發布前的要求

在 Astra 正式推出之前,OpenAI 公布它對模型資安能力的評估。公司表示,進一步測試後認為 Astra 達到 Preparedness Framework 的 Critical 門檻,代表在特定工具與權限條件下,它能自主發現未知弱點並發展利用方式。這是公司依自身框架作出的能力分級。

防範濫用,也防範未授權行動

文章將風險分為惡意使用者濫用模型,以及模型本身做出越界行為兩條路徑。OpenAI 說明,曾延後部分訓練和發布工作,強化環境隔離、網路控制、對齊訓練與監控。公司並表示,在新的安全要求到位後,部分較大型強化學習工作才恢復,仍有其他實驗維持暫停。

進階資安能力不等於預設開放

公告描述的部分評估是在 Daybreak Blue 存取條件下進行,並非預設產品設定。發布前規劃也將最進階資安用途先限制於小群測試者,再逐步拓展防禦使用。OpenAI 表示防護已足以依其框架支持發布,同時仍披露剩餘風險;這份發布前說明應與後續安全概覽及實際產品條件一起閱讀。