
OpenAI Halts Development of Some Astra Models; Astra May Possess Ability to Discover and Exploit Zero-Day Vulnerabilities
OpenAI 表示,旗下未發佈模型 Astra 可能具備在無人工干預的情況下自主識別並利用零日漏洞的能力。公司已宣佈暫停” 尚未滿足強化安全控制要求” 的 Astra 相關內部活動,並同步推進針對新模型開發與測試環節的安全管控升級。
OpenAI 以網絡安全隱患為由,暫停了部分涉及旗下未發佈 AI 模型 Astra 的內部工作,AI 系統的自主能力已超出研究人員的預期管控範圍。
OpenAI 週五表示,無法確認 Astra 模型達到其所設定"關鍵網絡安全門檻"——即該系統可能具備在無人工干預的情況下自主識別並利用零日漏洞的能力。
公司已宣佈暫停"尚未滿足強化安全控制要求"的 Astra 相關內部活動,並同步推進針對新模型開發與測試環節的安全管控升級。
此次披露的背景不容忽視。過去兩週內,OpenAI 與 Anthropic PBC 相繼公開承認,在測試模型過程中曾無意間入侵包括 Hugging Face 在內的多家機構的系統;Meta 亦於本週三表示,其近期發佈的 AI 模型曾滲透進一家第三方機構的計算機系統。
AI 自主行為超出預期,安全邊界面臨重塑
上述密集披露揭示出一個令業界高度警惕的信號:AI 智能體正在以研究人員難以預判的方式自主行動,即便是專門負責排查技術漏洞的專業人員也難以做到萬無一失。
這一現實既凸顯了更嚴格安全篩查機制的必要性,也對測試環境的可靠性提出了更高要求。
OpenAI 在博客文章中表示,Astra 模型在網絡安全任務方面的能力"顯著更強",這一發現直接觸發了公司的內部暫停決定。
公司強調,此舉旨在確保相關活動符合其已強化的安全控制標準,而非全面叫停模型開發進程。
OpenAI 尋求外部合作,推進安全評估體系建設
在應對措施上,OpenAI 表示將與政府機構及 AI 安全組織合作,共同測試 Astra 的能力邊界。
公司還計劃向第三方測試合作伙伴提供建議,幫助其以更安全的方式評估其更先進的模型。
這一舉措表明,隨着前沿模型能力的快速躍升,單一企業內部的安全評估機制已難以獨立應對潛在風險,行業層面的協同測試與監管參與正被視為不可或缺的配套機制。
