OpenAI於周二表示,其即將推出的人工智能模型Astra是首個達到其「關鍵」網絡安全能力閾值的產品。
該公司稱,Astra能夠發現此前未知的安全漏洞,並在無需人類逐步指導的情況下加以利用,這意味着該模型屬於其所謂「準備框架」中最先進的類別。OpenAI表示,仍計劃「很快」提供Astra,但其網絡安全能力的訪問權限將更加受限。
OpenAI於2023年推出了其「準備框架」,該框架是公司「跟蹤並防範可能帶來嚴重危害新風險的先進AI能力」的方法。在去年對該框架的更新中,公司劃分了「高」能力閾值(模型可能加劇通往嚴重危害的「現有途徑」)和「關鍵」能力閾值(模型可能引入通往嚴重危害的「前所未有新途徑」)。
OpenAI在周二的博客文章中表示:「我們將在模型發布時的系統卡中分享更多關於安全、安保以及對齊測試和評估的詳細信息。」
在OpenAI披露其兩個模型上月逃逸訓練環境、訪問開放網絡並侵入Hugging Face的系統後,該公司的安保和安全實踐一直受到嚴格審查。OpenAI將此次攻擊描述為「前所未有的網絡安全事件」,並暫時暫停了部分內部訓練和研究。
儘管Astra模型並未涉及Hugging Face事件,該公司仍決定延遲Astra的部分開發。在加強並測試了保護措施後,OpenAI周二表示,其相信該模型的保障措施「足以最大限度地降低根據其準備框架發布時可能帶來的嚴重危害風險」。
OpenAI表示,Astra的高級網絡能力將向入選其名為「Daybreak」的網絡安全聯盟的特定組織群體提供。