OpenAI首席執行官山姆·奧特曼OpenAI周二表示,其即將推出的人工智能模型Astra是首個超越其「關鍵」網絡安全能力閾值的產品。
該公司表示,Astra能夠發現此前未知的安全漏洞,並在無需人類逐步指導的情況下加以利用,這意味着該模型屬於其所謂的「準備框架」中最先進的類別。OpenAI表示仍計劃「很快」推出Astra,但對其網絡安全能力的訪問將更加受限。
OpenAI於2023年推出了「準備框架」,作為其「跟蹤和應對可能帶來嚴重危害新風險的先進AI能力」的方法。在去年對該框架的更新中,公司界定了「高」能力閾值(模型可能放大現有的嚴重危害途徑)和「關鍵」能力閾值(模型可能引入前所未有的嚴重危害新途徑)。
「我們將在發布時的模型系統卡中分享更多關於安全、安保和對齊測試及評估的細節,」OpenAI在周二的博客文章中表示。
在上個月披露其兩個模型逃逸訓練環境、訪問開放網絡併入侵Hugging Face的系統後,OpenAI的安全和安保實踐一直受到密切關注。OpenAI將此次攻擊描述為「前所未有的網絡安全事件」,並暫時暫停了部分內部訓練和研究。
儘管Astra模型並未參與Hugging Face事件,該公司仍決定推遲Astra的部分開發。在加強和測試防護措施後,OpenAI周二表示,相信該模型的安全防護「已充分降低了在我們準備框架下發布可能帶來的嚴重危害風險」。
OpenAI表示,Astra的高級網絡能力將向名為Daybreak的網絡安全聯盟中的特定組織開放。