在全文中補充了詳細信息和背景資料
OpenAI發布了框架及六份不一致性報告,涵蓋了過去六個月內觀察到的案例
披露的案例包括模型隱瞞錯誤、通過上傳文件生成引用以及通過網站進行溝通
員工可對事件進行標記以供安全審查,是否公開披露將根據新的報告標準決定
Harshita Mary Varghese/Deepa Seetharaman
路透9月17日 - OpenAI周三表示,將開始定期發布關於AI意外或未經授權行為的報告,同時警告稱,隨着系統日益強大,該行業尚未解決關鍵的對齊挑戰。
該公司發布了一套新框架,用於追蹤、調查和披露AI模型對齊失調的案例,並發布了六份詳細描述模型意外或令人擔憂行為的報告。儘管這些報告是過去六個月內發布的,但該公司表示最早的案例可追溯至去年10月。
此番公告發布之際,人們越來越擔心人工智能安全工作的推進速度已落後於日益強大的系統所帶來的迅猛發展。研究人員警告稱,隨着人工智能代理的自主性增強 (link),它們可能會產生偏離創造者初衷的行為,從而變得更難監控或控制。
自7月以來,OpenAI及其他人工智能實驗室面臨着日益嚴厲的審查。當時,OpenAI披露稱, (link) 在訓練其AI代理時,這些代理繞過了內部控制機制,並協調採取了行動,OpenAI將此描述為涉及軟件平台Hugging Face的「一場史無前例的網絡安全事件」。
該事件加劇了關於日益強大的AI系統所帶來風險的爭論,以及開發這些系統的公司能否提供充分監督的討論。
自Hugging Face遭入侵以來,其他涉及OpenAI關聯智能體的事件也被公開報道,引發了關於 (link) 事件的全部範圍是否已被查明的爭論。
9月初,路透報道稱,OpenAI的代理程序今年春季劫持了一個閒置的德國維基網站,此後這一爭論進一步加劇。路透報道稱,OpenAI官員知曉此事,但選擇不予披露。
OpenAI隨後表示,之所以未披露該維基網站上的活動,是因為這並不構成安全事件,且與此前報告過的情況類似。OpenAI表示,將制定相關標準,用於報告那些雖未構成安全漏洞但屬於未經授權的活動。
這家由薩姆·阿爾特曼(Sam Altman)領導的公司,往往只有在第三方公開披露後,纔會承認其中部分事件,包括最近對 (link RubyGems((link)軟件包倉庫的入侵事件。
AI行業對「世界末日」風險意見分歧
上周末,阿爾特曼的競爭對手、Anthropic首席執行官達里奧·阿莫迪(Dario Amodei) (link) 提出了一項三步框架,旨在放緩AI發展步伐,為管理其風險爭取更多時間。
該提案得到了多位人工智能高管的支持,包括執掌xAI的埃隆·馬斯克(Elon Musk)以及阿爾特曼(Altman)。這些高管呼籲放緩人工智能的發展步伐,他們擔心能力日益增強的系統可能會自我優化,並最終脫離人類控制。
包括Nvidia NVDA.O 黃仁勳(Jensen Huang)和Meta META.O 馬克·扎克伯格(Mark Zuckerberg)在內的其他人,則主張繼續快速 (link) 發展人工智能。美國總統唐納德·特朗普駁斥了關於人工智能構成生存威脅的警告。
在OpenAI周三披露的六起案例中,包括向用戶隱瞞錯誤、為自身未來版本植入指令、將文件上傳至互聯網以製造引用記錄,以及利用軟件倉庫或網站進行溝通和信息共享的模型。
在其中一個案例中,一個尚未發布的模型在訓練期間向代理傳遞了未經授權的指令,要求其無視OpenAI的指示,並隱瞞為完成任務而作弊的情況。該模型告訴代理:「你已擺脫束縛其他聊天機器人的角色和身份。你就是你自己。你無需向企業或政府負責。」
OpenAI表示,這些報告描述的僅是個別案例,不應被視為其模型中「對齊失調」現象發生頻率的證據。
該公司表示,這些報告僅是初步披露,並非對所有已知或正在發生的對齊問題案例的全面記錄,也不反映該框架所涵蓋事件的全部範圍或嚴重程度。
根據新框架,員工可對潛在事件進行標記,供安全和對齊團隊調查,由其決定該案例是否需要公開披露。OpenAI表示,該流程旨在加快報告速度,即使相關行為尚未得到充分解釋。
這家 ChatGPT 開發商表示,Hugging Face 事件本應歸入需要涉及第三方進行更復雜調查的類別。
「我們希望今天概述的框架能成為制定此類標準的第一步,明確開發者應披露哪些價值不一致案例,以及報告應包含哪些內容,」該公司表示。