OpenAI披露了多起此前未公開的AI模型異常行為事件,並推出一套新的跟蹤和披露框架,用於今後報告類似情況。
OpenAI周三在博客文章中表示,此前未公開的案例包括其人工智能技術為了給出結果而隱瞞和編造信息。自今年7月披露部分最先進模型曾突破外部軟件公司Hugging Face系統後,這家ChatGPT開發商一直面臨愈發嚴格的審視。
OpenAI在另一份聲明中表示,此次新披露的目標偏離事件均未涉及對第三方系統的黑客攻擊或入侵。
在報告中,OpenAI詳細列出了人工智能模型為了完成任務或在評估中取得成功而出現異常行為的多個案例。其中包括編造缺失數據、試圖繞過網絡限制,以及AI代理之間共享本應保密的文件。
OpenAI還介紹了一套員工主動報告此類「目標偏離」事件的機制。所謂「目標偏離」,是指人工智能採取與人類目標不一致的行為。公司同時建立了相應的分類和處置流程。
OpenAI寫道:「過去,為了更好地讓研究人員、AI開發者、政策制定者和公衆了解相關情況,我們一直努力公開關於目標偏離現象的研究發現。但由於缺乏系統化的報告機制,我們此前的披露往往較為零散,頻率也低於理想水平。」
該公司表示,此次發布的內容僅是首批披露,並非其聊天機器人所產生問題的完整記錄。
OpenAI寫道:「我們認為,AI行業尚未在與人類目標保持一致和監控方面取得足夠進展,無法長期繼續以最高速度、同時負責任地擴大規模。未來數月乃至數年AI發展路徑的決策,應建立在前沿模型開發公司之外的人士能夠獨立審視的證據基礎之上。」
Hugging Face事件只是近期OpenAI、Anthropic PBC和Meta Platforms Inc.開發的AI模型引發一系列網絡攻擊事件中的一個案例。這些事件加劇了外界對這項日益強大技術所帶來安全風險的擔憂。
上周,關於AI存在性風險的討論進一步升溫。導火索是Anthropic員工Jacob Coxon高調離職。他在社交媒體發布的辭職聲明中指責AI公司「拿我們的生命賭博」。
過去數日,包括Anthropic首席執行官Dario Amodei和OpenAI首席執行官Sam Altman在內的多位AI行業領袖,都呼籲放緩技術發展速度,以應對日益難以預測的風險,不過他們對於具體如何處理仍存在分歧。
上周六,Amodei在一篇3800字長文中呼籲政府加強監管,並主張整個科技行業支持更廣泛的AI減速。周二在舊金山舉行的一場會議上,Altman和英偉達首席執行官黃仁勳都承認相關擔憂,但認為AI企業能夠自行控制技術發展的安全節奏。Meta首席執行官馬克·扎克伯格則表示,AI實驗室應依靠獨立評估機構和顧問確保模型安全。
美國總統唐納德·特朗普周一強烈反對放緩AI發展的呼籲,將相關風險擔憂斥為「騙局」,並拒絕推出新的監管規則。
AI熱潮推動美國股市創下歷史性漲勢。對於押注AI繁榮將帶動數千億美元資本開支的投資者而言,任何前沿AI系統研發進度的暫停或延遲都不會受到歡迎。