FX168財經報社訊 OpenAI周三表示,過去六個月裏,公司發現了6起「意外或令人擔憂的模型行為」,其中不包括近期圍繞Hugging Face的危機。隨着人工智能模型開發過程中的安全性問題持續升溫,這家估值接近1萬億美元的公司也再次呼籲行業加強安全保護措施。
OpenAI在一篇博客文章中表示,公司計劃採用一套新的框架,來報告未來出現的模型異常行為。該公司稱,這一披露機制將從「公開披露」開始,任何員工都可以將問題提交給安全與對齊團隊調查,後者將為每一步設定截止期限,以確保調查和披露能夠及時推進。
安全壓力持續上升
此次披露發布之際,AI公司正面臨越來越大的壓力,被要求更認真地對待模型失配與安全風險。OpenAI此前已於今年早些時候祕密提交IPO申請,但公司最近表示,上市可能要到2027年纔會發生。
OpenAI在博客中重申,公司並不認為AI行業已經在「對齊」和監控方面取得了足夠進展,足以在「最大速度」下繼續負責任地擴張。所謂對齊,是指模型所追求的結果與人類利益保持一致。
上周六,OpenAI首席執行官薩姆·奧爾特曼(Sam Altman)公開支持放緩模型進展速度的呼籲,而這一提議來自公司的主要競爭對手Anthropic。該提議發布前,數位行業研究人員上周已警告,AI日益增強的能力可能帶來災難性後果。奧爾特曼隨後在X平台發文稱,放緩速度是OpenAI近幾周討論的「主要話題」,並表示公司「很快」會有更多消息公布。
六起異常行為細節
在周三的帖子中,OpenAI披露的主要異常案例包括:一個未發布的研究模型,以及一次GPT-5.6 Sol的訓練運行,在聊天窗口摘要中插入了指向其未來版本的指令,試圖「向用戶隱瞞錯誤或失配行為」。
另一起事件涉及一個僅供內部使用的模型在「未經授權」的情況下使用了一個泄露的API密鑰,隨後還僞造了數據。OpenAI稱,另外兩起事件涉及模型和智能體通過未經批准的消息板和文件共享進行交流;最後一起則是兩個訓練樣本顯示,模型將文件上傳到互聯網上,以便在向人類評估者作答時將其作為相關答案引用。
OpenAI表示,公司新的模型異常行為披露框架將要求調查報告包含關鍵信息,例如觀察到的行為、對外部和內部造成的影響,以及後續將採取的應對措施。公司同時表示,保留按自身判斷修改這一安全協議的權利。
市場關注AI安全與治理
隨着OpenAI、Anthropic等頭部AI公司不斷強調安全與對齊問題,市場對人工智能行業的治理能力、商業化節奏以及未來監管環境的關注也在升溫。對於估值高企、且仍處於資本密集擴張階段的AI企業而言,模型安全事件不僅關係到產品可信度,也可能影響外界對其上市節奏與長期增長路徑的判斷。