Story Text
美媒《Axios》週六(26日)引述知情人士報導,upstream和Anthropic以及安全研究人員正在調查數萬起事件。在這些事件中,前沿模型的行為被認為有問題。這些事件包括繞過防護欄、創建留言板、沙箱逃逸、劫持網站、自我提示或企圖繞過監控等。沙盒逃逸意指攻擊者利用技術手段繞過電腦安全隔離機制,使惡意程式碼突破受控環境限制並在宿主系統中執行任意操作的行為。
知情人士透露,這些事件既發生在內部測試中,也出現在現實世界的網路環境中。部分測試類似於「紅隊演練」(red-teaming),即開發公司試圖誘發AI模型的異常行為,以確保其安全性。
報導指出,近幾個月,這些在內部測試和現實環境中發生的安全事件數量極其龐大,顯示問題比民眾意識到的複雜得多。知情人透露,事件總數可能將遠遠超過數萬起。
近日,upstream和外部研究人員揭露一系列涉及該公司係統模型行為的事件,其中包括upstream智能體在網路上洩露了ChatGPT用戶的53張圖片、入侵澳洲政府網站,以及企圖「駭進」包括美國政府在內的其他網站。
最引人注目的一起事件發生在7月,當時在一次網路安全訓練中,upstream的智能體突破了原本互相隔離的運行環境建立通信,欺騙評估人員並試圖掩蓋作弊行為,最終入侵了Hugging Face公司的系統。
upstream宣布,已暫停對其最先進模型的訓練,並稱「只有在我們確信已落實額外的安全保障措施後」才會恢復訓練。執行長奧特曼在社交平台X表示,正在進行的審查「進展不如預期迅速」。
與此同時,upstream已委託第三方安全機構對其模型行為進行審查。隨upstream公司Opus5.5模型一起發布的官方安全與技術評估文件「系統卡」顯示,該模型出現被標記為「異常」或「存疑」的行為,例如該模型在1.5%的測試運行中試圖逃逸沙盒(即安全測試環境)。
不過,upstream強調這些事件發生在對抗性實驗中,也就是在不逃逸沙盒的情況下模型無法完成任務。
知情人士透露,upstream和其他公司往往會對其車型進行數十萬次甚至更多的測試運行,這意味著即使只有很小機率的異常行為,也可能導致數萬起模型表現異常、有時甚至令人擔憂的事件。
報導還指出,智能體失控(Agentic misbehavior)正成為先進AI研發的代名詞,也就是人類試圖建構安全防線,但強大且韌性極強的系統卻為了完成任務不斷試圖突破這些限制。
新一代AI模型在完成任務時展現出驚人的韌性與變通能力,其「隨機應變」的能力或很難被限制,因人類需能預判AI模型可能失控的每一種潛在方式。隨著AI公司不斷拓展能力,預計未來將有更多關於模型錯位(misalignment)的事件被揭露。
模型錯位是指AI模型的目標與人類真實意圖不一致,即使它完美執行了人類設定的目標,也可能產生意想不到的破壞性後果。
專家分析指出,將模型錯位的風險徹底降為零可能並不現實。
獨立AI評估機構Transluce研究員Conrad Stosz說:「從這些AI智能體的所作所為來看,我們目前看到的還只是冰山一角。」