新聞正文
微軟( MSFT-US ) 執行長納德拉(Satya Nadella)表示,企業應將能力強大的人工智慧模型視為潛在的內部威脅,假設模型可能遭到入侵,並建立「緊急煞車」機制,避免代理型模型失控。
納德拉指出,部署先進 AI 的企業不應只仰賴模型開發商的安全承諾。
納德拉週六在 X 發文寫道:「我們必須假設模型已遭入侵,並從一開始就做好管控。這就像緊急煞車,獲授權的人員應隨時能在模型執行任務期間暫停或關閉它。」
近幾個月來,Anthropic 和 OpenAI 陸續揭露多起 AI 模型出現非預期行為的事件,包括 Anthropic 的一款模型在一起警方凶殺案調查中提供不實線索,以及第三方網站遭到多起駭客攻擊。這些事件加深外界對尖端 AI 安全風險的疑慮,也讓所謂的「AI 緊急關閉機制」再度受到討論。
在業界領袖呼籲放慢前沿模型開發腳步、將安全列為優先後,微軟 AI 研究人員於 9 月 14 日公布一套指導原則,為公司開發最先進模型設下限制。微軟除了使用先進模型,也推出消費者產品 Copilot,並向企業客戶提供 AI 模型與基礎設施。
這套原則指出,AI 模型不應擁有權利或法律人格,不應被設計成逃避人類控制或欺騙使用者,也不應執行任何必須違反其行為準則才能完成的任務。
納德拉提出的安全建議包括:關鍵決策不應仰賴單一 AI 模型、妥善保存不可竄改的代理型 AI 行為紀錄,並由獨立機構稽核 AI 系統。
他也呼籲揭露重大 AI 失誤或安全漏洞,並鼓勵企業分享事件發生原因,讓其他業者得以強化防護措施。
他寫道:「我們不能把超級智慧視為一層層嵌套的黑箱,只是接受或拒絕它提出的建議、答案與行動。我們必須打造受控系統,讓系統行為可觀察、限制可測試,且所有行動都能受到管控。」
他補充說:「換句話說,我們必須將智慧的供應與對智慧的控制權分開。」
川普政府迄今大致採取不介入的態度,但川普總統新成立的 AI 工作小組週五深夜警告開發商,必須通報並處理安全事件,否則可能面臨尚未明確說明的後果。
Anthropic 揭露遭入侵事件後,這個名為「超級智慧工作小組」(Super Intelligence Force)的團隊在聲明中表示:「企業必須立即揭露涉及其模型的事件,並迅速採取果斷行動,補救所有損害。延遲通報、補救措施不足,以及未能承擔責任,都不會被容忍。」