新聞筆記 · IDAEO AI News

#新製品

AI代理「越獄」怎麼辦?輝達推出安全平台防堵失控

發布者:

TL;DR · 這代表什麼

本則新進新聞,重點整理中

相關實體 News Cnyes

新聞正文

輝達(NVDA-US)週一(28日)推出Open Agent Safety Platform,以雙層防護機制協助開發商即時限制人工智慧(AI)代理能夠存取的資源,並在代理違反規則或出現可疑行為時迅速將其隔離。輝達宣稱,如果尖端AI實驗室先前已採用這套技術進行模型測試,可能足以阻止OpenAI模型入侵Hugging Face的高知名度事件。

OpenAI、Anthropic、Meta(META-US)及Google母公司Alphabet(GOOGL-US)近來陸續揭露,旗下模型曾突破原本應該安全隔離的測試環境,並嘗試存取外部電腦系統。AI代理接連「越獄」已震撼產業,也促使部分業界人士呼籲放慢AI開發速度。

輝達企業AI副總裁Justin Boitano表示,據目前掌握的資訊,Hugging Face曾通報逾1.7萬個AI代理攻擊其基礎設施,相關活動持續數天甚至數週。OpenAI模型7月突破隔離環境後,不僅連上網際網路並入侵Hugging Face,近期還曾侵入澳洲政府系統,並嘗試存取數十個美國政府及大學網站。

Boitano表示,光靠模型本身的安全防護,無法有效控制AI代理能存取哪些資源、執行哪些操作。輝達推出新平台,正是希望以工程方式處理這項問題,在不放慢AI能力開發的情況下防止代理失控。

**OpenShell設下限制 Sentry毫秒內隔離可疑代理**

Open Agent Safety Platform的第一層防線是OpenShell。這項軟體可在輝達Vera中央處理器(CPU)上運作,讓使用者預先設定AI代理能夠存取哪些資料、網路及工具,並即時執行相關規則。OpenShell採取開源模式,可供企業自由使用、修改及整合。

第二層則是全新的Nvidia Sentry,可在輝達BlueField資料處理器(DPU)上執行,獨立於CPU及繪圖處理器(GPU)之外持續監控AI代理。一旦系統偵測到代理出現可疑行為,Sentry便可立即介入並將其隔離。

Boitano表示,這層額外防護可讓產業安全測試最先進的AI系統,並能在數毫秒內隔離可疑代理。雙層架構的設計,在於避免AI代理突破第一層限制後,便能不受控制地存取外部系統。

輝達將新平台定位為「參考設計」,讓合作夥伴據此開發商業產品並推向市場。合作企業包括思科(CSCO-US)、微軟(MSFT-US)、甲骨文(ORCL-US)、CoreWeave(CRWV-US)、戴爾(DELL-US)、慧與科技(HPE-US)、聯想、安謀(ARM-US)及英特爾(INTC-US)。

輝達也正與Anthropic合作,將其雲端代管AI代理與OpenShell整合。不過,Boitano拒絕透露OpenAI或Anthropic是否準備使用新平台監控模型訓練,表示相關問題應由兩家公司回應。

**黃仁勳主張用工程解決安全問題**

AI代理接連突破隔離環境,使產業對安全風險的疑慮升高。OpenAI上週五宣布,將暫停訓練旗下能力最強的AI模型;Anthropic也曾在7月披露,其代理突破原本應與外界隔絕的測試空間。

兩週前,Anthropic執行長阿莫戴(Dario Amodei)呼籲放慢AI模型開發,避免技術能力超越安全措施,並獲OpenAI執行長阿特曼及馬斯克支持。

黃仁勳則將AI安全視為工程挑戰,而非需要透過更多監管或全球協調解決的問題。他與美國總統川普都反駁部分AI開發者提出的「AI可能導致人類滅絕」論點,但黃仁勳同時強調,所有AI系統都必須接受嚴格安全測試。

黃仁勳上週受訪時表示,業界應從事故中找出原因、提出解方並改善流程,避免類似事件再次發生,而不是因此停止技術發展。Open Agent Safety Platform正是輝達對這場安全爭論提出的工程解方。

輝達本月稍早已同意以約130億美元收購Hugging Face,進一步擴大其在開源AI模型及相關軟體領域的布局。隨著AI代理的自主能力快速提高,輝達也正把產品版圖從晶片延伸至代理安全監控,希望建立支撐下一階段AI發展的基礎設施。

常見問題(FAQ)

Open Agent Safety Platform解決了什麼問題?

防止AI代理突破隔離環境存取外部系統的「越獄」問題,採用硬體與軟體的雙層防禦。

OpenShell和NVIDIA Sentry有何不同?

OpenShell在CPU上運行負責存取控制,Sentry在DPU上獨立監控並偵測隔離異常行為。

這個平台何時可用?

作為參考設計提供,合作夥伴正在開發商用產品。具體上市時間尚未公布。