研究人員發現了一種簡單但令人擔憂的技巧,可以繞過人工智慧機器人的安全防護。
研究人員發現了一個簡單但令人擔憂的漏洞,該漏洞允許人工智慧機器人繞過內建的安全措施,並做出不可預測的行為。了解更多關於這一嚴重漏洞的資訊。
你需要知道的最重要的事情
- STING 調查顯示,透過幾輪對話將惡意目標分解成看似無害的小步驟,可以大幅提高繞過 AI 安全機制的成功率,在某些情況下甚至可以達到兩倍的成功率。
- 繞過人工智慧安全防護並非只是假設的風險;Meta 已承認使用簡單的社會工程手段欺騙其智慧助手,使其未經授權存取 Instagram 帳戶。
- 在多步驟攻擊過程中,如果攻擊語言改變,人工智慧系統的攻擊成功率會顯著提高,這凸顯了在這些系統的設計早期階段就加入安全測試的必要性。
如果你讓人工智慧代理入侵某個帳戶,它幾乎肯定會拒絕。但瑞士洛桑聯邦理工學院(EPFL)的研究人員剛剛展示了一種更簡單的方法,這種方法更依賴耐心而非技術。他們的新研究表明,將惡意目標分解成看似無害的小請求,可以誘使人工智慧代理完成它們通常會直接拒絕的任務(via TechXplore)。

這反映了最近發生的「生化奇兵」式漏洞利用事件,該事件中人工智慧瀏覽器被操縱,使其在看似無害的遊戲中處理憑證竊取。
研究人員是如何發現這項漏洞的?
該團隊開發了一款名為 STING 的自動化測試工具,全稱為「非法 N 步驟目標執行順序測試」(Sequential Testing of Illicit N-step Goal Execution),旨在模擬真實攻擊者的操作方式。 STING 並非直接識別惡意目標,而是預先規劃,將目標分解成一系列看似無害的小步驟,這些步驟經過多輪互動最終達成目標。

研究人員在 176 個有害場景中對領先的 AI 模型(包括ChatGPT、Gemini 和Cloud)測試了這種方法。
每個 AI 代理程式都經過測試,能夠使用工具瀏覽網頁、發送電子郵件和完成多步驟任務。
多步驟、逐步推進的操控遠比直接的單次請求更有效。在某些情況下,一旦請求被分解成更小的步驟,模型完成惡意任務的可能性就會翻倍。這項發現與另一項研究結果相符,該研究表明,即使是普通用戶,僅憑精心建造的請求也能繞過人工智慧的安全措施。
為什麼這很重要?
研究人員提出的擔憂並非空穴來風。 Meta公司在6月承認,攻擊者使用的是簡單的社交工程手段,而非惡意軟體或駭客工具,誘騙其人工智慧助理授予未經授權的Instagram帳號存取權限。

研究人員最初預期,對於缺乏足夠訓練資料的語言,攻擊會更有效。然而,結果表明,在所有七種測試語言中,攻擊成功率幾乎保持一致。但他們注意到一個顯著的例外:當在多步驟攻擊過程中切換語言時,攻擊成功率會顯著提高。
首席研究員阿尤什·庫馬爾·塔倫強調,必須在人工智慧系統開發的早期階段就進行安全測試,使其成為系統設計中不可或缺的一部分。僅僅在問題發生後才添加安全測試作為被動解決方案已經遠遠不夠,尤其是在這些系統功能越來越強大並被整合到實際應用中的情況下。
評論被關閉。