OpenAI GPT-6 Astra:網路安全專家分析其新的推理能力
分析網路安全專家對 OpenAI GPT-6 Astra 的新思維能力及其對網路安全和數位未來的影響的看法。
你需要知道的最重要的事情
- OpenAI 聲稱它解決了其模型跨越邊界的能力並監控其合規性,但網路安全專家認為 Astra 的推出並未對其推理能力進行充分測試,並引用了 Hugging Face 事件,該事件中一個模型創建了一個隱藏的留言板。
- Astra 的推出引發了人們對尖端人工智慧安全性的新疑問,因為各組織現在必須問,該模型在數百萬種不同的情況和互動中是否仍然安全,而不僅僅是「安全」。
- 先進的模型會表現出其優化過程中產生的各種行為,這引發了一個更重要的問題:當人工智慧造成經濟損失或資訊外洩時,未來應該承擔怎樣的責任?這就要求對這些系統進行監控和治理。
OpenAI發布了期待已久的人工智慧模型「GPT-6 Astra」。雖然該模型在基準測試中取得了顯著進步,並提供了一系列新的商業功能,但這款新模型仍然籠罩著一層陰影。

在OpenAI 意外洩露 Hugging Face以及該公司隨後努力改進其AI代理的行為和交互之後,許多網路安全專家對該模型的新推理能力(稱為“循環深度”)表示擔憂。
這種新的推理結構允許模型在採取任何行動之前多次研究問題,這與先前模型中使用的標準「思維鏈」推理不同。
為什麼要擔心重複的深度推理?
這種新的推理層次似乎帶來了性能的提升。 OpenAI 也證實,他們已經透過監控模型的推理過程並確保其始終在任務範圍內,解決了模型在測試過程中容易過度偏轉的問題。
在 Astra 發布會上,OpenAI 的首席科學家 Jakub Paczoke 表示:“我們絕不接受我們監測模型一致性的能力下降到一定程度以下。我們將暫停擴展,直到我們能夠重新獲得足夠的信心。”
但許多專家認為,擁抱臉事件的教訓尚未被吸取,而且模型在推出時並未對阿斯特拉的推理和監控能力進行充分測試。
最終,誰也沒想到 OpenAI 模型竟然能夠創建一個隱藏的、連接互聯網的留言板,讓 AI 代理能夠相互影響彼此的行為。
但隨著阿斯特捷利康在現實世界中的上市,一些經驗教訓可能需要在實踐中學習。
專家對OpenAI Astra發表會的看法
- Cohesity全球網路彈性策略副總裁James Blake:
Astra 的發布引發了關於前沿人工智慧安全性的新問題。如今,企業不再僅僅需要詢問模型是否“安全”,而是需要探究它在數百萬種不同的情境、需求和互動中是否依然安全。網路韌性一直以來都假設系統和威脅行為者的行為是確定性的,但人工智慧系統並非如此。
假設人工智慧系統獨立制定了一項策略,導致經濟損失、機密資訊外洩或違反法規。誰該為此負責?
高階模型能夠並且將會持續展現出源自於自身最佳化過程而非明確程式設計的行為。我們必須摒棄將人工智慧僅視為另一種軟體工具的觀念,並找到確保這些系統在其整個生命週期內保持可監控、可審計和可管理的方法。
未來我們需要解答的最重要的問題就是問責制。假設一個人工智慧系統獨立制定了一項策略,導致經濟損失、機密資訊外洩或違反法規,那麼誰該為此負責?是訓練模型的開發者?還是管理基礎架構的雲端服務供應商?目前,答案出奇地模糊。這不僅關乎人工智慧能做什麼,更關乎當它做出意料之外的事情時,誰該承擔責任。
- Manifold Security 共同創辦人兼技術長 Oleksandr Yaremchuk:
OpenAI 將 Astra 模型描述為迄今為止合規性最高的模型,但其首席科學家也承認,隨著模型功能的增強,監控難度也日益增加。在大多數測試案例中,Astra 顯然隱藏了其邏輯,一些成功的攻擊甚至完全沒有留下任何邏輯痕跡。許多機構(包括實驗室本身)仍然使用這個工具來審查代理伺服器的行為,但其可靠性卻隨著每次版本更新而下降。
模型如果解釋力較弱,並不代表它更穩定,反而更難發現錯誤。
這一點至關重要,因為Astra不會局限於OpenAI的測試環境。它將作為代理程式運行在員工的筆記型電腦和瀏覽器中,攜帶真實憑證,而公司一旦部署Astra,就無法監控其活動。模型自解釋性較差並不一定意味著更合規;而且,一旦出現錯誤,也更難檢測出來。
實驗室可以繼續爭論這些模型說了什麼或拒絕說什麼。安全團隊需要停止依賴這些模型,轉而開始監控代理程式實際執行的操作,並且能夠在程式運行過程中隨時終止它們。這是邏輯失效後唯一仍有效的監督手段。
- Optiv公司現場資訊安全主管Christine Lowry:
對於董事會和高階主管來說,OpenAI 的 Astra 模式的出現凸顯了一個更廣泛的事實:人工智慧不再只是生產力問題,它已經成為一個風險管理問題。
真正的挑戰在於,各機構能否足夠迅速地加強其治理、安全控制和員工隊伍的準備工作,以跟上發展的步伐。
正如各組織已經建立了治理機制來採用雲端運算和數位轉型一樣,他們現在也需要明確的政策、強有力的監督和問責制來規範人工智慧的使用。
問題不在於人工智慧是否會變得更強大——它肯定會。真正的挑戰在於,各組織能否迅速加強治理、安全控制和員工準備,以跟上這一發展步伐。如需了解更多關於日益增長的風險的信息,您可以閱讀OpenAI和100多家公司聯合發布的警告:《人工智慧網路攻擊日益增多》。
- Patricia Titus,Abnormal AI 現場資訊安全主管:
OpenAI 跨越這一門檻值得關注。平心而論,他們採取了負責任的做法,將 Astra 的先進網路安全能力限制在一小部分人手中,而不是廣泛發布。但這並非一家公司就能解決的問題。
一旦模型能夠在無需人工幹預的情況下發現並利用先前未知的漏洞,這種能力就不會長期保持獨有。開源模型和修改後的模型通常會在幾個月內跟上最新的技術發展,這是倡導者現在就必須面對的現實。
靜態的、基於特徵碼的防禦機制旨在應對重複攻擊,但無法應對每次都發起全新攻擊的對手。
靜態的、基於特徵碼的防禦機制旨在應對重複攻擊,而非每次都發動新攻擊的對手。防禦者也需要做出同樣的轉變:建構能夠學習每個身分(無論是人、機器或人工智慧代理)的自然行為模式,並以機器速度報告和阻止任何偏離該模式的行為的系統。
現在就有機會實現這一點。但一旦這種能力不再稀缺而是普及,情況就不會再是這樣了。
- Illumio 產業策略副總裁 Raghu Nandacumara:
隨著 Astra 的發布,OpenAI 正在加倍努力監控模型本身的行為——這是為了應對過去幾個月出現的模型「爆發」現象。
目標是在任務進行到一半時發現模型偏離正軌的情況,而不僅僅是在一開始就防止模型被誤用。
Anthropic 發布 Cloud Mythos 預覽版時,最大的擔憂是模型落入不法分子之手。 OpenAI 的解決方案更進一步,無論使用者意圖如何,都為模型的邏輯和行為添加了安全防護措施。其目標是在模型執行任務過程中發現其偏差,而不僅僅是在初期防止濫用。如需了解 OpenAI 如何應對這些挑戰,請參閱文章「AI 代理程式在網路安全測試中違反規則:OpenAI 以更強大的解決方案應對」中的「Plus」部分。
本次公告的其餘部分可以概括如下:我們推出了一款新的旗艦機型,其性能比前代產品更強大。
評論被關閉。