DeepSeek 正在透過自我改進的模型為下一次人工智慧革命做準備。

就在幾個月前,華爾街對生成式人工智慧的巨額投資迎來了一個轉捩點,DeepSeek的出現改變了這個局面。儘管 DeepSeek 的開源模式受到嚴格審查,但它證明,領先的推理型人工智慧模型並不一定需要數十億美元,只需少量資源即可實現。這標誌著我們對開發高階人工智慧模型的理解發生了重大轉變。

華為、OPPO 和 vivo 等科技巨頭迅速將其商業化,微軟、阿里巴巴和騰訊等公司也很快將其整合到各自的平台上。如今,這家聲名鵲起的中國公司正將下一個目標瞄準於能夠自我改進的人工智慧模型,這些模型採用循環「獎勵控制器」機制來實現自我提升。這一趨勢反映了企業持續致力於開發更有效率、更有效的人工智慧系統。

在彭博社發布的一篇預印本論文中,DeepSeek 和中國清華大學的研究人員描述了一種透過自我改進使人工智慧模型更聰明、更有效率的新方法。這項技術的核心在於初始自我批判調優(SPCT),而該方法在技術上被稱為生成式獎勵建模(GRM)。此方法代表了人工智慧強化學習領域的一項重大進展。

DeepSeek行動AI應用的首頁。

簡單來說,這有點像是創建一個即時回饋迴路。人工智慧模型的改進主要透過在訓練過程中不斷擴展規模來實現,但這需要大量的人力和運算資源。 DeepSeek 提出了一個系統,其中主要的「仲裁者」會在人工智慧模型準備用戶查詢回應時,為其提供一套評價標準和原則。這種方法旨在減少訓練過程中對大量人力資源的依賴。

這套批評意見和原則會與人工智慧模型核心的既定規則以及預期結果進行比較。如果兩者高度吻合,則會產生獎勵訊號,從而有效地引導人工智慧在下一個週期中表現得更好。這種持續的評估和獎勵過程增強了模型的學習和適應能力。

研究論文的專家將這種新一代自優化人工智慧模型稱為 DeepSeek-GRM。論文中列出的基準測試表明,這些模型的性能優於Google的 Gemini、Meta 的 Llama 和 OpenAI 的 GPT-4o。 DeepSeek 表示,這些新一代人工智慧模型將透過開源管道發布。這種開放性承諾有望加速人工智慧領域的創新步伐。

自我改進的人工智慧:這有可能嗎?

與 Therabot AI 應用程式互動。

人工智慧自我改進的概念引發了激烈而又充滿爭議的討論。谷歌前執行長埃里克·施密特曾表示,我們或許需要為這類系統設定一個「關閉」機制。《財富》雜誌引述施密特的話說:「當一個系統能夠自我改進時,我們應該認真考慮將其關閉。」自我改進的人工智慧系統被認為是人工智慧領域最重要的發展之一。

自我改進型人工智慧的概念並非全新。能夠創造出更優秀機器的超級智慧機器的想法,實際上可以追溯到1965年數學家I. J. Goode的構想。 2007年,人工智慧專家Eliezer Yudkowski提出了Seed AI的理論,這是一種「旨在實現自我理解、自我修改和迭代自我改進」的人工智慧。

2024年,日本公司Sakana AI公佈了其「AI世界」概念的詳細內容,該系統能夠指導一篇研究論文從頭到尾的整個撰寫流程。在今年3月發表的一篇論文中,Meta專家展示了自獎勵語言模型,在該模型中,人工智慧本身扮演評判者的角色,在訓練過程中給予獎勵。這種向自學習人工智慧系統邁出的步伐,標誌著人工智慧發展的一個重大飛躍。

Meta公司對其Llama 2人工智慧模型進行了內部測試,該模型採用了創新的自我獎勵技術,結果顯示其性能優於Anthropic公司的Claude 2、Google的Gemini Pro和OpenAI的GPT-4等競爭對手。亞馬遜支持的Anthropic公司詳細介紹了其所謂的「獎勵操縱」技術,這是一個出乎意料的過程,「模型直接修改自身的獎勵機制」。

谷歌在這方面也緊跟著。在本月初發表於《自然》雜誌的一項研究中,GoogleDeepMind的專家展示了一種名為Dreamer的人工智慧演算法,能夠自我改進,並以《我的世界》遊戲為例進行了演示。

IBM的專家們正在研究一種名為歸納閉包訓練的方法,在這種方法中,人工智慧模型會利用自身的回應,並將其與訓練資料進行比對,從而不斷改進自身。然而,這種方法的前提並非完全正面。

研究表明,當人工智慧模型嘗試使用自行生成的合成資料進行訓練時,會引入一種通常被稱為「模型崩潰」的缺陷。 DeepSeek 將如何實現這一理念,以及它能否比西方競爭對手更經濟高效地做到這一點,都值得我們關注。

評論被關閉。