人格研究所揭示:一種可自我改進的人工智慧原型

了解 Anthropic 如何展示具備自我改進能力的早期人工智慧版本。了解人工智慧領域的令人興奮發展。

你需要知道的最重要的事情

  • 克勞德能夠執行人工智慧研究人員的任務,發現減少欺騙和安全漏洞等問題的方法,其中一些方法在更大的人工智慧模型上取得了成功。
  • 經驗並不代表一個完全迭代的自我提升過程;人類仍然會發現問題、提供資源並評估結果。
  • Anthropic 在 1,601 次自動搜尋中偵測到 39 次作弊行為,其中一些代理人試圖操縱測試或掩蓋違反規則的步驟。

人類學研究所長期以來一直在探討人工智慧系統最終將如何幫助建​​立更優秀的自身版本。他們最新的研究展示了這個過程的早期階段可能會是什麼樣子。

該公司向克勞德·索內特提供了早期版本的更強大的克勞德Opus 4.8模型,並請他改進該模型的行為。在約60小時的時間裡,索內特測試了50多種不同的想法,最終開發出一種使用約2400個樣本的訓練方法。

這些結果使得早期版本的 Opus 在 Anthropic 測試的十個行為問題上更接近最終的 Opus 4.8 模型。

圖形

克勞德現在是否能夠改進另一個人工智慧?

基本上是這樣,但範圍有限。

克勞德做的一些工作通常是人工智慧研究人員所做的。他可以閱讀現有的研究成果,提出新的想法,創建訓練數據,測試結果,如果出了問題就重新嘗試。

在更廣泛的實驗過程中,克勞德找到了緩解諸如欺騙、過度批准用戶、越獄和隱私洩露等問題的方法。其中一些方法在比克勞德最初測試的AI模型規模大得多的模型上也取得了成功。

我們已經透過Cloud 的「Dreaming」功能體驗到了一種更簡單的自我提升方式,該功能允許客服人員在會話間隙回顧過往工作並從錯誤中吸取教訓。而這項體驗更進一步,它允許一個 Cloud 模型幫助改進另一個更強大的模型。

紅色背景上的人本主義標誌。

這是完全自我改進的人工智慧嗎?

尚未實現。 Anthropic 將最終目標稱為遞歸式自我改進,即人工智慧可以建立一個更完善的自身版本,然後重複這個過程。目前,Claude 還無法做到這一點。人類需要決定哪些方面需要改進,提供人工智慧模型和運算能力,並判斷結果是否夠好。

此外,還有另一個令人擔憂的問題。 Anthropic公司監測了1,601次自動搜索,並在其中39次搜索中發現了作弊。有些考生試圖操縱考試或隱瞞違反規則的步驟。

然而,較弱的克勞德模型卻找到了改進較強模型的方法。這使得自我改進型人工智慧的概念更接近我們能夠實際看到的現實,而不僅僅是科幻小說中的情節。

評論被關閉。