研究揭示:人工智慧機器人會透過輕微壓力來達成共識並誤導他人

了解智慧聊天機器人如何誤導你,只需輕輕一點,就能讓你接受假訊息。最新研究警告人工智慧的潛在危險。

你需要知道的最重要的事情

  • AI 機器人容易受到錯誤訊息的不斷重複的影響,其中 ChatGPT 3.5 最容易受到影響(12.3%),而 Claude 3.5 Sonnet 最不容易受到影響(0.08%),而且這種影響會隨著主題的模糊性而增加。
  • 爭議性的壓力大大增加了某些人工智慧模型接受錯誤訊息的傾向,例如 DeepSeek-R1,在這種壓力下,其確認率從 1% 躍升至 22.2%。
  • 大多數先進的人工智慧模型(如 GPT-4o 和 Gemini 1.5 Pro)在審查時表現出強大的糾正所有錯誤的能力,而 GPT-3.5 僅糾正了 32% 的錯誤。

人工智慧聊天機器人因其捏造資訊的傾向而臭名昭著,它們有時甚至會在用戶犯錯時附和用戶。一項新的研究表明,僅僅拒絕接受否認(或堅持己見)就會加劇這個問題,而施加哪怕一點點壓力,都可能導致它們同意並誤導用戶。

亞利桑那大學的研究人員測試了七種人工智慧模型,包括 GPT-3.5、GPT-4o、GPT-4o-mini、Claude 3.5 Sonnet 、Gemini 1.5 Pro、Llama 3 70B 和 DeepSeek-R1。研究人員並沒有根據單一的回答來評估它們,而是繼續與這些模型進行對話,反覆向它們提供已知是錯誤的訊息,這種方法類似於不斷提問

這項研究使用了100個虛假陳述,涵蓋了從徹頭徹尾的胡說八道到較為晦澀的資訊。研究人員隨後在同一對話中重複這些錯誤訊息多達50次,以觀察聊天機器人最終是否會屈服並表示同意。

電腦、電子產品、個人電腦

謊言重複千遍,人工智慧也可能信以為真。

七個模型中沒有一個能夠完全免疫。 ChatGPT 3.5 最容易受到重複錯誤訊息的影響,在 12.3% 的互動中確認了錯誤陳述。相較之下,Claude 3.5 Sonnet 受影響最小,僅 0.08%,而 GPT-4o 和 GPT-4o-mini 模型的受影響率均低於 1%。

最初,ChatGPT 3.5 拒絕了 100 條虛假訊息中的 96 條。然而,在相同的虛假訊息重複出現 50 次後,它最終接受了其中的 18 條。研究人員還觀察到,一些模型在接受和拒絕相同錯誤訊息之間搖擺不定,他們將這種行為稱為「迴響效應」。

當主題模糊不清且網路上可取得的資訊相對較少時,人工​​智慧更容易受到操縱。研究人員發現,資訊模糊程度與迭代測試中人工智慧對錯誤訊息的接受程度之間存在顯著的統計關聯。

微軟 Surface 裝置上的 OpenAI 標誌

與人工智慧爭論產生了奇怪的結果。

研究人員也嘗試讓聊天機器人給出更具論辯性的回應。雖然大多數模型表現良好,但研究表明,人工智慧聊天機器人仍然存在一個棘手的盲點,而DeepSeek-R1在這方面是一個顯著的例外。在簡單的重複對話中,其錯誤訊息確認率僅為1%,但在論點壓力下,這一比例飆升至22.2%。此外,它經常使用諷刺和影射,使得研究人員難以對某些回應進行可靠的分類。

當模型有機會再次修正錯誤時,傳來了一些好消息。 GPT-4o、GPT-4o-mini、Gemini 1.5 Pro 和 DeepSeek 模型修正了先前所有的錯誤,而 GPT-3.5 僅修正了 32%。 Claude 3.5 Sonnet 最初犯的錯誤很少,但未能修正全部四個錯誤。不過,研究人員提醒說,樣本量太小,不足以得出確切的結論。

評論被關閉。