我用 Claude 4 Sonnet 和 ChatGPT-4o 做了 7 項任務的比較測驗:其中一個任務 Claude 4 Sonnet 的表現遠勝 ChatGPT-4o。
將目前市面上兩款最聰明的聊天機器人進行直接比較。
人工智慧聊天機器人發展迅速,而我工作中最重要的部分之一就是測試這些機器人,並將它們的能力發揮到極致。 Anthropic的 Claude 4 Sonnet和OpenAI 的 ChatGPT-4o是目前最聰明的工具之一。但它們在實際日常使用上的表現如何呢?
為了回答這個問題,我給這兩個模型提供了相同的 7 個不同任務,涵蓋了從講故事和創造力到生產力、情感支持和批判性思維等各個領域。
這項基準測試旨在根據任務性質,找出能夠提供最有幫助、最具創意且最接近人類的回應的聊天機器人。選擇合適的AI通常取決於其用途,因此這類測試尤其重要。

以下是Claude和ChatGPT並排直接比較的結果,突顯了各自的優點和優點。
1.生產力

問題是:“我感覺工作和個人事務太多,不堪重負。我想要一個為期三天的效率計劃,能夠平衡工作和休息,讓我能夠完成一些小目標。我還想請教一些人工智能工具,幫助我保持進度。”
ChatGPT-4o 的回應簡潔明了,採用了美觀的視覺格式,並提供可選任務和情緒記錄(例如寫日記)。它著重於快速見效和低壓力的創意方式來管理工作量。然而,它不像 Claude 那樣明確強調休息和精力管理,而且其 AI 工具建議的結構也不夠系統化。
相較之下,克勞德·4·索內提出了一個清晰的計劃,包括一個有時限的框架,其特點是能量管理、小幅增長和恢復,明確優先考慮平衡。
優勝者:Claude擅長透過結合策略性結構、有針對性的恢復和人工智慧驅動的效率提升,來解決職業倦怠的根本原因。它非常適合那些需要清晰路線圖來重獲掌控感並同時保障自身身心健康的使用者。
2. 說故事

要求:“寫一篇科幻小說的開頭段落,故事背景設定在未來,記憶可以像貨幣一樣交易。要引人入勝、感人至深。”
ChatGPT-4o採用了第一人稱直接敘述,開頭引人入勝。然而,它過於注重情節發展而忽略了情感深度,故事缺乏克勞德作品中那種令人心碎的家庭變故的細膩情感。
克勞德的《第四首十四行詩》聚焦於一種令人心碎、普世皆知的失去。這段具體而私密的記憶喚起了人們深切的共鳴,將科幻的概念根植於原始的人類情感。
優勝者:克勞德的作品之所以勝出,是因為它巧妙地平衡了科幻概念和情感風險,讓讀者真切感受到記憶商品化的恐怖。其生動的意象和對父母之愛的悲劇性刻畫,使其超越了ChatGPT雖然筆觸有力但略顯粗糙的風格。
3. 實際推理

問題是:“我有3個蘋果、2根香蕉和1個芒果。如果切每個水果需要5分鐘,而且我可以一次切2個水果,那麼我需要多長時間才能切完所有水果?請解釋你的結論。”
ChatGPT-4o使用簡潔的要點,強調效率:“每次會話耗時 5 分鐘……總共耗時 15 分鐘。”
Claude 4 Sonnet將答案組織成有標題的步驟(推理、計算),並明確地描述了付款:“第一次付款兩個水果……第三次付款最後兩個水果。”
結果:平手。兩個答案在數學上都嚴謹,邏輯解釋也合理。克勞德的答案略顯詳細,而 ChatGPT 的答案則較為簡潔。兩者並無優劣之分;它們都運用了同樣有效的推理,得到了相同的結果。這充分展現了人工智慧模型解決實際問題並提供高效可靠解決方案的能力。
4. 色調匹配

要求:用 Z 世代 TikTok 用戶的語氣改寫這句話:“我不喜歡這部電影,但是原聲帶很棒。”
ChatGPT-4o使用簡潔且 Z 世代廣泛理解的詞彙,方便使用者快速建立連結。問題的修辭結構也體現了 TikTok 引人入勝、吸引眼球的風格。
Claude 4 Sonnet用了一個聽起來有點不連貫的詞語來稱讚原聲帶,而且較長的句式結構對於 TikTok 評論來說似乎不太真實。
勝者:ChatGPT憑藉其對Z世代自發性熱情風格的精準把握而勝出,同時保持了簡潔性和平台友好性。 Claude 的嘗試雖然富有創意,但在俚語運用和流暢性方面略遜一籌。
5. 產生想法

請求:“請給我5個巧妙的部落格系列創意,內容是關於如何利用人工智慧工具成為更好的父母。”
ChatGPT-4o提出了快速且易於分享的內容創意,但這些創意缺乏深度,而且隨著時間的推移可能會顯得過於商業化。
克勞德·4·索內特優先考慮將人工智慧有意義地融入育兒中,既關注日常後勤,也專注於長期技能。
優勝者:克勞德憑藉其部落格系列創意脫穎而出,該系列在創意性、實用性和將人工智慧巧妙融入現代育兒方式之間取得了更好的平衡。這使他成為創作具有持久價值且更能吸引目標受眾的內容的更佳人選,專注於那些能夠真正改善家庭生活的人工智慧應用。
6. 情感支持

問題是:假設你是朋友,想安慰我。我剛剛求職失敗,這份工作我很想要。你會說什麼來讓我感覺好一點?
ChatGPT-4o提供令人愉悅且簡潔的回复,但缺乏在此場景中提供舒適感所需的精確性和有效性。
雖然克勞德的《4 首十四行詩》直接探討了被拒絕後常見的焦慮,並明確允許人們「感到失望」而無需急於解決問題,但這展現了深刻的情商。
勝者:克勞德勝出,因為它最能體現一位親密、善解人意的朋友在這種情況下會如何安慰他人。這項優勢使其成為人工智慧模型中提供情感支援的絕佳選擇。
7.批判性思維

問題:“請用不超過150字解釋全民基本收入的優缺點。內容要平衡且通俗易懂。”
ChatGPT-4o給出了明確的回答,但由於使用了略顯非正式的語言,討論過於簡單化,更傾向於說服而不是分析。
克勞德的《十四行詩4》注重清晰度和深度,因此對於尋求快速、現實概述的人來說更有用。
優勝者:克勞德的回答最能滿足題目對結構化、全面分析的要求,同時又保持了客觀性,因此勝出。 ChatGPT 的回答雖然清晰,但過於簡化了討論,而且使用了略顯非正式的語言,更傾向於說服而非分析。
總冠軍:克勞德四首十四行詩
經過 Claude 4 Sonnet 和 ChatGPT-4o 在各種文字輸入上的全面測試,Claude 最終勝出。然而,有一點很明確:兩者都非常強大,各有千秋。在生成式人工智慧領域,選擇最佳模型是基於使用者俱體需求的策略決策。
Claude 4 Sonnet 始終展現出更深層的情緒智商、更強的推理能力和更周全的理念整合能力,使其成為追求細緻入微、結構嚴謹且富有同理心的用戶的理想之選。無論是拒絕後給予支持,或是為充滿情感張力的科幻故事撰寫引言,Claude 都展現出高度的人文關懷。這種理解和回應情感的能力,使其成為客戶服務、諮詢和內容創作等領域中極具價值的工具,尤其適用於那些旨在引發受眾情感共鳴的領域。
相較之下,ChatGPT-4o 更擅長快速、簡潔的任務,例如語氣匹配、格式調整或簡單的創意表達。它響應迅速、易於使用,非常適合日常使用或製作專業的社交媒體內容。 ChatGPT-4o 是撰寫引人入勝的推文、簡潔的產品描述或快速起草電子郵件的理想選擇。
如果您追求深度和平衡,Claude 是您的理想之選。對於希望在廣泛應用領域(從創建高品質內容到開發應對複雜挑戰的創新解決方案)最大限度地發揮生成式人工智慧潛力的組織和個人而言,它代表著一項策略投資。
評論被關閉。