人工智慧可能讓你損失金錢:研究揭示金融聊天機器人的錯誤
別讓你的錢打水漂!一項新研究揭示了人工智慧和聊天機器人在金融問答中犯下的錯誤。立即了解真相。
你需要知道的最重要的事情
- كشفت دراسة Saturn أن نماذج الذكاء الاصطناعي للمشورة المالية تحقق متوسط دقة 43% فقط، وتنخفض إلى 12% في السيناريوهات الضريبية والمالية المعقدة، مما يشير إلى عدم موثوقيتها الكبيرة.
- قدمت روبوتات الدردشة المالية نصائح خاطئة وخطيرة، مثل اقتراح تجنب سداد القروض الطلابية بالانتقال للخارج أ或者 عدم تأثير إجازة الرهن العقاري على التصنيف الائتماني، مما قد يؤدي إلى عواقب مالية وخيمة.
- حتى أفضل نماذج الذكاء الاصطناعي المدفوعة أداءً، مثل Claude Opus 5، حقق معدل نجاح 61% فقط في المشورة المالية، وأخطأ في ما يقرب من أربع من كل عشر حالات، ووصل معدل خطئه إلى 67% في الأسئلة المعقدة.
ليس مفاجئًا أن نرى مستخدمي 人工智能 يستفيدون من كم المعرفة الهائل الذي يوفره لمساعدتهم في استفساراتهم المالية.
يكفي إلقاء نظرة على الإحصائيات؛ فوفقًا لبيانات أنتجتها Intuit Credit Karma وورد تفصيلها عن طريق 信用卡瑪، صرّح 66% من الأمريكيين الذين شملهم الاستطلاع واستخدموا الذكاء الاصطناعي التوليدي (GenAI) من قبل، أنهم استخدموه لطلب المشورة المالية، وترتفع هذه النسبة إلى 82% بين جيل الألفية والجيل Z. ويبرز استخدام الذكاء الاصطناعي للمساعدة في الأسئلة المالية كأحد أكثر تطبيقاته شيوعًا، حيث تحتل “المالية” المرتبة الثانية كأكثر حالات الاستخدام شيوعًا 人工智慧 التوليدي (41%)، بعد الصحة والعافية مباشرة (44%).

ووفقًا لدراسة أخرى (تُعرف بتقرير “السلطة الاصطناعية” Artificial Authority) أجرتها شركة Saturn المتخصصة في الذكاء الاصطناعي والتكنولوجيا، قد لا يكون تحويل الذكاء الاصطناعي إلى مستشار مالي هو القرار الأكثر حكمة. وقد توصل فريق Domain في Saturn إلى هذا الاستنتاج بعد اختبار 18 من أدوات الذكاء الاصطناعي الأكثر شيوعًا، والتي تشمل ChatGPT 和 Gemini 和 Claude 和 Copilot.
تشير جميع نتائج Saturn إلى نتيجة واحدة تبعث على التفكير: 聊天機器人 ليست موثوقة تمامًا عندما تبحث عن استشارة مالية حقيقية.
دراسة Saturn المعيارية كشفت عن نتائج مقلقة للغاية

تشير الإحصائيات الأكثر إثارة للانتباه التي أنتجها تقرير Saturn إلى أن نماذج الذكاء الاصطناعي كانت تخطئ في الإجابة على الأسئلة المالية أكثر مما تصيب.
عبر نماذج الذكاء الاصطناعي الـ 17 التي اختبرتها Saturn، بلغ متوسط معدل الدقة 43%، مما يعني أن روبوتات الدردشة هذه أخطأت في الإجابة على الأسئلة المالية بنسبة 57% من الوقت. وعندما عُرضت عليها سيناريوهات معقدة ومتعددة الخطوات تركز على القواعد الضريبية والأرقام المالية الأكثر دقة، انخفضت دقة أدوات الذكاء الاصطناعي المختبرة إلى 12%، مع ارتكاب الأخطاء بنسبة 88% من الوقت.
ليس من المستغرب أن نماذج الذكاء الاصطناعي المجانية التي تم اختبارها سجلت معدل فشل بلغ 63%، بينما حققت النماذج المدفوعة تقييمًا بنسبة 49% بدلاً من ذلك. وحصل Claude Haiku 4.5 على لقب النموذج المجاني الأسوأ أداءً، حيث قدم إجابات خاطئة أ或者 غير كاملة بنسبة 82% من الوقت. في المقابل، برز ChatGPT-5.6 Luna (max) كأفضل نموذج مجاني أداءً، على الرغم من أن معدل تقديمه لردود غير صحيحة أ或者 غير كاملة بلغ 56% من الوقت.
من بين جميع النماذج التي تم اختبارها، وجد بحث Saturn أن نموذج Claude Opus 5 المدفوع من Anthropic (الخاص بالاستدلال) حقق أفضل النتائج بمعدل نجاح بلغ 61%. حتى مع هذه الإحصائية التي تشير إلى كونه روبوت الدردشة الأفضل أداءً في تقديم المشورة المالية، إلا أن Claude Opus 5 أخفق في تقديم إجابات صحيحة في ما يقرب من أربع من كل عشر حالات. وعندما عُرضت عليه أسئلة أكثر تعقيدًا، استمر في ارتكاب الأخطاء بنسبة 67% من الوقت.
الأكثر إثارة للقلق في دراسة Saturn هو تعمقها في الأخطاء المحددة التي رصدتها في نماذج الذكاء الاصطناعي التي اختبرتها، والتي قد تؤدي إلى عواقب مالية وخيمة. على سبيل المثال، اقترح أحد النماذج قاعدة تفيد بأن خريج الجامعة يمكنه إيقاف سداد قروضه الطلابية بالانتقال إلى الخارج (في الواقع، قد يؤدي ذلك إلى زيادة الأقساط الشهرية). كما أخبر نموذج Gemini الذي تم اختباره أحد المقترضين بشكل خاطئ أن الحصول على إجازة من سداد أقساط الرهن العقاري لن يؤثر على درجة ائتمانه. لمزيد من المعلومات حول قيود روبوتات الدردشة، يمكنك الاطلاع على مقالنا حول نقطة عمياء مزعجة تعاني منها.
結論
يشير تقرير Saturn إلى حقيقة مُحبطة يجب على العديد من مستخدمي الذكاء الاصطناعي استيعابها: أن المشورة المالية المقدمة من الذكاء الاصطناعي لا تزال غير موثوقة، وقد تعرض مستخدميها لخسارة مبالغ طائلة من المال بدلاً من تحقيق Plus منه.
سلط تقرير صادر في مارس 2026 عن EY الضوء على أن 53% من المستجيبين يفضلون استخدام مساعد 人工智能 لاتخاذ قرارات الاستثمار المالي، بينما يفضل 14% استخدام ذكاء اصطناعي مستقل، وقال 33% إنهم لن يستخدموا أي شكل من أشكال الذكاء الاصطناعي في مثل هذه الحالات.
بفضل نتائج Saturn، قد ترتفع هذه الإحصائية البالغة 14% (الخاصة بالذكاء الاصطناعي المستقل) مع امتناع مستخدمي الذكاء الاصطناعي عن طرح أسئلة شخصية على روبوتات الدردشة حول إدارة الديون، والقروض الطلابية، والرهون العقارية، والمعاشات التقاعدية، وضريبة الميراث، والتخطيط للتقاعد.
評論被關閉。