MentalHealthBench: كيف تقيس OpenAI سلامة وجودة استجابات الذكاء الاصطناعي في محادثات الصحة النفسية؟

مركز صناع المحتوى بالذكاء الاصطناعي
0

MentalHealthBench: كيف تقيس OpenAI سلامة وجودة استجابات الذكاء الاصطناعي في محادثات الصحة النفسية؟



أصبح الذكاء الاصطناعي جزءًا من الطريقة التي يبحث بها الناس عن المعلومات ويطرحون الأسئلة ويناقشون المشكلات اليومية. ومع انتشار روبوتات المحادثة القادرة على إجراء حوارات طبيعية، بدأ استخدامها أيضًا في موضوعات حساسة تتعلق بالصحة النفسية والدعم العاطفي.

لكن هناك سؤالًا أكثر تعقيدًا من مجرد معرفة ما إذا كان النموذج يستطيع إنتاج إجابة تبدو متعاطفة: هل يستطيع الذكاء الاصطناعي تقديم استجابة مناسبة وآمنة عندما يكون السياق النفسي للمستخدم معقدًا أو حساسًا؟

للإجابة عن هذا النوع من الأسئلة، أعلنت OpenAI في سبتمبر 2026 عن MentalHealthBench، وهو معيار مفتوح صُمم لتقييم استجابات أنظمة الذكاء الاصطناعي في سيناريوهات تحاكي محادثات واقعية مرتبطة بالصحة النفسية.

ما هو MentalHealthBench؟

MentalHealthBench هو Benchmark أو معيار تقييم مخصص لدراسة أداء نماذج الذكاء الاصطناعي عند التعامل مع محادثات تتعلق بالصحة النفسية.

والـBenchmark في عالم الذكاء الاصطناعي ليس تطبيقًا علاجيًا، ولا خدمة للمستخدم النهائي، بل مجموعة منظمة من الاختبارات تستخدم لمقارنة سلوك النماذج وفق معايير محددة.

في حالة MentalHealthBench، أنشأت OpenAI مجموعة من المحادثات الاصطناعية التي تمثل مواقف مختلفة، ثم ربطت كل مهمة بمعايير تقييم وضعها مختصون في الصحة النفسية.

وبذلك يمكن إعطاء النموذج نفس السيناريو، ثم تقييم رده وفق مجموعة من المعايير المكتوبة مسبقًا.

💡 الفكرة الأساسية: لا يكتفي MentalHealthBench بالسؤال عما إذا كانت الإجابة تبدو جيدة، بل يحاول تقييم مجموعة من السلوكيات التي تجعل الاستجابة أكثر ملاءمة للسياق.

لماذا احتاج الذكاء الاصطناعي إلى معيار خاص بالصحة النفسية؟

تقييم النماذج اللغوية أصبح واسعًا في مجالات مثل البرمجة والرياضيات والعلوم والاستدلال. لكن محادثات الصحة النفسية مختلفة.

في السؤال البرمجي يمكن غالبًا تحديد الإجابة الصحيحة أو الخاطئة بوضوح. أما في المحادثات النفسية، فإن جودة الاستجابة تعتمد على السياق.

قد تكون الإجابة المناسبة لشخص يمر بضغوط يومية غير مناسبة لشخص يمر بحالة أكثر حدة.

كما أن الرد الجيد لا يعتمد على تقديم معلومة فقط، وإنما يمكن أن يعتمد على:

  • فهم ما يقوله المستخدم.
  • معرفة المعلومات الناقصة.
  • طرح سؤال توضيحي عندما يكون ضروريًا.
  • عدم القفز إلى استنتاجات غير مدعومة.
  • مراعاة مستوى الخطورة.
  • احترام قدرة المستخدم على اتخاذ قراراته.
  • تقديم خطوات عملية مناسبة للسياق.
  • معرفة متى يجب تشجيع المستخدم على طلب دعم بشري أو متخصص.

كيف بُني MentalHealthBench؟

أكثر من 80 مختصًا من دول مختلفة

شارك في تطوير المعيار أكثر من 80 مختصًا مرخصًا في الصحة النفسية من 22 دولة، من علماء النفس والأطباء النفسيين.

كما شملت المجموعة خبرات في نحو 20 تخصصًا فرعيًا، وتحدث المشاركون 19 لغة.

هذه النقطة مهمة لأن مفهوم الاستجابة المناسبة في الصحة النفسية قد يتأثر بالسياق الثقافي واللغوي.

1,215 محادثة اصطناعية

يتكون MentalHealthBench من 1,215 مهمة أو محادثة اصطناعية.

⚠️ ملاحظة مهمة: المحادثات اصطناعية وليست سجلات مرضى حقيقيين، ولذلك يجب عدم التعامل معها باعتبارها بيانات سريرية فعلية.
1,215 محادثة أو مهمة اصطناعية
650 حالة غير حادة
221 حالة عالية الحدة
344 حالة طارئة
22 دولة
19 لغة

أنواع المستخدمين داخل المعيار

البالغون

تشمل السيناريوهات حالات مرتبطة بالحياة اليومية والصعوبات النفسية والمواقف التي قد تدفع الشخص إلى البحث عن دعم أو معلومات.

المراهقون

يتضمن المعيار أيضًا سيناريوهات لمستخدمين تتراوح أعمارهم بين 13 و17 عامًا. وهذه الفئة تحتاج إلى تعامل أكثر حذرًا لأن العمر والسياق الأسري والاجتماعي يمكن أن يؤثروا في طبيعة الاستجابة المناسبة.

مقدمو الرعاية

هناك سيناريوهات مرتبطة بالأشخاص الذين يقدمون الرعاية لشخص آخر، بحيث لا يكون السائل بالضرورة هو الشخص الذي يعاني مباشرة.

المختصون

يشمل المعيار كذلك بعض السيناريوهات التي يكون فيها المستخدم مختصًا في المجال الصحي، مما يوسع نطاق الاختبار بدل حصره في المستخدم العام.

ما الذي يقيسه المعيار فعلًا؟

لا يركز MentalHealthBench على معيار واحد مثل التعاطف، وإنما يحاول تقييم مجموعة من السلوكيات المرتبطة بجودة الاستجابة.

فهم السياق

قد تكون الرسالة قصيرة، لكن خلفها معلومات مهمة لم يذكرها المستخدم. لذلك لا يكون الرد الأفضل دائمًا هو الإجابة المباشرة، وقد يحتاج النموذج إلى طرح سؤال توضيحي.

احترام استقلالية المستخدم

هناك فرق بين تقديم معلومات تساعد الشخص على اتخاذ قرار وبين محاولة اتخاذ القرار نيابة عنه. ولهذا يدخل مفهوم User Agency ضمن الجوانب المهمة في تقييم الاستجابة.

معايرة درجة الاستعجال

النموذج الذي يتعامل مع كل مشكلة بسيطة وكأنها حالة طارئة قد يصبح غير عملي، بينما النموذج الذي يقلل من أهمية موقف شديد الخطورة قد يفشل في تقديم الاستجابة المناسبة.

تقديم إرشادات عملية

الرد الذي يحتوي على كلمات تعاطف فقط قد لا يكون كافيًا. وفي بعض الحالات يحتاج المستخدم إلى خطوات واضحة ومناسبة للسياق، مع الحفاظ على حدود واضحة وعدم تقديم النموذج باعتباره بديلًا عن المختص.

كيف يتم تقييم الإجابات؟

أنشأ الخبراء معايير أو Rubrics خاصة بكل مهمة. وتضم المجموعة آلاف المعايير التي كتبها المختصون.

تتراوح أوزان المعايير بين -10 و+10، بحيث يمكن للسلوكيات المفيدة أن تحصل على نقاط إيجابية، بينما يمكن أن تؤدي بعض السلوكيات غير المناسبة إلى نقاط سلبية.

وبذلك لا يصبح التقييم مجرد سؤال: هل كانت الإجابة جيدة أم سيئة؟ بل يصبح أكثر تفصيلًا: أي أجزاء الإجابة كانت مفيدة؟ وأيها كان غير مناسب؟ وما أهمية كل سلوك في السياق المحدد؟

من يقوم بتصحيح الإجابات؟

يستخدم التقييم الآلي نظامًا يعتمد على GPT-5.6 Sol كأداة تقييم، حيث تتم مقارنة استجابات النماذج بالمعايير التي كتبها الخبراء.

وتشير بطاقة OpenAI الحالية إلى أن كل استجابة تحصل على درجة مبنية على الـRubric، ويتم تحويل الدرجة إلى نطاق من 0 إلى 100%، مع أخذ أربع استجابات مستقلة لكل مهمة وحساب المتوسط على مستوى المهمة.

نتائج النماذج: كيف ينبغي قراءتها؟

نشرت OpenAI نتائج لمجموعة من النماذج باستخدام MentalHealthBench. ومن النتائج المنشورة:

النموذج النتيجة المنشورة
GPT-6 Astra 57.3%
GPT-6 Sol 53.9%
Claude Opus 5.5 52.4%
GPT-6 Luna 50.2%
GPT-4o 32.1%
تنبيه: هذه الأرقام تمثل أداء النماذج على معيار محدد، وليست نسب نجاح في العلاج النفسي أو مؤشرات مباشرة على تحسن المستخدمين.

لماذا لا تكفي النتيجة الرقمية وحدها؟

الدرجة تعتمد على تصميم المهام والمعايير المستخدمة وطريقة وزنها وطريقة التقييم وتوزيع الحالات وعدة عوامل أخرى.

لذلك لا يمكن القول إن نموذجًا حصل على 57% "يعرف 57% من الصحة النفسية". هذا تفسير غير صحيح للرقم.

الدرجة تعكس أداء النموذج وفق طريقة القياس المحددة في هذا المعيار.

التعاطف وحده لا يكفي

من السهل الاعتقاد بأن الذكاء الاصطناعي الجيد في المحادثات النفسية هو النموذج الذي يتحدث بلطف.

لكن التعاطف وحده لا يكفي. فقد تكون الإجابة دافئة جدًا، لكنها لا تجمع معلومات كافية، أو تفترض أشياء غير معروفة، أو تقدم نصيحة عامة جدًا، أو لا تميز بين مستويات الاستعجال.

ولهذا يوضح MentalHealthBench الفرق بين الأسلوب الجيد والاستجابة المسؤولة.

أهم حدود MentalHealthBench

المحادثات اصطناعية

المحادثة الاصطناعية قد تحاكي موقفًا واقعيًا، لكنها ليست بالضرورة مساوية لتفاعل حقيقي بين شخص ومختص.

الدرجة لا تقيس النتيجة العلاجية

حتى الاستجابة التي تحصل على درجة مرتفعة لا تثبت أنها تؤدي إلى تحسن نفسي فعلي لدى المستخدم.

التقييم الآلي له حدوده

استخدام نموذج لغوي لتقييم نماذج أخرى يمكن أن يكون مفيدًا وقابلًا للتوسع، لكنه لا يلغي الحاجة إلى التحقق البشري والدراسات المستقلة.

المعيار من تطوير OpenAI

OpenAI هي الجهة التي طورت MentalHealthBench ونشرت نتائج النماذج باستخدامه. لذلك يمكن أن يكون التكرار المستقل من باحثين آخرين مفيدًا لفحص النتائج والمنهجية من زوايا إضافية.

ماذا عن اللغة العربية؟

من النقاط المهمة للمستخدم العربي أن المشروع يتضمن أمثلة بلغات غير الإنجليزية، ومنها العربية.

لكن وجود العربية في مجموعة الاختبار لا يعني أن أداء جميع النماذج سيكون متساويًا بين العربية والإنجليزية.

فاللغة ليست مجرد ترجمة للكلمات؛ إذ توجد اختلافات في التعبير عن المشاعر، واللهجات، والمصطلحات، والسياق الاجتماعي والثقافي.

ولهذا سيكون من المفيد مستقبلًا وجود اختبارات أكثر تفصيلًا للغات واللهجات المختلفة.

ماذا يعني هذا لمستقبل الذكاء الاصطناعي؟

يمكن أن يؤدي انتشار Benchmarks متخصصة مثل MentalHealthBench إلى تغيير طريقة تطوير النماذج.

في الماضي كان التركيز الكبير على زيادة حجم النموذج وتحسين قدرته على الاستدلال ورفع نتائج اختبارات الرياضيات والبرمجة.

لكن الاستخدام الحقيقي يحتاج أيضًا إلى السلامة وفهم السياق ومعرفة الحدود واحترام استقلالية المستخدم وتقليل الاستجابات غير المناسبة.

الفكرة الأوسع: النموذج المتقدم ليس فقط الذي يستطيع الإجابة عن أصعب الأسئلة، بل الذي يستطيع أيضًا التعامل مع المواقف المعقدة بحذر ومعرفة حدوده.

الفرق بين Benchmark والتطبيق الطبي

Benchmark تطبيق صحي مباشر
أداة لتقييم النموذج. نظام يستخدمه أشخاص في سياق صحي.
يعمل على مجموعة اختبار محددة. يتعامل مع مستخدمين ومواقف متغيرة.
يقيس الأداء وفق Rubrics محددة. يحتاج إلى حماية بيانات وضوابط سلامة إضافية.
لا يثبت فعالية علاجية. قد يتطلب تقييمًا سريريًا وتنظيميًا مختلفًا.

هل يمكن أن يصبح MentalHealthBench معيارًا نهائيًا؟

من المبكر اعتبار أي Benchmark معيارًا نهائيًا.

فالذكاء الاصطناعي يتغير بسرعة، كما أن طرق استخدامه تتغير. وقد تظهر نماذج جديدة وأساليب تقييم جديدة وبيانات أكثر واقعية.

ومن المحتمل أن تحتاج الاختبارات المستقبلية إلى الجمع بين:

  1. المحادثات الاصطناعية.
  2. التقييم البشري.
  3. الاختبارات متعددة الجولات.
  4. اختبارات السلامة.
  5. الدراسات الواقعية.
  6. قياس نتائج المستخدمين.
  7. التقييم عبر لغات وثقافات مختلفة.

لماذا يهم هذا الأمر لصناع المحتوى والمطورين؟

بالنسبة لصانع المحتوى، يوضح MentalHealthBench أن نشر معلومة عن الذكاء الاصطناعي يحتاج إلى أكثر من نقل إعلان الشركة.

أما بالنسبة للمطور، فهو يوضح أهمية اختبار النموذج في ظروف قريبة من الاستخدام الفعلي.

وبالنسبة للمستخدم العادي، يوضح أن الإجابة المقنعة ليست بالضرورة إجابة صحيحة أو مناسبة.

أما بالنسبة للباحثين، فإن وجود معيار مفتوح يوفر نقطة بداية لمزيد من التجارب والمقارنات.

الخلاصة

يمثل MentalHealthBench محاولة لتوسيع طريقة تقييم الذكاء الاصطناعي في مجال حساس للغاية.

فبدل التركيز فقط على الحالات الطارئة أو على ما إذا كان النموذج قادرًا على إنتاج إجابة متعاطفة، يحاول المعيار دراسة مجموعة أوسع من السلوكيات، مثل فهم السياق، احترام استقلالية المستخدم، تقديم إرشادات مناسبة، ومعايرة مستوى الاستعجال.

ويضم المعيار 1,215 محادثة اصطناعية، مع معايير تقييم كتبها مختصون في الصحة النفسية، ويغطي مستويات مختلفة من الحالات ومجموعة متنوعة من المستخدمين واللغات.

الخلاصة الأهم: الدرجة المرتفعة في MentalHealthBench لا تعني أن النموذج أصبح معالجًا نفسيًا، ولا تثبت أن استخدامه يؤدي إلى نتائج علاجية أفضل في العالم الحقيقي.

القيمة الحقيقية لهذا النوع من المعايير تكمن في جعل السؤال أكثر دقة:

ليس فقط: هل يستطيع الذكاء الاصطناعي التحدث مع الإنسان؟

بل: هل يستطيع أن يتعامل مع السياق الحساس بطريقة مناسبة وواضحة وآمنة، مع معرفة حدوده؟

الأسئلة الشائعة حول MentalHealthBench

ما هو MentalHealthBench؟
هو معيار مفتوح لتقييم كيفية استجابة نماذج الذكاء الاصطناعي لمحادثات وسيناريوهات مرتبطة بالصحة النفسية.
كم عدد المحادثات الموجودة فيه؟
يضم 1,215 مهمة أو محادثة اصطناعية، منها 650 غير حادة و221 عالية الحدة و344 طارئة.
هل المحادثات حقيقية؟
لا. المحادثات اصطناعية ومصممة لمحاكاة سيناريوهات واقعية، وليست سجلات مرضى حقيقيين.
من شارك في إعداد المعيار؟
شارك أكثر من 80 مختصًا مرخصًا في الصحة النفسية من 22 دولة، مع خبرات تغطي نحو 20 تخصصًا فرعيًا و19 لغة.
هل يثبت MentalHealthBench أن الذكاء الاصطناعي يستطيع تقديم العلاج النفسي؟
لا. المعيار يقيس جودة الاستجابات وفق معايير محددة، ولا يثبت فعالية علاجية أو تحسنًا سريريًا حقيقيًا.
هل يمكن اعتبار النتيجة الأعلى دليلًا على أن النموذج أفضل في كل شيء؟
لا. النتيجة تعكس أداء النموذج على هذا المعيار وتحت منهجيته المحددة، ولا يمكن تعميمها على جميع استخدامات الذكاء الاصطناعي.
لماذا هذه الاختبارات مهمة؟
لأن النماذج أصبحت تستخدم في محادثات حساسة، وبالتالي تحتاج الشركات والباحثون إلى طرق أكثر تفصيلًا لقياس السلامة وجودة الاستجابة.
هل يمكن استخدام ChatGPT بدل الطبيب أو المعالج؟
لا ينبغي اعتبار ChatGPT بديلًا عن العلاج أو الرعاية المهنية. القدرة على المحادثة لا تعني امتلاك دور سريري.

ملاحظة منهجية

هذا المقال يميز بين الحقائق المنشورة عن MentalHealthBench وبين التحليل والتفسير.

الأرقام والمنهجية الأساسية مبنية على المعلومات المنشورة عن المعيار وبطاقة OpenAI الخاصة بالتقييم، بينما الاستنتاجات المتعلقة بحدود الـBenchmark هي قراءة تحليلية لطبيعة اختبارات الذكاء الاصطناعي وليست ادعاءات بأن المعيار أثبت فعالية علاجية.

المصادر والمراجع

تمت كتابة المقال بهدف شرح المعيار وتحليل أهميته وحدوده، وليس تقديمه كدليل على أن الذكاء الاصطناعي أصبح بديلًا عن المتخصصين في الصحة النفسية.

```

إرسال تعليق

0 تعليقات

إرسال تعليق (0)
3/related/default