الذكاء الاصطناعي العام تفوق على أدوات سريرية متخصصة

يذكر تقييم مستقل جديد نُشر في Nature Medicine أن نماذج اللغة الكبيرة العامة الرائدة تفوقت على منتجين متخصصين في الذكاء الاصطناعي السريري عبر ثلاثة معايير طبية منفصلة. قارنت الدراسة بين OpenEvidence وUpToDate Expert AI من جهة، وبين GPT-5.2 وGemini 3.1 Pro Preview وClaude Opus 4.6 من جهة أخرى.

تتعارض النتيجة مع افتراض شائع في الصناعة مفاده أن المنتجات السريرية المصممة خصيصًا للطب ستتفوق بشكل موثوق على النماذج الأوسع بسبب التدريب الخاص بالمجال أو أنظمة الاسترجاع. في هذا التقييم، لم يحدث ذلك.

وتعرض الورقة هذه النتيجة بوصفها تحذيرًا عمليًا للمستشفيات والأطباء وأنظمة الرعاية الصحية التي قد تفكر في النشر السريع لذكاء اصطناعي طبي مملوك من دون تحقق خارجي قوي. ويجادل المؤلفون بأن الادعاءات المتعلقة بالأداء السريري المتفوق يجب أن تُختبر بشكل مستقل، لا سيما عندما لا تكون البنى الأساسية وخطوط التدريب متاحة للعامة.

كيف أُجريَت المقارنة

مرّ التقييم بثلاث مراحل. أولًا، استخدم الباحثون 500 سؤال من MedQA لاختبار المعرفة الطبية. ثانيًا، استخدموا 500 بند من HealthBench لقياس مدى توافق مخرجات النماذج مع الأطباء. ثالثًا، أنشأوا معيارًا للاستفسارات السريرية الواقعية من 100 سؤال مجهول الهوية كان الأطباء قد طرحوها على نموذج لغة عام في بيئة سريرية حية.

تُعد المرحلة الثالثة أبرز أجزاء الورقة لأنها تحاول تجاوز نتائج المعايير المجردة. ففي مجموعة الاستفسارات السريرية الواقعية، أجرى 12 طبيبًا أمريكيًا مراجعات عشوائية ومخفاة لمخرجات النماذج، ما أنتج 1,800 وسم/تعليق بين النموذج والسؤال.

وعبر التقييمات الثلاثة، تفوقت نماذج الحدود العامة الرائدة على أداتي الذكاء الاصطناعي السريري. وتذكر الورقة أيضًا أن الأدوات السريرية جاءت بنتائج مماثلة تقريبًا لـ Google Search AI Overview في معيار الاستفسارات السريرية الواقعية.

لماذا تهم هذه النتيجة

الذكاء الاصطناعي السريري المتخصص يدخل بالفعل في الممارسة الطبية، لكن الورقة تقول إن التقييمات المستقلة في العالم الواقعي ما تزال نادرة. وتكتسب هذه الفجوة أهمية لأن أنظمة الرعاية الصحية يُطلب منها الوثوق بأدوات غالبًا ما يكون تصميمها الداخلي وبيانات التدريب وخيارات النماذج فيها غير شفافة.

ولا تقول الدراسة إن النماذج العامة آمنة تلقائيًا للاستخدام الطبي غير الخاضع للإشراف. بدلًا من ذلك، فحواها أضيق لكنه أهم: التخصص وحده لا ينبغي اعتباره دليلًا على أداء أفضل. إذا كان المنتج يروّج لنفسه على أنه مضبوط طبيًا، فلا يزال على البائعين والمشترين أن يثبتوا أنه يؤدي فعلًا بشكل أفضل في المهام ذات الصلة السريريّة.

ولهذا تبعات مباشرة على الشراء والحوكمة. فالمستشفى الذي يختار بين مساعد سريري يحمل علامة تجارية ونموذج حدودي محاط بضمانات مؤسسية قد لا يكون أمامه اختيار بين مستويات أداء مختلفة بوضوح. ووفقًا لهذا التقييم، يمكن للأنظمة الأكثر عمومية أن تساوي أو تتجاوز الأنظمة المتخصصة في مقاييس مهمة.

تحدٍ للأفضلية الاحتكارية

وتشير الورقة أيضًا إلى تحول أوسع في الذكاء الاصطناعي. فقد استفادت نماذج الحدود من مجموعات تدريب ضخمة جدًا ومن أعمال مواءمة واسعة. ويقترح المؤلفون أن تلك المكاسب قد تكون الآن قوية بما يكفي لتحدي المنتجات المتخصصة في مجال محدد حتى من دون إعادة تدريب ضيق.

هذا لا يعني أن كل نموذج عام سيتفوق على كل أداة سريرية في كل بيئة. لكنه يعني أن الحجة القديمة القائلة إن التخصص يخلق بالضرورة أفضلية حاسمة تبدو أضعف مما افترضه كثير من المشترين.

تكتسب المقارنة أهمية خاصة لأن الأدوات السريرية تُقدَّم بالفعل بوصفها منتجات للممارسة الطبية على نطاق واسع. وفي هذا السياق، فإن الأداء الضعيف ليس مجرد نتيجة أكاديمية. بل يثير أسئلة حول السلامة والقيمة، وما إذا كانت العلامة التجارية القائمة على الخبرة تسبق الأدلة.

ما الذي ينبغي أن تستخلصه الأنظمة الصحية

الخلاصة الأكثر قابلية للدفاع عنها من الدراسة ليست أن على الطب التخلي عن الذكاء الاصطناعي المتخصص. بل إن معايير التقييم تحتاج إلى الارتفاع. ويبدو أن الاختبار المستقل للمهام السريرية الواقعية أمر أساسي قبل الوثوق بأي نظام في الممارسة.

وهذه هي أقوى مساهمة في الورقة. فهي تضع الأدلة الواقعية قبل فئات التسويق، وتذكّر المشترين بأن ملصق النموذج قد يكون أقل أهمية من الأداء المقاس. وفي مجال تحمل فيه الأخطاء عواقب خطيرة، فهذا الفرق ليس نظريًا.

  • قيّمت Nature Medicine أداتين متخصصتين في الذكاء الاصطناعي السريري مقابل ثلاثة نماذج عامة رائدة.
  • تفوقت النماذج الرائدة على الأدوات السريرية في MedQA وHealthBench ومعيار الاستفسارات السريرية الواقعية.
  • استخدم الجزء الواقعي من الدراسة 100 استفسار طبيب مجهول الهوية و1,800 تعليق من الأطباء.
  • يدعو المؤلفون إلى تقييم مستقل أقوى قبل النشر السريري.

هذه المقالة مبنية على تقرير Nature Medicine. اقرأ المقال الأصلي.

Originally published on nature.com