البث المباشر

باحثون يحذرون من تقييم الذكاء الاصطناعي طبياً

الإثنين 21 سبتمبر 2026 - 13:21 بتوقيت طهران
باحثون يحذرون من تقييم الذكاء الاصطناعي طبياً

حذّر باحثون من الاكتفاء بالمعايير الداخلية ومؤشرات استقرار العناقيد عند تقييم أداء خوارزميات الذكاء الاصطناعي في تحليل البيانات الطبية، مؤكدين أن هذه المؤشرات لا تكفي لتحديد مدى توافق النتائج مع التصنيفات السريرية المعتمدة.

وأظهرت دراسة مقارنة أجراها باحثون من جامعة طهران للعلوم الطبية ومؤسسات متعاونة، ونُشرت في مجلة Digital Health، أن أياً من خوارزميات التجميع الثماني التي جرى اختبارها لم يحقق أداءً متفوقاً بصورة ثابتة في جميع مجموعات البيانات الطبية التي شملتها الدراسة.

وتُستخدم تقنيات التنقيب عن البيانات والتعلم الآلي على نطاق متزايد مع تنامي حجم وتعقيد البيانات الطبية، فيما تُعد تقنية التجميع (Clustering) إحدى أساليب التعلم غير الخاضع للإشراف، إذ تعمل على تصنيف العينات المتشابهة في مجموعات من دون الحاجة إلى بيانات موسومة مسبقاً، بهدف الكشف عن الأنماط والهياكل الكامنة في مجموعات البيانات الطبية المعقدة.

وشملت الدراسة خمس مجموعات بيانات طبية عامة ومجهولة الهوية، هي بيانات مرضى الكبد في الهند (ILPD)، وسرطان الثدي، ومرض السكري لدى الهنود من قبيلة بيما، وبيانات أمراض القلب Statlog، ومتلازمة تكيس المبايض (PCOS).

وبعد معالجة البيانات، بما في ذلك التعامل مع القيم المفقودة وتطبيع البيانات وترميز المتغيرات، اختبر الباحثون ثماني خوارزميات للتجميع، هي التجميع الهرمي (HC)، وk-means، وFANNY، وخوارزمية الخريطة ذاتية التنظيم الشجرية (SOTA)، وDIANA، وPAM، وCLARA، وAGNES.

وقيّم الباحثون أداء الخوارزميات من خلال ثلاث مجموعات رئيسية من المعايير، شملت المؤشرات الداخلية مثل قابلية الاتصال وعرض السيلويت ومؤشر Dunn، إلى جانب مؤشرات استقرار العناقيد، ومنها متوسط نسبة عدم التداخل (APN) ومتوسط المسافة (AD) ومتوسط المسافة بين المتوسطات (ADM) وشكل الجدارة (FOM). كما استخدمت الدقة ومؤشر Adjusted Rand (ARI) في التحقق الخارجي لمقارنة نتائج التجميع بالتصنيفات المتاحة.

وأظهرت النتائج أن خوارزميتي التجميع الهرمي وAGNES حققتا أداءً أفضل بصورة متكررة في مجموعات بيانات ILPD والسكري وStatlog، وفقاً للمعايير الداخلية ومؤشرات الاستقرار، بينما سجلت خوارزمية k-means أفضل أداء في مجموعة بيانات سرطان الثدي.

أما في بيانات متلازمة تكيس المبايض، فقد كانت نتائج HC وAGNES وk-means وDIANA متقاربة، من دون تسجيل تفوق واضح لخوارزمية واحدة على بقية الأساليب.

لكن نتائج التحقق الخارجي قدمت صورة مختلفة، إذ أظهرت أن تفوق خوارزمية ما وفق المعايير الداخلية ومؤشرات الاستقرار لا يعني بالضرورة أن المجموعات التي تنشئها تتطابق بصورة أكبر مع التصنيفات السريرية المعروفة.

وخلص الباحثون إلى أنه لا يمكن اعتماد خوارزمية تجميع واحدة بوصفها الأفضل لجميع مجموعات البيانات الطبية، مشددين على أن تقييم جودة التجميع ينبغي ألا يعتمد على المعايير الداخلية والاستقرار فقط.

وأكدت الدراسة أن الجمع بين المعايير الداخلية ومؤشرات الاستقرار والتحقق الخارجي يوفر تقييماً أكثر شمولاً لأداء خوارزميات التجميع في تحليل البيانات الطبية، بما قد يساعد الباحثين في مجال المعلوماتية الصحية على اختيار الأساليب المناسبة وإنتاج نتائج أكثر موثوقية وقابلية لإعادة الإنتاج.

شاركوا هذا الخبر مع أصدقائكم

جميع الحقوق محفوظة