مشکل اوراکل: چالش پنهون ارزیابی هوش مصنوعی تو پزشکی
خلاصهٔ کاملتر
نویسنده، بابی سموئلز از شرکت Protege، با یه مثال شروع میکنه: دانشجوی پزشکی که تو همه امتحانا صد گرفته، لزوماً پزشک خوبی نیست. به گفته اون، همین حرف دقیقاً مشکل هوش مصنوعی تو سلامته: مدلا رو با «امتحان» میسنجیم، در حالی که کار واقعی پزشکی خیلی فرق داره. سه دلیل اصلیش رو اینجوری میشمره: تصمیمای پزشکی ذاتاً ذهنیان و «حقیقت مطلق» ندارن، دادههای خام معمولاً پیش شرکتا قفله، و بنچمارکا هم بیاینکه کسی بخواد، تبدیل به ابزار تبلیغاتی میشن.
نویسنده اسم این معضل رو «مشکل اوراکل» گذاشته: تنها راه سنجیدن درستی یه تصمیم پزشکی اینه که بیمار رو تا مدتها دنبال کنی، که خودش کار سختیه. با داده واقعی از شبکه Protege نشون میده هویت جراح بهتنهایی میتونه تا ۷۷ درصد از تفاوت تصمیما (مثلاً بین تعویض جزئی یا کامل زانو) رو توضیح بده؛ یعنی مدل ممکنه «درست» تصمیم بگیره ولی چون با سلیقه اون پزشک خاص یکی نبوده، تو بنچمارک نمره بد بگیره.
آمار استفاده هم نگرانکنندهست: طبق گزارش OpenAI بیش از ۳۰۰ میلیون نفر هفتگی از ChatGPT برای سوالای سلامت استفاده میکنن، و بهزودی نزدیک یهسوم یادداشتای پزشکی SOAP رو هوش مصنوعی مینویسه. اما بنچمارکای فعلی خیلی محدودن: میانه یه پرونده پزشکی واقعی حدود ۸۵۰۰ توکنه، ولی پنج تا از شش بنچمارک عمومی سلامت کمتر از این حجم به مدل میدن؛ بعضیاشون فقط کمتر از ۲۰۰ توکن. حتی ترتیب چیدن گزینههای چندگزینهای یا اضافهکردن یه جمله به پرامپت میتونه برنده رقابت بین مدلا رو کاملاً عوض کنه.
نتیجهگیری نویسنده اینه که مشکل اصلی دیگه داده و قدرت پردازش نیست، بلکه ندونستن اینه که مدل کِی واقعاً درست تصمیم گرفته. بهجای تمرکز روی نمره تست، پیشنهادش اینه که اثر واقعی هوش مصنوعی رو روی چیزایی مثل امید به زندگی، فرسودگی پرستارا و اعتماد بیمار بسنجیم.
نکات کلیدی:
- هویت جراح تا ۷۷ درصد از تفاوت تصمیمای پزشکی رو توضیح میده، نه ویژگیای بیمار.
- بیش از ۳۰۰ میلیون نفر هفتگی از ChatGPT برای سوالای سلامت استفاده میکنن.
- میانه یه پرونده پزشکی ۸۵۰۰ توکنه؛ پنج از شش بنچمارک عمومی کمتر از این به مدل میدن.
- عوضکردن ترتیب گزینهها یا یه جمله تو پرامپت میتونه برنده مقایسه مدلا رو عوض کنه.
- نویسنده میگه راهحل، سنجش اثر واقعی رو سلامت بیماره، نه فقط نمره بنچمارک.




