وقتی مدل کوچکتر از GPT-5 بهتر عمل میکنه
خلاصهٔ کاملتر
سالهاست که استراتژی پیشفرض در خرید ابزارهای هوش مصنوعی اینه: بزرگترین مدل موجود رو انتخاب کن. این منطق هم بیدلیل نبود — تا همین اواخر، تقریباً همیشه مدلهای بزرگتر در بنچمارکهای اصلی جلوتر بودن. اما حالا یه نتیجهی تجربی اون فرض رو زیر سوال میبره.
تیم Dharma AI بنچمارک DharmaOCR رو منتشر کرده — یه ارزیابی تخصصی روی وظیفهی OCR (شناسایی متن از تصویر) در اسناد حقوقی و اداری به زبان پرتغالی برزیلی. نتیجه: یه مدل ۳ میلیارد پارامتری تخصصی با امتیاز ۰.۹۱۱ اول شد. Claude Opus 4.6 با ۰.۸۳۳ دوم، Gemini 3.1 Pro با ۰.۸۲۰ سوم، و GPT-5.4 با ۰.۷۵۰ چهارم شد. این شکاف ۸ درصدی بین اول و دوم، از هر فاصلهی دیگهای در لیست بزرگتره.
اما عدد جالبتر هزینهست: مدل تخصصی ۳B تقریباً ۵۲ برابر ارزانتر از Claude Opus 4.6 در هر میلیون صفحه کار میکنه. بهعلاوه، نرخ «تباهی متن» (text degeneration — وقتی مدل وارد یه حلقهی تکراری میشه و خروجی قابلاستفاده نمیده) در این مدل فقط ۰.۲۰٪ بود، در حالی که مدلهای عمومی بزرگتر نرخهای بالاتری داشتن.
دلیل این نتیجه چیه؟ مقاله یه مفهوم کلیدی رو مطرح میکنه: distributional alignment یا «همراستایی توزیعی». یعنی اینکه تاریخچهی آموزشی یه مدل چقدر به وظیفهی هدف نزدیکه. مدل کوچکتری که پارامترهاش رو صرف دقیقاً همون کاری کرده که ازش میخوای، از مدل بزرگی که پارامترهاش پخش دهها حوزهی دیگهست بهتر عمل میکنه.
تخصصسازی یه ویژگی تجمعی هم داره. آزمایشها نشون میدن که همون pipeline آموزشی روی مدلی که از قبل نزدیکتر به حوزه بوده، نتیجهی بهتری میده. مثلاً در مقیاس ۳ میلیارد پارامتر: مدل Nanonets-OCR2 که قبلاً برای OCR عمومی آموزش دیده بود بعد از fine-tuning به ۰.۹۲۱ رسید، ولی مدل Qwen2.5-VL-3B با معماری مشابه اما نقطهی شروع عمومیتر، به ۰.۷۹۳ رسید. همان معماری، همان داده، همان روش — تفاوت فقط در نقطهی شروع بود.
نکات کلیدی:
- یه مدل ۳B تخصصی از Claude Opus، GPT-5، Gemini و سایر APIهای تجاری در OCR تخصصی پیشی گرفت
- هزینهی اجرا ۵۲ برابر کمتر از بهترین رقیب تجاری بود
- «همراستایی توزیعی» (نزدیکی تاریخچهی آموزش به وظیفه) از تعداد پارامترها پیشبینیکنندهتره
- تخصصسازی تجمعیه: نقطهی شروع نزدیکتر به حوزه، نتیجهی fine-tuning رو بهطور چشمگیری بهتر میکنه
- این نتیجه فعلاً در یه حوزه و یه بنچمارک تأیید شده و نیاز به بررسی در حوزههای دیگه داره




