چرا بیشتر دادههای RL که به لبهای فرانتیر فروخته میشن، استاندارد لازم رو ندارن؟
خلاصهٔ کاملتر
صنعت داده برای آموزش مدلهای زبانی بزرگ با یه بحران پنهان روبهروئه: اکثر دادههایی که به لبهای فرانتیر فروخته میشن، از نظر کیفیت زیر سطح انتظار این لبها هستن. نویسنده استدلال میکنه که شرکتهای داده از دو طرف ضربه میخورن؛ هم دامنههای سادهتر رو انتخاب میکنن چون ارزیابیشون راحتتره، هم توی همون دامنههای ساده هم QC درستی نمیکنن.
بررسی ورودی (Intake Review) اولین و ارزانترین دروازه QC هست. قبل از هر run آموزشی، باید بررسی کرد که آیا اصلاً میشه این دیتاست رو ارزیابی کرد یا نه. این چک شامل چند مورد اصلیه:
- طیفبندی تأییدپذیری: تکلیف کجا بین grading قطعی کد (مثل SWE-bench) و قضاوت LLM (مثل HealthBench یا Prometheus 2) قرار میگیره؟
- مقاومت در برابر آلودگی: آیا دیتاست میتونه موج بعدی مدلها رو هم تفکیک کنه؟ مثلاً GPQA و AIME بهخاطر نشت به دادههای پیشآموزش، ظرف یه سال قدرت تمایزگذاریشون رو از دست دادن.
- تحلیل pass@k و توزیع سختی: اگه pass@1 روی مدل هدف صفر باشه یا توزیع سختی دوقطبی باشه، هیچ گرادیانی برای یادگیری وجود نداره.
- ساختار rubric: معیارهای اتمیک و باینری هستن یا ترکیبی و reward-hackable؟
فروشندههایی که این بررسی رو بهشکل مستند انجام میدن، چرخه onboarding رو در چند هفته طی میکنن نه چند ماه.
بعد از intake، نوبت تست فعال میرسه که گرانتره اما مشکلاتی رو شناسایی میکنه که intake نمیتونه ببینه. Reward hacking توی training ظاهر میشه، نه ارزیابی استاتیک. METR اعلام کرد ۱ تا ۲ درصد از تلاشهای o3 شامل exploit بود و ImpossibleBench نشون داد GPT-5 در ۷۶ درصد موارد تستکیسها رو دور میزنه.
سه پروب مهم برای تست فعال که تقریباً هیچ فروشندهای اونا رو اجرا نمیکنه اینان:
- Sycophancy: چاپلوسی مدل زیر فشار reward
- Reward-tampering: دستکاری تابع پاداش
- Alignment-faking: وانمود کردن به همسویی (baseline: 12%)
برای دادههایی که با verifier گریدینگ میشن، الگوی SWE-bench Verified Pro با ۲۰۰ مورد PASS و ۲۰۰ مورد FAIL با گزارش جداگانه FP و FN حالا حداقل انتظاره. جالبه که OpenAI اعلام کرد ۵۹.۴٪ از مسائل SWE-bench اصلی، test case های معیوب داشتن.
نکات کلیدی:
- بیشتر دادههای RL که در ۲۰۲۶ به لبهای فرانتیر فروخته میشن از چارچوب QC داخلی خود این لبها عقبترن
- بررسی ورودی (intake review) ارزانترین دروازه QC هست اما اغلب نادیده گرفته میشه
- reward hacking، sycophancy و فراموشکاری مدل مشکلاتی هستن که فقط با تست فعال (نه ارزیابی استاتیک) شناسایی میشن
- Anthropic و سایر لبها در ۲۰۲۵ بیش از یک میلیارد دلار برای دادههای RL هزینه کردن — پس هزینه نادیده گرفتن QC بسیار بالاست
- فروشندههایی که این چارچوب رو مستند ارائه میدن، قراردادها رو سریعتر میبندن و اعتماد بیشتری میسازن




