راهنمای کامل یادگیری تقویتی برای مدلهای زبانی بزرگ
خلاصهٔ کاملتر
کمرون وولف، پژوهشگر و نویسندهی نیوزلتر Deep (Learning) Focus، تو این پست یه مرور جامع از یادگیری تقویتی (RL) برای مدلهای زبانی بزرگ نوشته -از مفاهیم پایه تا لبهی تحقیقات امروز. به گفتهی خودش، هدف اینه که یه مرجع مستقل باشه که هم مبانی RL رو پوشش بده، هم مسیر تکامل الگوریتمهای policy gradient که برای آموزش LLMها استفاده میشن.
تو فرمولبندی RL برای LLM، خود مدل زبانی نقش policy رو داره، پرامپت state اولیهست و هر توکن (یا کل پاسخ) یه action حساب میشه. پاداشها میتونن outcome-based باشن (فقط به کل پاسخ داده میشن) یا process-based (به مراحل میانی هم پاداش میدن)؛ پاداشهای outcome رایجتر هستن ولی چون فقط در پایان مسیر داده میشن، یادگیری رو سختتر میکنن.
مقاله دو چارچوب اصلی برای محاسبهی پاداش رو مقایسه میکنه: RLHF که پاداش رو از یه مدل پاداش آموزشدیده روی ترجیحات انسانی میگیره، و RLVR که پاداش رو مستقیم از توابع راستیآزمایی قطعی (مثل تست واحد کد یا تطبیق جواب ریاضی) استخراج میکنه. نویسنده اشاره میکنه چون RLVR به مدل پاداش وابسته نیست، ریسک reward hacking خیلی کمتره و همین باعث شده مقیاسپذیرتر باشه -یکی از دلایل پیشرفت مدلهای استدلالی اخیر.
برای محاسبهی advantage (یعنی چقدر یه اکشن بهتر یا بدتر از انتظار پالیسی عمل کرده)، مقاله یه تخمین ساده نشون میده: تفاوت بازدهی واقعی مشاهدهشده و خروجی مدل ارزش (critic):
returns = ... # بازدهی واقعی هر توکن
values = critic(states) # تخمین ارزش هر حالت
advantages = returns - values.detach() # تخمین advantageاین تفاوت مشخص میکنه که آیا نتیجهی یه اکشن بهتر از چیزی بوده که مدل ارزش پیشبینی کرده بود یا بدتر.
نویسنده همچنین به نقش KL divergence تو کنترل پالیسی میپردازه: این معیار میزان فاصلهی پالیسی در حال آموزش از یه پالیسی مرجع (معمولا مدل قبل از RL) رو اندازه میگیره و بهعنوان جریمه، یا مستقیم به پاداش اضافه میشه یا تو تابع loss میاد -روش اول تو PPO اولیهی RLHF رایجه و روش دوم تو GRPO. چون محاسبهی دقیق KL روی کل واژگان پرهزینهست، عملا از تخمینهای Monte Carlo مثل k1 و k3 استفاده میشه.
نکات کلیدی:
- مقاله دو فرمولبندی MDP (سطح توکن) و bandit (سطح کل پاسخ) رو برای مدلسازی RL در LLM مقایسه میکنه
- RLHF از مدل پاداش آموزشدیده روی ترجیحات انسانی استفاده میکنه، RLVR از توابع راستیآزمایی قطعی
- الگوریتمهایی مثل REINFORCE و RLOO با فرمولبندی bandit کار میکنن، PPO با فرمولبندی MDP
- برای تخمین KL divergence بدون محاسبهی کل توزیع واژگان، از تخمینگرهای Monte Carlo مثل k1 و k3 استفاده میشه




