Antidoom؛ راهحل لیکویید برای حلقههای تکرار مدلها
خلاصهٔ کاملتر
به گفته لیکویید AI، یکی از خطاهای رایج زمان استنتاج (inference) توی مدلهای زبانی، زوال تکراری (repetitive degeneration) هست؛ مدل یه عبارت — معمولاً چیزی مثل «صبر کن، بذار دوباره فکر کنم» — رو تولید میکنه و بعد همون رو بارها و بارها تکرار میکنه تا پنجره کانتکست تموم شه. لیکویید اسم این پدیده رو doom loop گذاشته و میگه مدلهای استدلالی کوچیک، مخصوصاً روی مسائل سخت ریاضی و کدنویسی و ردهای فکری طولانی، بیشتر بهش دچار میشن.
راهحل مرسوم اینه که موقع استنتاج یه repetition_penalty اعمال بشه تا توزیع خروجی وزندهی مجدد بشه، ولی نویسنده میگه این یه راهحل سرهمبندیشدهست که میتونه عملکرد رو خراب کنه. یادگیری تقویتی هم جواب میده ولی پاداشدهی دقیق و rollout آنلاین پرهزینه میخواد.
روش لیکویید هدفمندتره: دقیقاً همون توکنی که یه حلقه رو شروع میکنه شناسایی میکنن، مدل رو آموزش میدن که توی همون یه موقعیت گزینههای منسجمتر رو ترجیح بده، و بقیه توزیع رو تقریباً دستنخورده میذارن. این روش که Antidoom نامیده شده، یه الگوریتم به اسم Final Token Preference Optimization (FTPO) رو به کار میبره؛ نسخهای شبیه DPO که فقط روی توکن انتهایی یه دنباله در حال تولید آموزش میبینه و چند توکن جایگزین رو همزمان تقویت میکنه تا فقط یه توکن پرتکرار جای یکی دیگه رو نگیره.
طبق تحلیل نویسنده، حلقهها از ترکیب سه مکانیزم میآن. اول، بعضی توکنها بیشازحد آموزش دیدن و پرتکرارن — توی مدلهای استدلالی، نشانگرهای گفتمانی و خوداندیشی مثل «Wait» یا «Alternatively»؛ وقتی مدل نامطمئن یا گیر میشه، اینها به گزینههای جذابِ بازگشتی تبدیل میشن. دوم، هر بار تکرار، احتمال همون دنباله رو بالاتر میبره تا به ۱ نزدیک شه. سوم، مدلهای استدلالی معمولاً با دمای پایین اجرا میشن و توی دمای صفر همیشه محتملترین توکن انتخاب میشه، پس یه حلقهٔ تقویتشده هیچ راه خروجی نداره.
برای ساختن دیتاست آموزشی، لیکویید روی یه مجموعه پرامپت که عمداً برای ایجاد حلقه طراحی شده کامل تولید میکنه، بعد خطاها رو استخراج میکنه؛ یه حلقه وقتی تشخیص داده میشه که یه بخش حداقل چهار بار و روی حداقل ۶۰ کاراکتر تکرار بشه، و بعد اولین توکنِ اولین تکرار هدف قرار میگیره. نتیجه چشمگیره: روی یه چکپوینت اولیه از LFM2.5-2.6B، ۱۰.۲٪ از خروجیها روی پرامپتهای سخت ریاضی و کد حلقه تولید میکردن؛ بعد از آموزش Antidoom این نرخ به ۱.۴٪ رسید و امتیازهای ارزیابی هم بهخاطر کمشدن حلقهها بهتر شدن.
نکات کلیدی:
- doom loop یعنی گیرکردن مدل توی تکرار بیپایان یه عبارت تا اتمام کانتکست
- Antidoom فقط توکن شروع حلقه رو اصلاح میکنه و بقیه توزیع رو دستنخورده میذاره
- الگوریتم FTPO فقط روی توکن انتهایی آموزش میبینه و چند جایگزین رو تقویت میکنه
- نرخ حلقه روی LFM2.5-2.6B از ۱۰.۲٪ به ۱.۴٪ کاهش پیدا کرد
- دمای پایین و توکنهای بیشازحد آموزشدیده مثل «Wait» حلقهها رو تشدید میکنن




