verifiers v1؛ بازسازی محیطهای آموزش ایجنت در Prime Intellect
خلاصهٔ کاملتر
پرایم اینتلکت تو یه رشتهتوییت اعلام کرده که verifiers v1 رو منتشر میکنه؛ به گفتهٔ خودشون یه بازنگری کامل روی پشتهٔ محیطهاشون برای دوران تازهٔ یادگیری تقویتی ایجنتی و ارزیابی مدلها.
ایدهٔ ساختاری اینه که محیط رو به سه تکهٔ مستقل بشکنن: مجموعهٔ تسک (taskset)، هارنس و رانتایم. نتیجهاش انعطافیه که تا الان نبود — میتونی تسکها رو یا بهصورت بومی تو verifiers بسازی یا از چارچوبهای دیگه مثل Harbor بیاری، تو هر هارنسی مثل Codex یا mini-SWE-agent ارزیابی و آموزش بدی، و همه رو تو رانتایمهای مختلف — سابپروسس، داکر یا سندباکس — اجرا کنی.
قطعهٔ مرکزی این معماری یه سرور رهگیریه که خود verifiers مدیریتش میکنه و بین هارنس و سرور استنتاج میشینه. همونجا تریسها رو در لحظه ثبت میکنه، که هم برای آموزش لازمه و هم اجازهٔ بازنویسی میده — مثلاً برای خنثی کردن reward hacking، یعنی وقتی مدل یاد میگیره بهجای حل مسئله، معیار پاداش رو دور بزنه.
تغییر فنی مهم اینه که تریسها حالا گراف جهتدار بدون دور از پیامها هستن و هر پیام دقیقاً یکبار ذخیره میشه. یعنی اندازهٔ تریس با تعداد نوبتها خطی رشد میکنه نه مربعی، و همین رولاوتهای ایجنتی طولانی رو عملی میکنه؛ مخصوصاً برای بازپخش روتر و دادهٔ چندوجهی.
نکتهٔ ظریفتر اینه که رولاوتها خطی نیستن. فشردهسازی متن و زیرایجنتها تو گراف شاخه میسازن، و هر مسیر ریشه تا برگ یه نمونهٔ پیوسته و قابلآموزشه. به بیان تیم، یه تریس یعنی N نمونهٔ آموزشی — و آموزش افقبلند فراتر از پنجرهٔ کانتکست بهشکل بومی ممکن میشه.
verifiers v1 مستقیم به prime-rl وصل میشه و تیم میگه همهٔ اجراهای عملیاتی داخلیشون رو با همین نسخه انجام داده. نمونهای که آوردن آموزش GLM-4.5-Air روی تسکهای ScaleSWEست، با قدمهای زیر چهار دقیقه و رولاوتهای ۳۵ نوبتی، که ۱۰۰۰ قدم رو تو دو روز و فقط با ۶ نود H200 تموم کرده.
نکات کلیدی:
- تفکیک محیط به سه لایهٔ تسک، هارنس و رانتایم برای جابهجایی آزاد بینشون
- سرور رهگیری بین هارنس و موتور استنتاج، با ثبت و امکان بازنویسی تریس
- تریس بهشکل گراف پیام؛ رشد خطی بهجای مربعی با تعداد نوبتها
- هر مسیر ریشه تا برگ یه نمونهٔ آموزشی مستقله
- اتصال مستقیم به prime-rl؛ آموزش GLM-4.5-Air روی ۶ نود H200 در دو روز




