وقتی هوش مصنوعی خودش تحقیق میکنه
خلاصهٔ کاملتر
شرکت Recursive تو این مقاله اولین نتایج یه سیستم تحقیق هوش مصنوعی خودکار رو منتشر کرده. به گفتهٔ تیم، این سیستم کل حلقهٔ تحقیق رو خودش میچرخونه: یه ایده پیشنهاد میده، پیادهسازیش میکنه، آزمایش اجرا میکنه، نتیجه رو اعتبارسنجی میکنه و از چیزی که یاد گرفته برای انتخاب آزمایش بعدی استفاده میکنه. چندتا رشتهٔ تحقیق رو همزمان و در بازههای طولانی پیش میبره و شاخههای امیدوارکننده رو با هم ترکیب میکنه.
تیم میگه سیستم رو روی سه بنچمارک تست کرده که هم اهمیت عملی دارن و هم حلقهٔ بازخورد سریعی دارن. این سه تا روی سه اهرم اصلی پیشرفت هوش مصنوعی فشار میارن: الگوریتم بهتر آموزش، آموزش سریعتر، و استفادهٔ کارآمدتر از سختافزار. نکتهٔ مهم اینه که هر سه معیار روشن و واریانس پایینی دارن، برای همین تشخیص «تقلب در پاداش» (reward hack) توشون راحتتره.
تو بنچمارک اول یعنی NanoChat که کارش آموزش یه مدل زبانی کوچیک تو بودجهٔ پنج دقیقه روی یه GPUـه، سیستم از بهترین راهحل جامعهٔ autoresearch@home جلو زد و خطای validation رو از 0.9372 به 0.9109 BPB رسوند. یکی از بزرگترین بهبودها از یه مکانیزم حافظهٔ کوتاهمدت غنیتر اومد: علاوه بر value embedding پایه، مدل هر bigram و trigram رو هش میکنه و بردارهای جدول رو با گیتهای یادگرفتهشده وارد مسیر value توجه میکنه.
v = v + gate.unsqueeze(-1) * ve
v = v + bg_gate.unsqueeze(-1) * bigram_ve
v = v + tg_gate.unsqueeze(-1) * trigram_veبنچمارک دوم یعنی NanoGPT Speedrun خیلی سختتره، چون بیشتر از دو سال یه جامعهٔ بزرگ روش کار کرده و زمان آموزش رو از حدود ۴۵ دقیقه به 79.7 ثانیه رسونده. با این حال سیستم باز هم تونست زمان رو به 77.5 ثانیه برسونه. به گفتهٔ نویسنده این بهبود از ترکیب چند تغییر اومد: بردن محاسبات توجه به دقت FP8 (هشتبیتی) فقط موقع آموزش، تزریق نویز اکتشاف کنترلشده تو بهینهساز، و یه کرنل MLP سبکتر که فعالسازیهای اضافی رو موقع backward بازسازی میکنه.
بنچمارک سوم یعنی SOL-ExecBench یه قدم پایینتر میره و سراغ نوشتن کرنلهای سریع و درست GPU میره؛ چیزی که خیلی به کار واقعی تولید نزدیکتره چون هزینهٔ آموزش و inference واقعی رو تعیین میکنه. سیستم روی ۲۳۵ کرنل بهصورت مشترک کار کرد تا الگوهای مشترک رو بین کارهای مرتبط دوباره استفاده کنه و میانگین امتیاز SOL رو از 0.699 به 0.754 رسوند، یعنی ۱۸ درصد کم شدن فاصله تا حد ایدهآل.
تیم تأکید میکنه که این ایدهها از خود سیستم اومدن نه از تخصص قبلیشون، و حتی برای بررسی بیشتر، خروجی این اجراها رو open-source کردن. البته خودشون هم میگن چون مدلهای زیربنایی ممکنه قبلاً این تکنیکهای عمومی رو دیده باشن، این نتایج لزوماً «کشف مستقل» نیستن، اما نشون میده فرایند جستجو میتونه یه پشتهٔ آموزشی رقابتی رو از نقطهٔ شروع ضعیف هم سرهم کنه.
نکات کلیدی:
- سیستمی که کل حلقهٔ تحقیق رو خودکار میکنه: ایده، پیادهسازی، آزمایش، اعتبارسنجی و انتخاب آزمایش بعدی
- روی سه بنچمارک به نتیجهٔ state-of-the-art رسید: آموزش با بودجه ثابت، سرعت آموزش، و بهینهسازی کرنل GPU
- حتی روی بنچمارکی که سالها جامعهٔ انسانی روش کار کرده بود (NanoGPT Speedrun) هم بهبود پیدا کرد
- استفاده از جدولهای هش bigram/trigram و دقت FP8 از تکنیکهای کلیدی بود
- تیم خروجی اجراها رو open-source کرده تا بقیه بتونن بررسی و روش کار کنن




