SkillOS: ایجنتهای هوش مصنوعی که از تجربه یاد میگیرن
خلاصهٔ کاملتر
اکثر ایجنتهای مبتنی بر LLM مثل یه حلکنندهی تکباره عمل میکنن؛ تسکی رو انجام میدن و هیچ چیزی از اون تجربه به دفعهی بعد منتقل نمیشه. SkillOS این مشکل رو با ایدهی «مهارتهای قابل استفادهی مجدد» حل میکنه؛ مهارتهایی که از تجربههای قبلی استخراج میشن و میتونن در تسکهای مشابه آینده دوباره به کار گرفته بشن.
معماری SkillOS دو بخش اصلی داره: یه مجری ثابت (frozen executor) که مهارتها رو بازیابی و اعمال میکنه، و یه متصدی مهارت قابل آموزش (trainable skill curator) که یک مخزن خارجی به نام SkillRepo رو مدیریت میکنه. متصدی مهارت با یادگیری تقویتی آموزش میبینه تا یاد بگیره چه مهارتهایی رو اضافه، ویرایش، یا حذف کنه.
چالش اصلی اینه که بازخورد یادگیری در این فرآیند غیرمستقیم و با تأخیر هست؛ اگه ایجنت یه مهارت جدید اضافه کنه، اثر اون رو شاید فقط در تسکهای بعدی بشه سنجید. SkillOS این مشکل رو با طراحی پاداشهای ترکیبی و آموزش روی دستههایی از تسکهای بههم مرتبط حل میکنه؛ تسکهای اولیه SkillRepo رو آپدیت میکنن و تسکهای بعدی نتیجهی این آپدیت رو ارزیابی میکنن.
نتایج آزمایشها روی تسکهای چندمرحلهای و تکمرحلهای نشون میده که SkillOS از هر دو روش «بدون حافظه» و «با حافظهی قوی» پیشی میگیره. جالبتر اینه که متصدی آموزشدیده روی مدلهای مجری مختلف و حوزههای گوناگون هم تعمیم پیدا میکنه. با گذر زمان، مهارتهای ذخیرهشده در SkillRepo به فایلهای Markdown ساختارمندتری تبدیل میشن که متا-مهارتهای سطح بالاتر رو هم در خودشون کدگذاری میکنن.
نکات کلیدی:
- SkillOS ایجنتهای LLM رو از حلکنندههای تکباره به سیستمهای خودتکاملیابنده تبدیل میکنه
- یادگیری تقویتی برای مدیریت هوشمند مخزن مهارت (SkillRepo) به کار میره
- بازخورد غیرمستقیم با آموزش روی دستههای تسکهای وابسته به هم جبران میشه
- متصدی مهارت روی مدلهای مجری متفاوت هم قابل تعمیمه
- مهارتها با گذر زمان رشد میکنن و ساختار پیچیدهتری پیدا میکنن




