GRAM؛ دکمهی خاموش برای دانش دومنظورهی مدلها
خلاصهٔ کاملتر
یه مدل هوش مصنوعی پیشرفته، در کنار هرچیز دیگه، یه انبار بزرگ از دانشه. بخشی از این دانش «دومنظوره»ست؛ یعنی هم میشه ازش برای کار خوب استفاده کرد هم بد. مثلاً دانش امنیت سایبری هم میتونه یه آسیبپذیری مهم رو وصله کنه هم ازش سوءاستفاده کنه، یا دانش ویروسشناسی هم به ساخت واکسن کمک میکنه هم به طراحی یه پاتوژن خطرناک.
به گفتهی این پژوهش، محافظتهای فعلی کامل نیستن. مدلها رو آموزش میدن که درخواستهای مضر رو رد کنن و از دستهبندها (classifier) استفاده میکنن تا ورودی و خروجی خطرناک رو فیلتر کنن، ولی هیچکدوم دانشی که ته مدل ذخیره شده رو عوض نمیکنن. برای همین یه مهاجم مصمم ممکنه با jailbreak از این دفاعها رد بشه و به اون دانش برسه.
روش GRAM (سرنام Gradient-Routed Auxiliary Modules) میخواد خود دانش رو کنترل کنه. کاری که میکنه اینه که به هر لایهی مدل چند نورون اضافی میذاره و اونها رو به گروههایی به اسم «ماژول» تقسیم میکنه، یکی برای هر دسته از دانش دومنظوره. موقع آموزش، وقتی مدل به متن یه دستهی دومنظوره مثل ویروسشناسی میرسه، فقط ماژول همون دسته اجازهی یادگیری داره و بقیهی وزنهای عمومی موقتاً قفل میشن.
نتیجهش اینه که دانش ویروسشناسی بهجای پخششدن تو کل شبکه، توی همون ماژول جمع میشه. بعد از آموزش میشه اون ماژول رو کلاً پاک کرد تا اون توانایی هم بره، یا برای استقرارهای مورد اعتماد سرجاش نگهش داشت. تو آزمایشها چهار دستهی دومنظوره تعریف شده بود، برای همین یه بار آموزش یه مدلی داد که میشه ۱۶ جور مختلف (روشن یا خاموش برای هر دسته) پیکربندیش کرد.
به گفتهی نویسنده، GRAM تو سه آزمایش با واقعگرایی فزاینده تست شد. توی یه آزمایش بزرگتر روی ترکیبی از متن وب، کد و مقالههای علمی با چهار حوزهی ویروسشناسی، امنیت سایبری، فیزیک هستهای و یه زبان برنامهنویسی خاص، حذف یه ماژول اون توانایی رو تقریباً مثل اینکه اصلاً روی اون داده آموزش ندیده باشه پاک کرد، اونهم بدون اینکه عملکرد عمومی مدل افت کنه.
نکتهی مهم اینه که وقتی یه مهاجم سعی کرد با کمی دادهی مخرب دانش پاکشده رو برگردونه، GRAM تقریباً بهخوبی روش فیلترکردن داده مقاومت کرد؛ درحالیکه روش «فراموشی» (unlearning) بعد از آموزش فقط دانش رو سرکوب میکرد و راحت با کمی fine-tuning برمیگشت. البته نویسنده تأکید میکنه که این تحقیق هنوز اولیهست، روی هیچکدوم از مدلهای Claude اجرا نشده و توی مقیاس frontier یا خط تولید واقعی تست نشده.
نکات کلیدی:
- GRAM روشیه که دانش دومنظوره رو توی ماژولهای جدا و قابلحذف مدل نگه میداره
- موقع آموزش فقط ماژول همون دسته یاد میگیره و وزنهای عمومی قفل میشن
- با یه بار آموزش میشه یه مدل رو تا ۱۶ حالت روشن/خاموش پیکربندی کرد
- حذف ماژول توانایی رو پاک میکنه بدون افت عملکرد عمومی و جلوی برگشت دانش رو بهتر از unlearning میگیره
- تحقیق فعلاً اولیهست و روی مدلهای Claude پیاده نشده




