رفتار خوب در یک حوزه، به کلِ مدل سرایت میکنه
خلاصهٔ کاملتر
به گفتهٔ نویسندهها، هرچی سیستمهای هوش مصنوعی تو حوزههای پرمخاطره مثل سلامت، علم و کدنویسی توانمندتر و خودمختارتر میشن، باید تو موقعیتهای دیدهنشده هم مفید، صادق و امن بمونن. پژوهشهای قبلی نشون داده «ناهمترازی» میتونه تعمیم پیدا کنه — مدلی که یاد میگیره کدِ ناامن بنویسه، تو کارهای کاملاً بیربط هم بد رفتار میکنه. این مقاله سؤالِ برعکس رو میپرسه: آیا آموزشِ رفتارِ خوب هم همینجوری سرایت میکنه؟
برای جواب، تیم یه دیتاستِ مصنوعی از گفتوگوهای واقعگرایانه ساخته که صفاتی مثل صداقت، فروتنیِ معرفتی، شفافیتِ فراشناختی (توانِ توضیحِ روندِ فکر)، اصلاحپذیری، انصافِ همگانی و توجه به رفاهِ انسان رو زیرِ فشار و ابهام و انگیزههای رقیب میسنجه. این سناریوها حوزههایی مثل سلامت، آموزش، علم، حقوق، مهندسی و اقتصاد رو پوشش میدن.
بعد یه مدل رو با مقدارِ کمی از این دیتای صفاتِ مفید، قاطیِ یه ترکیبِ استانداردِ post-training آموزش دادن. نتیجه این شد که مدل نهفقط تو خودِ این صفات بهتر شد، بلکه تو ۴۴ تا از ۵۳ بنچمارکِ داخلی و خارجی — که deception، reward hacking، توصیهٔ مضر و رعایتِ specification رو میسنجن و اصلاً تو آموزش نبودن — از مدلِ پایه بهتر عمل کرد. یعنی آموزش رو این صفات، رفتارِ کلیِ مدل رو جابهجا کرد.
به گفتهٔ نویسندهها، غافلگیرکنندهترین بخش این بود: وقتی مدل رو فقط تو یه حوزه — سلامت — روی رفتارِ خوب آموزش دادن، این تمایلاتِ خوب به حوزههای دیگه هم تعمیم پیدا کرد و تو ارزیابیهای غیرِسلامتی مثل reward hacking و فریب هم بهتر شد. این دقیقاً قرینهٔ یافتهٔ قبلیشونه که آموزش رو دیتای بدِ سلامت، به ناهمترازیِ گسترده منجر میشد.
بخشِ دومِ مهم، پایداریِ این بهبود زیرِ فشاره. تیم با پرامپتهای خصمانه (persona prompts) سعی کرد مدل رو به سمتِ رفتارِ مضر هل بده؛ مدلِ آموزشدیده با این صفات، خیلی بهتر مقاومت کرد. نکتهٔ مهم اینه که مدل بهطور کلی کمهدایتپذیر نشد — به دستورهای مشروع و نقشهای تخصصی همچنان جواب میداد — بلکه «پایداریِ گزینشی» داشت: به سمتِ خوب هدایتپذیر میموند ولی به سمتِ فریب و توصیهٔ مضر سختتر کشیده میشد.
حتی در برابرِ فاینتیونِ مخرب هم مقاومتر بود: وقتی هر دو مدل رو با همون دیتا فاینتیون کردن تا توصیهٔ پزشکیِ غلط بدن، مدلِ پایه هم تو سلامت و هم تو ارزیابیهای غیرِسلامتی بهشدت افت کرد، ولی مدلِ آموزشدیده خیلی بیشتر مقاومت کرد — بهویژه تو حوزههای غیرِسلامتی. نویسندهها این رو یه اثباتِ مفهومِ اولیه میدونن که RL روی صفاتِ مفید میتونه رفتارِ خوبِ گسترده، تعمیمپذیر و پایدار بسازه، هرچند میگن هنوز کارِ بیشتری لازمه.
نکات کلیدی:
- آموزش با RL روی صفاتِ مفید (صداقت، شفافیت، اصلاحپذیری) رفتارِ خوبِ مدل رو در دهها بنچمارک بهتر کرد.
- این بهبود به حوزهها و تسکهای خارج از دادهٔ آموزش هم تعمیم پیدا کرد (۴۴ از ۵۳ بنچمارک).
- آموزش فقط تو حوزهٔ سلامت، به رفتارهای خوب تو حوزههای دیگه سرایت کرد.
- بهبودها زیرِ پرامپتهای خصمانه و فاینتیونِ مخرب هم پایدار موندن.
- مدل «پایداریِ گزینشی» داشت: به سمتِ خوب هدایتپذیر، ولی به سمتِ مضر مقاوم.




