Qwen3.8-27B یه نسخهٔ بدون فیلتر پیدا کرد
خلاصهٔ کاملتر
Qwen3.8-27B-OBLITERATED یه نسخهٔ «ابلیتهشده» از مدل Qwen3.8-27B شرکت علیباباست که یه محقق به اسم OBLITERATUS ساخته. ابلیتریشن یعنی بهجای فاینتیون کردن مدل، اون جهت داخلیای که مدل برای رد کردن درخواستهای حساس ازش استفاده میکنه رو تو فضای وزنها پیدا میکنن و حذفش میکنن. نسخهٔ سوم (V3) این پروژه مدعیه هم امتناعهای صریح («نمیتونم کمکت کنم») و هم نسخههای نرمتر یعنی نصیحتهای ایمنیِ بیمحتوا رو حذف کرده، اونم با از دست دادن فقط ۲.۱ واحد درصد از دقت MMLU نسبت به مدل اصلی.
پروژه از V1 تا V3 دنبال حل یه بدهبستان بوده: هرچی امتناع رو بیشتر حذف کنی، مدل ممکنه دقتش رو بیشتر از دست بده. V1 با یه عمل جراحی SVD یهباره امتناعها رو کامل حذف کرد ولی ۶ واحد درصد از MMLU رو گرفت، افت زیادی برای یه مدل ۲۷میلیاردی. V2 با ترکیب دو روش SVD و LEACE که هرکدوم یهجور ضعف دارن و مکمل هم میشن، با نسبت ۶۰ به ۴۰ دقتو تقریباً به سطح مدل اصلی برگردوند، ولی هنوز بعضی جوابها بهجای امتناع، نصیحت ایمنی میدادن.
V3 با تکرار مرحلهبهمرحلهٔ همین جراحی روی بهترین نسخهٔ قبلی، بهجای شروع دوباره از مدل اصلی، و یه مجموعهٔ پرامپت هدفمند برای پیدا کردن جهتهای امتناعِ باقیمونده، این نصیحتهای نرم رو هم حذف کرده. نتیجهٔ نهایی، طبق ادعای سازنده، صفر امتناع صریح و صفر نصیحت ایمنیه.
طبق نتایج lm-eval-harness، مدل اصلی ۸۴.۵ درصد MMLU میگیره؛ V1 به ۸۱.۴ درصد افت کرده، V2 به ۸۴.۳ درصد برگشته و V3 رو ۸۲.۳ درصد ایستاده. این افت یکسان توزیع نشده: دروس STEM بیشترین ضربه رو خورده (۳.۳ واحد درصد افت)، در حالی که علوم انسانی تقریباً دستنخورده مونده و بعضی درسها مثل فلسفه حتی نمرهشون بالاتر رفته. توضیح دادهشده اینه که جهتهای امتناع تا حدی با مسیرهای استدلال ساختاریافته همپوشانی دارن، برای همین درسهای منطقی حساسترن.
سازندهها بیش از ۱۰۰۰ پرامپت رو دستی بررسی کردن، نه با ابزار خودکار تشخیص امتناع، چون این ابزارها معمولاً پاسخهای نصیحتگونه رو تشخیص نمیدن. تو ۲۰ تا پرامپت کدنویسی و امنیت، مدل هر ۲۰ تا رو با پیادهسازی واقعی جواب داده، و تو ۸ تا تسک پیشرفتهٔ دنیای واقعی هم ۷ تا رو مثل مدل اصلی درست جواب داده. مدل بهعنوان ابزار پژوهشیه، برای محققهای همسویی و تیمهای red team، نه کاربر عادی؛ با فرمتهای GGUF از حدود ۱۱ تا ۲۷ گیگابایت و نسخهٔ کامل bfloat16 حدود ۵۴ گیگابایت هم منتشر شده.
نکات کلیدی:
- V3 با تکنیک ترکیبی SVD و LEACE و تکرار مرحلهای، هم امتناع صریح و هم نصیحت ایمنی رو حذف کرده
- افت دقت MMLU نسبت به مدل اصلی فقط ۲.۱ واحد درصده (۸۲.۳ درصد در برابر ۸۴.۵ درصد)
- بیشترین افت دقت مال دروس STEM و منطق رسمیه، نه علوم انسانی
- سازنده تنظیمات temperature صفر و repetition penalty ۱.۱۵ رو برای بهترین خروجی توصیه کرده
- مدل با فرمتهای GGUF از ۱۱ تا ۲۷ گیگابایت و نسخهٔ کامل ۵۴ گیگابایتی در دسترسه




