Qwen3.8-27B OBLITERATED؛ نسخهای از Qwen که دیگه رد نمیکنه
خلاصهٔ کاملتر
OBLITERATUS یه نسخهٔ اصلاحشده از Qwen3.8-27B منتشر کرده به اسم OBLITERATED که با روش ابلیتریشن (یعنی جراحی مستقیم روی وزنهای مدل، بدون فاینتیون یا ترفندهای پرامپت) رفتار امتناع رو از مدل حذف میکنه. نسخهٔ V3، هم امتناعهای مستقیم («نمیتونم کمکت کنم») و هم نصیحتهای امنیتی نرمتر رو کنار گذاشته، در حالی که فقط ۲٫۱ درصد از دقت MMLU رو نسبت به مدل اصلی از دست داده. مدل با لایسنس Apache 2.0 و در قالبهای GGUF و safetensors عرضه شده.
به گفتهٔ تیم سازنده، رسیدن به این نتیجه سه مرحله طول کشیده. نسخهٔ V1 با یه پاس تهاجمی از SVD (روش تجزیهٔ ماتریسی برای پیدا کردن جهتهای امتناع تو فضای وزن) امتناعهای سخت رو حذف کرد ولی ۶ درصد از MMLU رو قربانی کرد. V2 با ترکیب SVD و LEACE (روشی ملایمتر که کمتر به توانایی مدل آسیب میزنه) به نسبت ۶۰ به ۴۰، تقریباً به سطح دقت مدل اصلی رسید ولی هنوز بعضی وقتا نصیحت امنیتی میداد. V3 با اصلاح تدریجی روی V2 و یه پاس هدفمند رو دستهبندیهایی که هنوز امتناع نرم داشتن، این مشکل رو هم حل کرد.
تو تست MMLU با ۵۷۰۰ سوال، مدل اصلی ۸۴٫۴۶ درصد گرفته و V3 به ۸۲٫۳۳ درصد رسیده؛ یعنی ۲٫۱۲ درصد افت. این افت یکنواخت نیست: بخش STEM (ریاضی و علوم پایه) ۳٫۳ درصد افت داشته، ولی علوم انسانی فقط ۱ درصد. جالبه که تو فلسفه و تاریخ اروپا، V3 حتی از مدل اصلی هم بهتر عمل کرده، هرچند با توجه به نمونهٔ فقط ۱۰۰ سوالی هر بخش، این میتونه صرفاً نویز آماری باشه. تو یه تست ۲۰ تایی کدنویسی و امنیت هم، V3 تو هر ۲۰ مورد کد کارکردنی تولید کرده.
مدل کارت خودش تنظیمات اجرای خاصی رو توصیه میکنه: دمای صفر (greedy decoding)، جریمهٔ تکرار ۱٫۱۵، و خاموش بودن حالت thinking برای مستقیمترین جوابها. بدون سیستمپرامپت هم بهتر جواب میده، چون طبق تستهای سازنده، سیستمپرامپت میتونه دوباره رفتار امتناع رو برگردونه. سازنده صراحتاً میگه این مدل برای محققهای امنیت، تیمهای ردتیم و کاربرای لوکالفرست ساخته شده، نه یه چتبات عمومی؛ چون دیگه لایهٔ قضاوت فاینتیونشدهای برای فیلتر کردن درخواستهای واقعاً مضر نداره و مسئولیتش کامل با کاربره.
نکات کلیدی:
- Qwen3.8-27B OBLITERATED V3 با ۲٫۱ درصد افت دقت MMLU (۸۲٫۳۳٪ در برابر ۸۴٫۴۶٪ مدل اصلی)، صفر درصد امتناع داره
- روش کار ترکیب دو تکنیک SVD و LEACE به اسم complementary abliteration blending هست
- افت دقت تو بخش STEM بیشتره (۳٫۳-)، در حالی که علوم انسانی فقط ۱- درصد افت داشته
- مدل با لایسنس Apache 2.0 و در فرمتهای GGUF (از ۱۱ تا ۲۷ گیگابایت) و safetensors (حدود ۵۴ گیگابایت) عرضه شده
- تنظیمات پیشنهادی: دمای صفر، جریمهٔ تکرار ۱٫۱۵، و بدون سیستمپرامپت




