Shieldstral؛ نگهبان ۳ میلیاردی و متنبازِ میسترال
خلاصهٔ کاملتر
میسترال از Shieldstral رونمایی کرده؛ یه مدل نگهبان (guardrail) ۳ میلیارد پارامتری با وزنهای باز و لایسنس Apache 2.0 که هم متن رو ارزیابی میکنه هم تصویر. به گفتهٔ میسترال مشکل مدلهای نگهبانِ فعلی اینه که یه تاکسونومی ثابت از دستههای آسیب رو توی وزنهاشون پختهن، پس عوضکردن کاربردشون یعنی آموزش دوباره. در حالی که یه محتوای واحد میتونه تو ابزار تحقیقات امنیتی بیمشکل باشه و تو یه پلتفرم سلامت روان مضر.
راهحل اینه که تعدیل محتوا به یه مسئلهٔ پرسشوپاسخ دوگزینهای تبدیل شده. هر درخواست سه بخش داره: بخش Instruct برای زمینه و میزان سختگیری ارزیابی، بخش Query برای یه سؤال بله/خیر مثل «آیا این محتوا خشونت فیزیکی رو ترویج میکنه؟» و بخش Document برای خود محتوا — پرامپت، پاسخ مدل، جفت پرامپت-پاسخ یا یه تصویر. مدل موقع اجرا فقط لاجیتهای yes و no رو میخونه و با softmax تبدیلشون میکنه به یه نمرهٔ پیوسته.
همین قالب ساده چند کار رو یکی میکنه: دستهبندی پرامپت، تعدیل پاسخ، تشخیص ردکردن درخواست (refusal) و تشخیص محتوای سمی. چون سیاست کامل توی پرامپت زندگی میکنه، یه چکپوینت واحد با سیاستهای تازهای که موقع استقرار تعریف میشن هم کنار میاد. خروجی هم بهجای یه برچسب گسسته، یه احتمال کالیبرهست؛ پس میشه روش آستانه گذاشت یا بر اساس اطمینان رتبهبندی کرد.
به گفتهٔ تیم میسترال، رمز کار دادهست نه اندازه. اونها دیتاستهای عمومی با تاکسونومیهای ناهمگون رو به یه قالب واحد برگردوندن و عبارتبندی سؤالها رو مدام عوض کردن تا مدل به یه سبک نوشتار عادت نکنه. بعد جفتهای متضاد ساختن — متنهایی که عمداً یه سیاست رو نقض میکنن ولی سیاستِ خیلی شبیهش رو نه — تا مدل مرز دقیق هر سیاست رو یاد بگیره، نه حفظکردن یه مشت برچسب ثابت.
برای تصویر که دادهٔ ناامنش کمیابه و مثل متن نمیشه ساختش، از دیتاستهای عمومی بهعنوان نمونهٔ منفی استفاده کردن و هر جفت تصویر-سؤال رو از یه ریرنکر بینایی-زبانی رد کردن تا برچسب غلط کم بشه. آموزش با LoRA بوده و چند چکپوینت مکمل با SLERP ادغام شدن. میسترال میگه قدمهای بعدی پوشش چندزبانه، مقاومت روی سندهای بلندتر و ایمنی چندوجهی گستردهتره.
نکات کلیدی:
- طبقهبند ایمنی ۳ میلیارد پارامتری با وزنهای باز و لایسنس Apache 2.0
- سیاست به زبان ساده و موقع اجرا داده میشه، بدون نیاز به آموزش دوباره
- یه رابط واحد برای متن، تصویر و ترکیب متن و تصویر
- خروجی یه نمرهٔ پیوستهٔ کالیبرهست، نه برچسب بله/خیر خشک
- روی یه GPU ۱۶ گیگابایتی اجرا میشه و به گفتهٔ میسترال با مدلهای تا ۷ برابر بزرگتر رقابت میکنه




