Mage؛ خانوادهٔ مدلهای چندوجهی سبک مایکروسافت
خلاصهٔ کاملتر
تیم Mage در مایکروسافت خانوادهای از مدلهای چندوجهی (multimodal) رو منتشر کرده که همهشون روی یه بودجهٔ ثابت ۴ میلیارد پارامتر ساخته شدن. به گفتهٔ تیم، هدف اینه که کار روی درک و تولید تصویر برای آزمایشهای کنترلشده، پژوهش روی post-training و کاربردهای تخصصی، با سختافزار و بودجهٔ محاسباتی واقعبینانه شدنی بشه.
ایدهٔ مشترک بین اعضای خانواده چیزیه که خودشون بهش میگن codec-aligned efficiency؛ یعنی ظرفیت بازنمایی رو همونجایی خرج کن که سیگنال واقعی هست. همین ایده هم سمت درک تصویر اعمال شده هم سمت تولیدش. کل پروژه هم زیر لایسنس MIT منتشر شده.
عضوی که همین حالا در دسترسه، Mage-Flow هست: یه استک تولیدی ۴ میلیاردی برای تولید تصویر از متن و ویرایش تصویر با دستور متنی. دو تیکهٔ اصلیش Mage-VAE (یه توکنایزر latent سبک) و یه Diffusion Transformer چندوجهی با رزولوشن بومیه که با rectified flow matching آموزش دیده. هر تسک هم سه نسخه داره: Base، نسخهٔ RL-aligned و نسخهٔ Turbo چهارمرحلهای.
عددهایی که تیم گزارش کرده جالبن. Mage-VAE همون کیفیت بازسازی FLUX.2-VAE رو میده ولی حدود ۱۲ برابر کمتر محاسبات برای encode و حدود ۲۲ برابر کمتر برای decode لازم داره؛ یعنی گلوگاه VAE توی رزولوشن بالا برداشته میشه. یه چکپوینت هم از ۵۱۲ تا ۲۰۴۸ و روی هر نسبت تصویری کار میکنه، حتی نسبتهای خیلی کشیده مثل ۴:۱.
سمت سرعت هم packing رزولوشن بومی بههمراه کرنلهای fused CUDA زمان هر گام آموزش رو از حدود ۱٫۹۳ ثانیه به حدود ۰٫۷۸ ثانیه رسونده، یعنی نزدیک ۲٫۵ برابر آموزش سریعتر. موقع استفاده هم روی یه A100 و در اندازهٔ ۱۰۲۴×۱۰۲۴، نسخهٔ Turbo هر تصویر رو در ۰٫۵۹ ثانیه و نسخهٔ ویرایش Turbo هر ویرایش رو در ۱٫۰۲ ثانیه تحویل میده.
عضو دوم خانواده، Mage-VL هست؛ یه مدل پایهٔ زبانی-تصویری codec-native که از صفر و در همون مقیاس ۴ میلیاردی آموزش دیده و قراره علاوه بر درک تصویر و ویدیو، حالت proactive streaming هم داشته باشه. فعلاً کد و چکپوینتهاش بیرون نیومده و تیم گفته بهزودی منتشرشون میکنه.
یه نکتهٔ مهم هم توی بخش Responsible AI اومده: این مدلها فقط برای پژوهش منتشر شدن و برای محصول یا سرویس واقعی در نظر گرفته نشدن. چون دیتای آموزش تا حد زیادی از وب جمع شده، ممکنه خروجیها سوگیری داشته باشن یا نادرست باشن، و تیم توصیه کرده استفادهکنندهها خودشون لایههای اعتبارسنجی و مدیریت محتوا اضافه کنن.
نکات کلیدی:
- خانوادهٔ Mage از مایکروسافت، همه با بودجهٔ ثابت ۴ میلیارد پارامتر
- Mage-Flow برای تولید تصویر از متن و ویرایش دستوری، در سه نسخهٔ Base و RL-aligned و Turbo
- توکنایزر Mage-VAE با حدود ۱۲ برابر محاسبات کمتر در encode و ۲۲ برابر کمتر در decode
- یه چکپوینت برای رزولوشن ۵۱۲ تا ۲۰۴۸ و هر نسبت تصویری، حتی ۴:۱
- ۲٫۵ برابر آموزش سریعتر و ۰٫۵۹ ثانیه برای هر تصویر روی یه A100
- Mage-VL برای درک تصویر و ویدیو هنوز منتشر نشده
- لایسنس MIT، ولی فقط برای کاربرد پژوهشی




