Qwen-Image-2.0: مدل جدید علیبابا برای تولید و ویرایش تصویر
خلاصهٔ کاملتر
تیم Qwen در علیبابا مدل Qwen-Image-2.0 رو توی یه گزارش فنی روی arXiv معرفی کرد. این مدل یه سیستم «همهکاره» برای تولید تصویره که قراره شکاف بین ساخت تصویر و ویرایش اون رو پر کنه — یعنی هر دو قابلیت توی یه معماری واحد ادغام شدن.
مشکلی که مدلهای قبلی داشتن اینه که با متنهای خیلی طولانی، تایپوگرافی چندزبانه، و صحنههای ترکیبی پیچیده کنار نمیاومدن. Qwen-Image-2.0 سعی کرده این ضعفها رو برطرف کنه، خصوصاً در محتوای متنمحور مثل اسلایدها، پوسترها، اینفوگرافیکها و کمیکها.
از نظر معماری، این مدل Qwen3-VL (مدل زبانی-بصری چندوجهی علیبابا) رو به عنوان condition encoder به کار میبره. یعنی ابتدا پرامپت متنی رو عمیقاً درک میکنه، بعد این درک رو به یه Multimodal Diffusion Transformer (نوعی معماری مبتنی بر نویززدایی تکراری) پاس میده تا تصویر نهایی تولید بشه. این ترکیب بهش اجازه میده هم درک قوی از دستورالعملهای پیچیده داشته باشه، هم انعطاف کافی در تولید و ویرایش.
یکی از ویژگیهای بارز Qwen-Image-2.0 اینه که میتونه پرامپتهایی تا ۱۰۰۰ توکن رو پردازش کنه — یعنی میشه دستورالعملهای خیلی دقیق و مفصل بهش داد. این ظرفیت بالا کمک میکنه محتوای متنمحور مثل پوستر یا اینفوگرافیک با جزئیات کامل ساخته بشه.
در بخش کیفیت تصویر، مدل روی سه محور بهبود پیدا کرده: جزئیات غنیتر، بافتهای واقعیتر، و نورپردازی منسجم. همچنین ادعا میشه که پرامپتهای پیچیده رو در سبکهای متنوع بهتر از قبل دنبال میکنه. آموزش مدل هم با یه پایپلاین چندمرحلهای سفارشی و دادههای گزینششده در مقیاس بزرگ انجام شده.
نتایج ارزیابی انسانی نشون میده Qwen-Image-2.0 در هر دو حوزه تولید و ویرایش تصویر بهطور چشمگیری از نسل قبلی Qwen-Image بهتره. این مدل هنوز بهصورت عمومی منتشر نشده، ولی گزارش فنی کاملش روی arXiv در دسترسه.
نکات کلیدی:
- ادغام تولید و ویرایش تصویر در یه مدل واحد
- استفاده از Qwen3-VL به عنوان encoder برای درک عمیقتر دستورالعملها
- پشتیبانی از پرامپتهای تا ۱۰۰۰ توکن برای محتوای متنمحور
- بهبود تایپوگرافی چندزبانه و رندر متنهای طولانی
- پیشرفت قابلتوجه در فوتورئالیسم و نورپردازی واقعیتر




