NTM: تولید تصویر باکیفیت در فقط ۴ مرحله
خلاصهٔ کاملتر
مدلهای دیفیوژن (Diffusion Models) که امروز پشت ابزارهایی مثل Stable Diffusion قرار دارن، فرایند تولید تصویر رو به دهها یا حتی صدها مرحله کوچک تقسیم میکنن. هر مرحله یه کمی نویز گاوسی رو از تصویر پاک میکنه تا در نهایت به خروجی نهایی برسیم. مشکل اینجاست که وقتی بخوای تعداد این مراحل رو به شدت کاهش بدی — مثلاً به ۴ مرحله — این فرض پایهای مدل دیگه درست کار نمیکنه.
روشهای موجود برای سرعتبخشیدن به این فرایند، مثل distillation (آموزش یه مدل کوچکتر از روی مدل بزرگ)، consistency training، یا روشهای adversarial (مثل GAN)، هر کدام یه جنبه مهم رو قربانی میکنن: چارچوب احتمالاتی دقیق. یعنی دیگه نمیتونی بگی دقیقاً چقدر احتمال داره مدل این خروجی رو تولید کنه.
Normalizing Trajectory Models یا NTM یه رویکرد تازهست که هر گام برگشتی در فرایند نمونهبرداری رو بهجای یه تقریب ساده، بهعنوان یه Conditional Normalizing Flow (جریان نرمالساز شرطی) مدل میکنه. جریان نرمالساز یه ابزار ریاضیه که میتونه توزیعهای پیچیده رو با دقت کامل احتمالاتی نمایش بده — و اینجاست که NTM هم کیفیت و هم دقت رو با هم نگه میداره.
از نظر معماری، NTM دو بخش داره: بلوکهای invertible (وارونپذیر) سبک که درون هر گام کار میکنن، و یه پیشبین عمیق موازی که کل مسیر تولید رو با هم در نظر میگیره. این ترکیب هم از ابتدا قابل آموزشه و هم میشه اون رو از مدلهای flow-matching از پیشآموزشدیده مقداردهی اولیه کرد.
یکی از ویژگیهای جالب NTM اینه که احتمال دقیق مسیر، self-distillation رو ممکن میکنه: یه denoiser سبکوزن روی امتیازدهی خود مدل آموزش میبینه و میتونه در چهار گام نمونههای باکیفیت تولید کنه. در بنچمارکهای text-to-image، NTM با فقط ۴ مرحله نمونهبرداری با قویترین مدلهای موجود برابری میکنه یا از اونا جلو میزنه.
نکات کلیدی:
- مدلهای دیفیوژن در کاهش تعداد گامها دچار افت کیفیت یا از دست دادن چارچوب احتمالاتی میشن
- NTM هر گام برگشتی رو با Conditional Normalizing Flow مدل میکنه تا هر دو مشکل رو حل کنه
- معماری ترکیبی: بلوکهای invertible سبک + پیشبین عمیق موازی روی کل مسیر
- قابلیت self-distillation: تولید تصویر باکیفیت در فقط ۴ گام
- در بنچمارکهای text-to-image با بهترین روشهای موجود رقابت میکنه




