DFlash 2: ترفندی که سرعت Qwen رو تقریبا دو برابر میکنه
خلاصهٔ کاملتر
تیم تحقیقاتی z-lab یه تکنیک جدید به اسم DFlash 2 ساخته که رو مدل Qwen3.8-27B سوار میشه و سرعت تولید توکن رو تقریبا دو برابر میکنه، بدون اینکه کیفیت خروجی مدل عوض بشه. این روش نیازی به آموزش دوباره یا تغییر معماری مدل اصلی نداره و بهعنوان چکپوینت z-lab/Qwen3.8-27B-DFlash2 روی Hugging Face با لایسنس Apache 2.0 منتشر شده. جالبه که فاصلهٔ کوتاهی بعد از انتشار مدل بازوزن Qwen3.8-27B توسط علیبابا، جامعهٔ متنباز همین مدل رو کوانتایز، تقطیر و حالا با این روش هم سریعتر کرده.
روش پشت این کار speculative decodingه (یعنی بهجای اینکه مدل بزرگ تکتک توکنها رو تولید کنه، یه مدل کوچیکتر چند تا توکن رو جلوتر حدس میزنه و مدل اصلی همهشونو توی یه پاس تایید میکنه). اگه حدسها درست باشن، چند تا توکن رو با هزینهٔ یه پاس تایید میگیری؛ اگه غلط باشن، فقط همون قسمت دور ریخته میشه و بقیه نگه داشته میشه. یعنی این معامله تقریبا همیشه به نفع سرعته.
نکتهٔ متفاوت DFlash 2 اینه که بهجای حدس زدن توکنها یکییکی، همهٔ موقعیتهای پیشنویس رو همزمان پیشبینی میکنه. تیم سازنده متوجه شده حتی وقتی حدس اول غلطه، توکن درست تقریبا همیشه (حدود ۹۹٪ مواقع) بین ۱۶ گزینهٔ برتر هست؛ برای همین این ۱۶ گزینه رو نگه میداره و یه path selector سبک، بهترین مسیر بینشون رو پیدا میکنه. یه لایهٔ کانولوشن کوچیک هم به هر موقعیت زمینهٔ موقعیت قبلی رو میده بدون اینکه موازی بودن کار خراب بشه؛ نتیجهش حدود یه توکن تاییدشدهٔ اضافه توی هر پاس، با فقط حدود ۱٪ سربار تاخیر.
توی تست روی یه GPU از نوع Nvidia A100، حالت عادی SGLang روی Qwen3.8-27B میانگین حدود ۲۸.۹ توکن در ثانیه میداد؛ با DFlash 2 همون پرامپتها به حدود ۵۹.۱ توکن در ثانیه رسیدن (کمی بیشتر از دو برابر)، و یکی از پرامپتها حتی به ۷۲ توکن در ثانیه رسیده. کل ستآپ حدود ۷۷ گیگابایت VRAM مصرف کرده که با کم کردن اندازهٔ کش KV میشه کمترش کرد. نصب فعلا از یه برنچ خاص SGLang انجام میشه؛ پشتیبانی vLLM و llama.cpp هم در حال توسعهست.
نکات کلیدی:
- سرعت تولید توکن روی A100 از حدود ۲۸.۹ به حدود ۵۹.۱ توکن در ثانیه رسیده (نزدیک به ۲ برابر)
- مصرف VRAM کل ستآپ حدود ۷۷ گیگابایته، قابل کم شدن با تنظیم کش KV
- سربار تاخیر اضافهشده فقط حدود ۱٪ هست
- مدل با لایسنس Apache 2.0 روی Hugging Face با نام z-lab/Qwen3.8-27B-DFlash2 منتشر شده
- نصب فعلا فقط از یه برنچ خاص SGLang ممکنه؛ پشتیبانی vLLM و llama.cpp در حال توسعهست




