Escha-W2: مدلی ۲۷ میلیاردی که رو یه GPU خونگی جا میشه
خلاصهٔ کاملتر
تیم Escha Labs یه نسخه فشردهشده از مدل Qwen3.8-27B رو با اسم Escha-W2 منتشر کرده که با کوانتایز ۲بیتی (میانگین ۲.۴۶۹ بیت به ازای هر پارامتر) حجم وزنهاش رو به حدود ۱۰.۱۵ گیگابایت رسونده. طبق گفتهی سازنده این یعنی کل مدل ۲۷میلیاردپارامتری بههمراه کش KV و یه پنجره کانتکست ۶۴هزار توکنی، رو یه GPU خونگی ۲۴ گیگی مثل RTX 3090 یا 4090 جا میشه، و با یه تنظیم خاص حتی تا ۱۲۸هزار توکن کانتکست هم میره بالا.
دلیل این صرفهجویی حافظه یه معماری هیبریده: از ۶۴ لایهی مدل فقط ۱۶ تاش attention کامل دارن، بقیه لایههای gated-delta-net هستن که یه حافظهی بازگشتی ثابت (حدود ۰.۱۵ گیگابایت بهازای هر استریم) نگه میدارن. نتیجهش اینه که کش KV فقط ۶۴ کیلوبایت بهازای هر توکن هزینه داره، یعنی حدود یهچهارم چیزی که یه مدل ۲۷B معمولی با attention کامل روی همهی لایهها لازم داره.
اجراش نیاز به یه رانتایم اختصاصی به اسم escha-runtime-qwen3dense داره که یه فورک سفارشی از SGLangه؛ نصب SGLang معمولی از PyPI کنارش باعث تداخل میشه. سه تا پارامتر اصلی هم برای تیون کردن سرور هستن: MEM (سهم VRAM از کل حافظه)، CTXLEN (سقف کانتکست) و MAMBA_RATIO (حافظهی رزروشده برای حالت بازگشتی)، که بههم وابستهن؛ مثلاً بالا بردن CTXLEN بدون بالا بردن MEM میتونه باعث بشه سرور بدون خطا بالا بیاد ولی پرامپتهای بلند رو بیسروصدا کوتاه کنه.
از نظر سرعت، روی یه RTX 4090 حالت تککاربره حدود ۶۷ توکن در ثانیه میده و حالت بهینهشده برای همزمانی با ۱۶ استریم به حدود ۶۴۹ توکن در ثانیه میرسه. یه نکتهی دیگه اینه که prefix caching (RADIX=1) فقط وقتی کمک میکنه که یه پرامپت عین همون قبلی تکرار بشه، نه تو مکالمههای agentic که هر بار چیزی به کانتکست اضافه میشه؛ تو تستها یه پرامپت تکراری از ۶۶.۵ ثانیه به ۱.۴ ثانیه رسید، ولی پرامپتی که فقط ۴هزار توکن آخرش با قبلی فرق داشت، هیچ صرفهجوییای نداشت و کل ۶۵.۷ ثانیه طول کشید.
نکات کلیدی:
- وزنهای Escha-W2 حدود ۱۰.۱۵ گیگابایته و رو GPU ۲۴گیگی مثل RTX 3090/4090 اجرا میشه.
- MEM=0.72 یعنی کانتکست ۶۴هزار توکنی با ۱۸.۳GB VRAM؛ MEM=0.88 و CTXLEN=131072 یعنی ۱۲۸هزار توکن با ۲۱.۸GB.
- رانتایم لازم escha-runtime-qwen3denseه، نه SGLang معمولی.
- سرعت روی RTX 4090: تککاربره ~۶۷ توکن بر ثانیه، چندجریانی تا ۶۴۹ توکن بر ثانیه.
- prefix caching فقط تو تکرار دقیق پرامپت کمک میکنه، نه تو agent loopهای طولانی.




