ds4.c: موتور استنتاج بومی برای DeepSeek V4 Flash
خلاصهٔ کاملتر
ds4.c یه موتور استنتاج native و فوقالعاده متمرکز برای مدل DeepSeek V4 Flash هست. برخلاف پروژههایی مثل llama.cpp که سعی میکنن همهچیز رو پشتیبانی کنن، این پروژه عمداً محدود طراحی شده: فقط یه مدل، فقط Metal، و فقط با فایلهای GGUF اختصاصی خودش کار میکنه.
چرا DeepSeek V4 Flash اینقدر جالبه؟ اول اینکه به خاطر معماری MoE (Mixture of Experts)، پارامترهای کمتری در هر مرحله فعاله، پس سریعتره. دوم اینکه در حالت thinking، بخش فکری مدل خیلی کوتاهتره — گاهی تا ۱/۵ مدلهای دیگه — و مهمتر اینکه طول بخش thinking متناسب با پیچیدگی سؤاله. سوم اینکه پنجره کانتکست این مدل یه میلیون توکن هست.
یکی از ایدههای اصلی پروژه اینه که KV cache فشرده DeepSeek V4 در ترکیب با SSD سریع مکهای مدرن، این امکان رو میده که KV cache رو روی دیسک نگه داری نه فقط در RAM. این یعنی inference طولانیمدت روی کامپیوترهای شخصی واقعاً عملیه.
کوانتیزاسیون ۲ بیتی ارائهشده هم شوخی نیست. فقط routed MoE experts کوانتیز میشن (لایههای up/gate با IQ2_XXS و down با Q2_K)، در حالی که بقیه اجزا مثل shared experts و projections و routing دستنخورده میمونن. نتیجه اینه که مدل ۲۸۴ میلیاردی روی MacBook با ۱۲۸ گیگ RAM اجرا میشه.
از نظر سرعت، در تستهای انجامشده روی MacBook Pro M3 Max با ۱۲۸ گیگ، نرخ تولید توکن با کوانت q2 حدود ۲۶ توکن در ثانیه هست و prefill برای prompt کوتاه به ۵۸ توکن در ثانیه میرسه. روی Mac Studio M3 Ultra با ۵۱۲ گیگ، این اعداد به ترتیب به ۳۶ و ۸۴ توکن در ثانیه میرسن. برای اجرای یه prompt ساده کافیه بنویسی:
./ds4 -p "Explain Redis streams in one paragraph."پروژه از نظر فنی Metal-only هست و مسیر CPU فقط برای بررسی صحت وجود داره. توسعهدهندگان هم صادقانه اعلام کردن که این پروژه با کمک قابلتوجه GPT 5.5 توسعه یافته و هنوز در مرحله آلفاست. همچنین این پروژه بدون llama.cpp و GGML وجود نداشت و سازندگان به صراحت این موضوع رو در acknowledgements ذکر کردن.
نکات کلیدی:
- ds4.c یه موتور استنتاج اختصاصی Metal برای DeepSeek V4 Flash هست، نه یه GGUF runner عمومی
- KV cache میتونه روی دیسک ذخیره بشه، نه فقط در RAM — این یه تحول مفهومیه
- کوانت ۲ بیتی هوشمندانه طراحی شده: فقط MoE experts کوانتیز میشن تا کیفیت حفظ بشه
- مدل روی MacBook با ۱۲۸ گیگ (q2) و مکهای ۲۵۶ گیگ به بالا (q4) قابل اجراست
- پنجره کانتکست یه میلیون توکن و thinking متناسب با پیچیدگی، این مدل رو از رقبا متمایز میکنه
- پروژه هنوز در مرحله آلفاست و CPU path به خاطر باگ macOS ممکنه کرنل رو کرش بده




