DigitalOcean سریعترین اینفرنس DeepSeek V3.2 رو ارائه داد
خلاصهٔ کاملتر
DigitalOcean در رویداد سالانه Deploy خودش از عرضه عمومی سه مدل زبانی بزرگ DeepSeek V3.2، MiniMax-M2.5 و Qwen 3.5 397B روی سرویس Serverless Inference پرده برداشت. نکته جالب اینه که طبق بنچمارکهای Artificial Analysis، این پلتفرم در سرعت خروجی برای دو مدل DeepSeek V3.2 و Qwen 3.5 397B رتبه اول بین تمام ارائهدهندههای تستشده رو کسب کرده.
اما چرا سرعت اینفرنس اینقدر مهمه؟ تیم مهندسی DigitalOcean معتقده که تمرکز اصلی توسعه هوش مصنوعی دیگه از آموزش مدلها به سمت کارایی اینفرنس جابجا شده. در اپلیکیشنهای مدرن مثل ایجنتهای هوشمند، کوپایلتها و سیستمهای real-time، یه تاخیر کوچیک میتونه مجموعهای از چند ده فراخوانی متوالی مدل رو به یه تجربه کند و آزاردهنده تبدیل کنه. پس سرعت دیگه فقط یه معیار فنیه؛ مستقیماً روی تجربه کاربر تاثیر میذاره.
در بنچمارکهای DeepSeek V3.2 با ۱۰ هزار توکن ورودی، سرعت خروجی به ۲۳۰ توکن در ثانیه رسیده که ۳.۹ برابر AWS Bedrock با ۵۹ توکن در ثانیهست. زمان دریافت اولین توکن (TTFT) هم ۰.۹۶ ثانیهست و فقط Google Vertex در این معیار از DigitalOcean جلوتره. در نمودار ترکیبی latency در برابر سرعت خروجی هم DigitalOcean یکی از سه ارائهدهندهایه که در مطلوبترین ربع قرار میگیره.
پایه سختافزاری این موفقیت GPUهای NVIDIA HGX B300 هستن که بر اساس معماری Blackwell Ultra ساخته شدن. این GPUها ۲۸۸ گیگابایت حافظه HBM3e دارن که ۵۰ درصد بیشتر از نسل B200ه، و قدرت محاسباتی NVFP4 اونها هم ۱.۵ برابر بیشتره. البته DigitalOcean توضیح میده که در ابتدای استقرار در محیطهای مجازیسازیشده با افت ۲۵ درصدی عملکرد روبرو شدن و با همکاری مستقیم تیم NVIDIA این مشکل رفع شد.
در لایه کوانتیزیشن، از فرمت NVFP4 (یه فرمت ممیز شناور ۴ بیتی تخصصی) استفاده شده که حافظه مورد نیاز رو حدود ۱.۸ برابر نسبت به FP8 کاهش میده و توان عملیاتی اینفرنس رو بالا میبره. مهمتر اینکه این کوانتیزیشن روی معماری Blackwell Ultra که پشتیبانی بومی از NVFP4 داره، عملاً بدون افت محسوس در دقت مدل انجام میشه.
در لایه نرمافزاری هم بهینهسازیهای جدی روی فریمورک متنباز vLLM انجام شده. Tensor Parallelism برای توزیع مدل روی چند GPU (در قالب TP4 یا TP8) استفاده شده. Kernel Fusion چند عملیات رو در یک kernel GPU ادغام میکنه و سربار پردازشی رو کم میکنه. Programmatic Dependent Launch هم اجرای موازی kernelها رو ممکن میکنه که برای workloadهای تعاملی با latency پایین حدود ۱۰ درصد بهبود میده.
یکی از جالبترین بخشهای این پست تکنیک Speculative Decoding با Multi-Token Predictionه. در این روش، یه مدل کوچکتر (draft model) توکنهای بعدی رو پیشبینی میکنه و مدل اصلی بزرگتر این پیشبینیها رو در یه forward pass واحد تایید میکنه؛ نتیجهش افزایش چشمگیر throughput بدون افت کیفیت خروجیه. برای MiniMax-M2.5 هم یه مدل EAGLE3 با استفاده از ابزار TorchSpec آموزش داده شده تا همین تکنیک اعمال بشه.
نکات کلیدی:
- DigitalOcean رتبه اول سرعت خروجی برای DeepSeek V3.2 و Qwen 3.5 397B بین ارائهدهندههای تستشده توسط Artificial Analysis رو کسب کرده
- سرعت ۲۳۰ توکن در ثانیه و TTFT زیر یک ثانیه برای DeepSeek V3.2 با ۱۰ هزار توکن ورودی
- GPU پایه: NVIDIA HGX B300 با معماری Blackwell Ultra و ۲۸۸ گیگابایت HBM3e
- کوانتیزیشن NVFP4 حافظه مصرفی رو ۱.۸ برابر نسبت به FP8 کاهش میده
- بهینهسازیهای vLLM شامل Tensor Parallelism، Kernel Fusion و Speculative Decoding
- همکاری مستقیم با NVIDIA برای حل مشکل افت عملکرد در محیطهای مجازیسازیشده




