TokenSpeed: موتور اینفرنس بهینه برای عصر کدنویسی هوش مصنوعی
خلاصهٔ کاملتر
با رشد انفجاری ابزارهای کدنویسی مبتنی بر هوش مصنوعی مثل Claude Code، Codex و Cursor، حجم توکنهایی که باید پردازش بشن به شکل چشمگیری بالا رفته. این رشد به قدری جدیه که دیتاسنترهایی با دهها گیگاوات مصرف برق داره ساخته میشه. در این شرایط، بهینهسازی موتورهای اینفرنس دیگه یه انتخاب نیست — یه ضرورته.
TokenSpeed یه موتور اینفرنس اپنسورسه که از صفر برای بارکاریهای agentic طراحی شده. یعنی همون سناریوهایی که context بیشتر از ۵۰ هزار توکنه، مکالمات دهها ترن طول میکشن و کاربر انتظار داره جواب سریع بگیره. هدف اصلی TokenSpeed اینه که TPM/GPU (توکن در دقیقه به ازای هر GPU) رو به حداکثر برسونه، در حالی که یه کف سرعت برای هر کاربر — معمولاً ۷۰ TPS — حفظ بشه.
از نظر معماری، TokenSpeed سه بخش کلیدی داره. لایهی مدلینگ با رویکرد SPMD محلی کار میکنه و به توسعهدهندهها اجازه میده annotation های I/O رو در مرزهای ماژول مشخص کنن؛ یه کامپایلر استاتیک سبک هم بقیهی کارها رو خودکار انجام میده و دیگه نیازی به پیادهسازی دستی منطق ارتباطی نیست. اسکجولر هم control plane رو از execution plane جدا میکنه — control plane با C++ و به شکل یه finite-state machine پیادهسازی شده که امنیت مدیریت منابع (از جمله KV cache) رو در زمان کامپایل تضمین میکنه، نه runtime. این یعنی خطاها خیلی زودتر شناسایی میشن.
لایهی کرنل هم به عنوان یه زیرسیستم مستقل و ماژولار طراحی شده که از شتابدهندههای مختلف پشتیبانی میکنه. یکی از مهمترین دستاوردهای این لایه، کرنل MLA (Multi-head Latent Attention) بهینهشده برای NVIDIA Blackwell است. در کرنل decode، محور q_seqlen و num_heads با هم گروهبندی شدن تا Tensor Core ها بهتر استفاده بشن — این تکنیک مخصوصاً وقتی تعداد head ها کمه خیلی موثره. کرنل prefill هم یه پیادهسازی fine-tune شده از softmax داره. این کرنل MLA توسط vLLM پذیرفته شده.
تیم TokenSpeed بنچمارکهاشون رو روی trace های واقعی از SWE-smith انجام داده که خیلی نزدیک به ترافیک production coding agent هاست. نتیجه؟ در پیکربندی بهینه (Attention TP4 + MoE TP4)، TokenSpeed در مقایسه با TensorRT-LLM حدود ۹٪ در حالت min-latency و حدود ۱۱٪ throughput بالاتر حول ۱۰۰ TPS/User داره. در کرنل decode هم با speculative decoding، latency تقریباً نصف TensorRT-LLM شده.
TokenSpeed هنوز در حال توسعهست و production hardening اون برای ماههای آینده برنامهریزی شده. این پروژه در همکاری با تیمهای NVIDIA DevTech، AMD Triton، Qwen Inference، Together AI و چند تیم دیگه ساخته شده.
نکات کلیدی:
- TokenSpeed یه موتور اینفرنس اپنسورسه که برای بارکاریهای agentic (مثل coding agent ها) از صفر طراحی شده
- اسکجولر C++ مبتنی بر FSM، صحت مدیریت منابع رو در زمان کامپایل تضمین میکنه نه runtime
- کرنل MLA اختصاصی برای NVIDIA Blackwell بهینه شده و توسط vLLM پذیرفته شده
- در بنچمارکهای واقعی، ~۱۱٪ throughput بالاتر و تقریباً نصف latency decode نسبت به TensorRT-LLM
- پروژه هنوز در مرحلهی توسعهست و production hardening اون در حال انجامه




