FreeToken چطور مدلهای MoE غولپیکر رو روی یک GPU اجرا میکنه
خلاصهٔ کاملتر
FreeToken ابزاریه برای اجرای محلی مدلهای mixture of experts (MoE یعنی مدلهایی که بهجای فعال کردن کل شبکه، فقط چند زیرشبکهٔ تخصصی یا «اکسپرت» رو فعال میکنن)، مثل GLM، DeepSeek و Miniax. این مدلها چند صد میلیارد پارامتر دارن و روش معمول سرو کردنشون کل مدل رو روی VRAM میآره، یعنی یه مدل ۳۰۰ میلیارد پارامتری به هشت GPU یا بیشتر نیاز داره. نویسنده میگه FreeToken این فرض رو زیر سؤال میبره: فقط اکسپرتهای پرکاربرد رو کنار کش KV روی GPU نگه میداره و بقیهٔ مدل رو تو RAM سیستم میذاره.
پیش از سرو کردن مدل، FreeToken یه بنچمارک واقعی رو GPU خودت اجرا میکنه و سرعت پردازش CPU رو با سرعت انتقال از طریق PCIe (باس ارتباطی CPU و GPU) مقایسه میکنه. اگه CPU سریعتر از انتقال PCIe باشه، حالت hybrid انتخاب میشه و اکسپرت روی CPU محاسبه میشه؛ اگه انتقال سریعتر باشه، حالت offload انتخاب میشه و اکسپرت از طریق PCIe به GPU منتقل میشه. این تصمیم فقط یه بار برای هر ترکیب مدل و سختافزار گرفته میشه، بدون تنظیم دستی.
تو نمونهٔ نویسنده با یه مدل کوانتیزهشدهٔ NVFP4 روی کارت A6000، بارگذاری در حدود ۳۰ ثانیه انجام شد، بیش از ۲۱ گیگابایت فقط برای کش KV کنار گذاشته شد و مصرف نهایی VRAM به حدود ۴۴ گیگابایت رسید، بدون هیچ تنظیم دستیای مثل تعیین دستی تنسور پارالل یا کوانتیزیشن.
FreeToken یه شل ترمینالی به اسم FT shell هم داره که همزمان با چت کردن، آمار زندهای مثل سرعت تولید توکن، وضعیت کش اکسپرتها (چقدر پره و چقدر دوباره استفاده میشه) و مصرف کلی VRAM رو نشون میده؛ به گفتهٔ نویسنده همین دید لحظهای کمک میکنه بفهمی سیستمت بهینه کار میکنه یا داره به سقف VRAM میخوره.
FreeToken همچنین بهعنوان بکاند محلی برای شش ابزار کدنویسی هوش مصنوعی از جمله Claude، Codex، DSH، Hermes agent، OpenClaw و OpenCode قابل استفادهست؛ کافیه این ابزارها رو با آدرس سرور محلی FreeToken اجرا کنی تا بهجای API ابری، از مدل سرو شده روی سیستم خودت استفاده کنن.
نویسنده معتقده این راه هم هزینهٔ سرور چند GPU و هم قبض API رو حذف میکنه، اما در سرعت با یه دیپلوی اختصاصی چند GPU رقابت نمیکنه؛ برای آزمایش محلی یا کار محرمانه میارزه، ولی برای سرویسدهی پرترافیک، زیرساخت اختصاصی همچنان برندهست.
نکات کلیدی:
- FreeToken بخش کوچیکی از اکسپرتهای مدل رو رو GPU نگه میداره و بقیه رو رو RAM سیستم میذاره تا مدلهای صدها میلیارد پارامتری رو یک GPU سرو کنه
- بنچمارک خودکار بین حالت hybrid (پردازش CPU) و offload (انتقال PCIe) تصمیم میگیره، بدون تنظیم دستی
- نمونهٔ Qwen 3.6 روی A6000: بارگذاری در ۳۰ ثانیه، حدود ۲۱ گیگ VRAM برای KV cache، مصرف نهایی حدود ۴۴ گیگ
- FT shell آمار لحظهای مثل توکن بر ثانیه و وضعیت کش اکسپرتها رو نشون میده
- به شش ابزار کدنویسی از جمله Claude، Codex، DSH، Hermes agent، OpenClaw و OpenCode وصل میشه
- برای سرویسدهی پرترافیک همچنان زیرساخت اختصاصی چند GPU سریعتره




