Superlinked Inference Engine: یه سرور برای بیش از صد مدل
خلاصهٔ کاملتر
وقتی داری یه ایجنت هوش مصنوعی میسازی، معمولاً به چند تا مدل نیاز داری: یه مدل embedding (یعنی مدلی که متن رو تبدیل به بردار عددی میکنه تا بشه شباهت معنایی رو سنجید) برای جستوجوی معنایی، یه reranker برای مرتبکردن نتایج بر اساس ربط، یه مدل استخراج موجودیت، و یه مدل تولید متن برای جواب نهایی. هر کدوم از اینا یعنی یه سرور جدا و سهم جدا از GPU. Superlinked Inference Engine (SIE) دقیقاً همین پراکندگی رو هدف گرفته: یه موتور متنباز با مجوز Apache 2 که همهی این مدلها رو از یه سرور واحد سرو میکنه.
طبق نمایشی که تو مقاله اومده، نصب SIE با یه محیط مجازی پایتون (مثلاً با uv یا conda) و یه دستور نصب انجام میشه، بعد یه دستور دیگه سرور رو بالا میاره. موقع اجرا، سرور ۱۵۱ مدل تو رجیستری خودش پیدا کرده، بدون اینکه چیزی دانلود کنه؛ مصرف حافظهی GPU هم صفر میمونه تا وقتی یه مدل واقعاً درخواست بشه. این طراحی «شروع فوری، لود تنبل» یعنی هر مدل فقط بار اولی که صداش میزنی لود میشه و بعدش تو حافظه میمونه.
یه SDK سبک هم به سرور وصل میشه و همون الگو برای هر کار تکرار میشه: یه کلاینت بساز و یه متد با اسم مدل و ورودی صدا بزن. متد encode بردار embedding برمیگردونه (تو دمو یه بردار ۳۸۴بعدی)، score جوابها رو بر اساس ربط مرتب میکنه، extract موجودیتهایی مثل اسم شخص یا سازمان رو بدون فاینتیون بیرون میکشه، و generate متن تولید میکنه. عوض کردن مدل، مثلاً از all-MiniLM کوچیک به BGE-M3 بزرگتر، فقط با عوض کردن یه رشتهی اسم مدل تو کد انجام میشه، بدون ریاستارت سرور.
به گفتهی نویسنده، اجرای محلی SIE یعنی دادهت هیچوقت از سختافزار خودت بیرون نمیره و هزینهی هر توکن رو به چند فروشندهی مختلف نمیدی، اما در عوض باید خودت یه GPU داشته باشی و مسئول نگهداری سرور باشی. برای تیمهایی که نمیخوان زیرساخت GPU رو خودشون مدیریت کنن، Superlinked یه نسخهی ابری مدیریتشده از همین موتور هم ارائه میده؛ همون کد و همون کاتالوگ مدل، فقط رو زیرساخت خودشون هاست شده.
نکات کلیدی:
- SIE بیش از ۱۰۰ مدل embedding، reranker، استخراج و تولید متن رو از یه سرور واحد سرو میکنه
- متنباز با مجوز Apache 2 و بالای ۲۸۰۰ ستاره رو گیتهاب
- مدلها لود تنبل دارن؛ فقط موقع اولین فراخوانی دانلود و رو GPU لود میشن
- عوض کردن مدل فقط با تغییر یه رشتهی اسم مدل تو کد، بدون ریاستارت سرور
- چهار متد اصلی: encode، score، extract و generate (روی بکاند جدا)
- برای کسایی که نمیخوان GPU مدیریت کنن، نسخهی ابری مدیریتشده هم موجوده




