سربراس CS-4: کلاستر هوش مصنوعی بدون سوییچ شبکه
خلاصهٔ کاملتر
سربراس (Cerebras) از CS-4 رونمایی کرده؛ یه سیستم هوش مصنوعی در مقیاس رک که تراشههای wafer-scale خودش (تراشههایی بهاندازه یه ویفر کامل سیلیکون) رو بین رکهای مختلف بدون سوییچ شبکه به هم وصل میکنه تا تاخیر ارتباطی کم بشه. شرکت میگه CS-4 تا ۲ برابر سریعتر از CS-3 عمل میکنه و تو یه تست با مدل GPT-OSS-120B، سرعت استنتاج (inference، یعنی مرحله تولید جواب بعد از آموزش مدل) بهازای هر کاربر تا ۳۰ برابر سیستمهای GPU بوده؛ سربراس میگه این عدد به مدل و تنظیمات بستگی داره.
فناوری پشت این اتصال بدون سوییچ اسمش Direct Wafer Links هست که تاخیر بین ویفرها رو تا ۲ میکروثانیه پایین میاره. سیستم از پروتکل RoCE v2 روی اترنت (یه روش استاندارد برای دسترسی مستقیم و کمتاخیر به حافظه از راه دور) هم پشتیبانی میکنه تا بتونه به زیرساختهای اترنت پرسرعت موجود تو دیتاسنترها وصل بشه؛ هر CS-4 تا ۷.۲ ترابیت بر ثانیه پهنایباند I/O داره.
به گفته نیل شاه، معاون پژوهش Counterpoint Research، وصل کردن مستقیم رکبهرک تراشهها میتونه یه لایه بزرگ از سختافزار شبکه رو حذف کنه که معمولا بخش زیادی از بودجه و تا یکسوم برق مصرفی یه کلاستر هوش مصنوعی رو میبلعه. اما بدهبستون هم داره: اتصالهای نقطهبهنقطه نسبت به فبریکهای سوییچشده معمولی، انعطاف کمتری برای مسیریابی دوباره ترافیک یا مدیریت خرابی دارن.
منیش راوات، تحلیلگر TechInsights، میگه این معماری وابستگی به لایههای سوییچینگ سنتی رو کم میکنه ولی کامل حذفش نمیکنه؛ اتصال بیرونی، ذخیرهسازی، ارکستریشن و ارتباط با سختافزارهای ناهمگون همچنان به شبکه سنتی نیاز دارن. نکته دیگه اینه که Direct Wafer Links اختصاصیه: شتابدهندههای شرکتهای دیگه نمیتونن به این فبریک وصل بشن و برای اسکیل کردنش فقط باید سیستم بیشتر از خود سربراس اضافه کرد.
سربراس از PyTorch پشتیبانی میکنه ولی بارهای کاری از طریق پلتفرم اختصاصی خودش، CSoft، اجرا میشن که به گفته شاه هنوز به بلوغ اکوسیستم CUDA انویدیا نرسیده. به گفته دانیش فاروقی، مدیرعامل Fab Economics، این میتونه باعث بشه سازمانها یه دامنه مدیریتی جدا برای این سیستمها کنار زیرساخت GPU موجودشون نگه دارن؛ سرعت بیشتر استنتاج هم فشار رو به تامین سریعتر توکنهای ورودی و داده زمینه منتقل میکنه.
فاروقی میگه یه نقطه فشار میتونه تو فاز prefill پیش بیاد؛ یعنی مرحلهای که مدل قبل از تولید جواب، کل پرامپت ورودی رو پردازش میکنه. تو استقرارهای غیرمتمرکز این پردازش ممکنه بیرون از CS-4 انجام و بعد از طریق اترنت منتقل بشه، که اونجا سرعت شبکه بیرونی مهمتر میشه. سربراس همچنین میگه CS-4 تا ۱۰ برابر بازدهی بیشتر بهازای هر وات نسبت به CS-3 داره، ولی این افزایش بازدهی محدودیتهای توان و خنکسازی تراکم بالای رک رو کامل از بین نمیبره.
نکات کلیدی:
- CS-4 تا ۲ برابر سریعتر از نسل قبلی CS-3 هست
- تو تست مدل GPT-OSS-120B، سرعت استنتاج بهازای هر کاربر تا ۳۰ برابر سیستمهای GPU بوده (بسته به مدل و تنظیمات متغیره)
- Direct Wafer Links تاخیر بین ویفرها رو تا ۲ میکروثانیه پایین میاره
- هر CS-4 تا ۷.۲ ترابیت بر ثانیه پهنایباند I/O داره و از RoCE v2 روی اترنت پشتیبانی میکنه
- Direct Wafer Links اختصاصیه؛ شتابدهندههای شرکتهای دیگه نمیتونن بهش وصل بشن
- سربراس ادعا میکنه بازدهی انرژی CS-4 تا ۱۰ برابر CS-3 بیشتره




