ویرگو؛ فابریک تازهٔ گوگل برای دیتاسنترهای AI
خلاصهٔ کاملتر
تیم شبکهٔ گوگل کلاود تو این پست میگه عصر هوش مصنوعی معماری فیزیکی ابر — مخصوصاً شبکه — رو مجبور به یه بازنگری بنیادی کرده. با رشد نمایی پارامترهای مدلهای پایه، شبکههای همهمنظورهٔ سنتی به مرز توانشون رسیدن. جواب گوگل به این وضعیت Virgo Network هست: یه فابریک دیتاسنتر در مقیاس بزرگ که با فلسفهٔ «کل کمپوس مثل یک کامپیوتر» ساخته شده و زیرساخت AI Hypercomputer گوگله.
به گفتهٔ نویسندهها چهار محدودیت، طراحیهای قدیمی رو زمین میزنه: مقیاس عظیم، چون آموزش دیگه از توان و فضای یک دیتاسنتر بیرون زده و به دامنههای چنددیتاسنتری نیاز داره؛ رشد انفجاری پهنای باند لازم برای هر شتابدهنده، چون آموزش مدلهای پایه عملاً به شبکه گره خورده؛ برستهای همزمان در حد زیرمیلیثانیه که بافرها رو خفه میکنه و یه گره کند میتونه کل کلاستر رو عقب بندازه؛ و نیاز سرویسدهی ML به تأخیر پایین و یکنواخت.
معماری جدید سه لایهٔ تخصصی داره که با هم مثل یه دامنهٔ محاسباتی واحد کار میکنن: لایهٔ scale-up برای ارتباط تنگاتنگ شتابدهندهها داخل یک pod، فابریک scale-out که یه شبکهٔ RDMA اختصاصی شتابدهندهبهشتابدهنده برای ترافیک east-west بین podهاست و روی تأخیر قطعی و goodput بالا تنظیم شده، و شبکهٔ Jupiter برای ترافیک north-south یعنی دسترسی به استوریج و محاسبات عمومی و وصل کردن چند سایت به هم.
این جدا کردن لایهها سه فایده داره: هر دامنه رو میشه مستقل از بقیه ارتقا داد بدون اینکه کل سیستم بخوابه، پهنای باند scale-out اختصاصی و بدون انسداد میمونه، و شبکه پابهپای هر نسل جدید شتابدهنده همطراحی میشه تا فابریک با سختافزارش جور دربیاد.
خود Virgo روی سوئیچهای high-radix سواره؛ چون هر سوئیچ پورت بیشتری داره، تعداد لایههای شبکه کم میشه و نتیجه یه توپولوژی مسطح دولایهٔ non-blocking با چند صفحهٔ (plane) مستقله. اعداد اعلامشده هم قابل توجهن: اتصال ۱۳۴ هزار تراشهٔ TPU 8t تو یک فابریک با تا ۴۷ پتابیت بر ثانیه پهنای باند دوبخشی، تا ۴ برابر پهنای باند هر شتابدهنده نسبت به نسل قبل، و ۴۰ درصد تأخیر کمتر در حالت بیبار.
تو مقیاس صدها هزار تراشه، خرابی سختافزار اجتنابناپذیره و یه قطعهٔ معیوب میتونه کل جاب آموزش همگام رو مختل کنه. برای همین Virgo با صفحههای سوئیچینگ مستقل طراحی شده تا خطا ایزوله بمونه و یه خرابی موضعی، goodput کل کلاستر رو پایین نکشه.
روی این پایه، گوگل با تلهمتری زیرمیلیثانیهای شبکه رو رصد میکنه تا ازدحام گذرا رو ببینه، مدیریت بافر رو بهتر کنه و ریشهٔ کندیها رو تو کل استک پیدا کنه. تشخیص خودکار straggler و قابلیت تازهٔ تشخیص hang هم کمک میکنه گرههای کند یا از کار افتاده سریع پیدا بشن، تا زمان بازیابی (MTTR) پایین و فاصلهٔ بین وقفهها (MTBI) بالا بمونه.
نکات کلیدی:
- Virgo Network فابریک scale-out تازهٔ گوگله که زیربنای AI Hypercomputer هست
- معماری سهلایه: scale-up داخل pod، فابریک RDMA برای ترافیک east-west، و Jupiter برای north-south
- توپولوژی مسطح دولایهٔ non-blocking روی سوئیچهای high-radix، با چند plane مستقل
- تا ۱۳۴ هزار تراشهٔ TPU 8t در یک فابریک با تا ۴۷ پتابیت بر ثانیه پهنای باند دوبخشی
- تا ۴ برابر پهنای باند هر شتابدهنده و ۴۰ درصد تأخیر کمتر نسبت به نسل قبل
- جداسازی خطا با صفحههای سوئیچینگ مستقل، بهعلاوهٔ تلهمتری زیرمیلیثانیهای و تشخیص خودکار straggler و hang




