AI Hypercomputer؛ معماری یکپارچهٔ گوگل برای هوش مصنوعی
خلاصهٔ کاملتر
گوگل کلاد تو صفحهٔ معرفی AI Hypercomputer میگه این محصول یه سرویس تکی نیست، بلکه یه معماریه که سختافزار سفارشی، نرمافزار متنباز و چند مدل مختلف خرید ظرفیت رو یکپارچه کنار هم میذاره. ادعای اصلیشون اینه که چون همهٔ اجزا با هم طراحی شدن، هم کارایی بالاتر میره هم هزینه و زمان توسعه پایین میاد.
سمت آموزش مدل، تمرکز روی TPU نسل هشتم و مجموعهای از ابزارهای نرمافزاریه که با DeepMind همطراحی شدن — از Pathways و Pallas برای آموزش تا Ray و Agent Sandbox برای فاینتیون. به نوشتهٔ گوگل با این ترکیب، توسعهٔ مدلهای زبانی ۳۶٪ سریعتر پیش میره و شاخص Goodput، یعنی درصد زمان مفید هر شتابدهنده، تا ۹۷٪ بالا میره. برای تیمهایی که GPU میخوان هم قراره اینستنسهای مبتنی بر NVIDIA Vera Rubin NVL72 امسال بیاد.
بخش سرویسدهی (inference) روی کم کردن تأخیر مانور میده: GKE Inference Gateway زمان تا اولین توکن رو ۷۱٪ کم میکنه، پروژهٔ متنباز llm-d با تفکیک مراحل سرویسدهی تا ۱۲۰ هزار توکن در ثانیه جواب میده، و Rapid Cache همراه TPU 8i مدل رو ۵ برابر سریعتر لود میکنه. برای اجرای انبوه ایجنتها هم GKE Agent Sandbox تا ۳۰۰ سندباکس در ثانیه میسازه و ایجنت بیکار رو موقتاً میخوابونه تا پولش حساب نشه.
نکتهٔ مهم برای تیمهای مهندسی، قابل حمل بودن کاره. TorchTPU پشتیبانی بومی PyTorch رو روی TPU میاره، پس برای جابهجایی بین TPU و GPU لازم نیست کد رو بازنویسی کنی. زیرساخت هم روی GKE سواره که تا ۱۳۰ هزار نود مقیاس میگیره و با Google Distributed Cloud برای محیطهای هیبریدی جور میشه. ابزارهای Cluster Director هم گزارش سلامت قبل از استقرار، داشبورد رصد و چک سلامت همیشگی میدن.
سمت هزینه، چند مدل مصرف انعطافپذیر تعریف شده: تا ۹۱٪ تخفیف روی کارهای دستهای و مقاوم به خطا با Spot VM، تا ۵۰٪ با Dynamic Workload Scheduler وقتی زمان شروع کار برات مهم نیست، و تا ۵۰٪ با تعهد استفادهٔ بلندمدت. گوگل همچنین میگه دیتاسنترهاش نسبت به پنج سال پیش شش برابر توان محاسباتی به ازای هر واحد برق میدن و TPU نسل هشتم ۸۰٪ نسبت قیمت به کارایی بهتر و ۲۰٪ مصرف انرژی بهینهتر داره.
برای اینکه ادعاها زمینیتر بشه، چند نمونهٔ مشتری هم آورده شده: WPP چرخهٔ یادگیری تقویتی ربات انساننما رو از ۲۴ ساعت به کمتر از یک ساعت رسونده، تویوتا سراغ GKE رفته چون تو تستهاش چهار برابر سریعتر مقیاس گرفته، و MLB زمان ساخت ایجنتهاش رو از چند ماه به چند هفته کم کرده. فقط یادت باشه همهٔ این عددها از خود گوگل و روی یه صفحهٔ محصول اومده، نه از یه بنچمارک مستقل.
نکات کلیدی:
- AI Hypercomputer یه معماری یکپارچهست، نه یه سرویس تکی: سختافزار، نرمافزار و مدل خرید ظرفیت با هم.
- ادعای ۳۶٪ سرعت بیشتر در توسعهٔ مدل زبانی و Goodput تا ۹۷٪ با TPU نسل هشتم.
- کاهش ۷۱٪ زمان تا اولین توکن با GKE Inference Gateway و لود ۵ برابر سریعتر مدل با Rapid Cache.
- TorchTPU جابهجایی بین TPU و GPU رو بدون بازنویسی کد ممکن میکنه.
- تخفیف تا ۹۱٪ روی Spot VM و تا ۵۰٪ با Dynamic Workload Scheduler یا تعهد بلندمدت.




