چالش واقعی هوش مصنوعی تو تولید، مدل نیست؛ زیرساخته
خلاصهٔ کاملتر
تو یه پنل زنده InfoQ، رناتو لوسیو (سردبیر InfoQ) با چهارتا متخصص از شرکتهای مختلف -مریم آریک از Doubleword، الکس اینفانزون از Cockroach Labs، لوکا بیانکی از MESA و سیمروس ماهش از استارتاپ Forge- درباره چالشهای زیرساختی هوش مصنوعی تو تولید حرف زدن. جمعبندی همهشون این بود: دیگه مشکل اصلی ساختن مدل نیست، مشکل اینه که چطور این سیستمها رو تو مقیاس واقعی، پایدار نگه داریم.
مریم آریک میگه پیشبینی اولیهشون این بود که هزینه توکن سالی حدود ۱۰ برابر بشه، اما تو عمل چیزی نزدیک به ۱۰۰ برابر شده، سرعتی که هیچکس انتظارش رو نداشت. الکس اینفانزون هم میگه علاوه بر کمبود GPU، مصرف انرژی دیتاسنترها هم داره یه محدودیت جدی میشه، چون باید سالها قبل برای ظرفیت برق برنامهریزی کرد. لوکا بیانکی هم میگه فقط با بیدار شدن آمریکا و شروع ترافیک اونجا، نرخ پاسخدهی APIهای هوش مصنوعی بهشدت افت میکنه.
به گفتهٔ مریم آریک، برنامهریزی ظرفیت برای بار کاری هوش مصنوعی اونقدر پیچیده شده که خودِ سلف-هاستینگ inference دیگه بهصرفه نیست، مگر اینکه این کارِ اصلی یه شرکت باشه؛ برای همین اکثر تیمها این مسئله رو سپردن به ارائهدهندههای inference. با این حال، حتی بهترین ارائهدهندهها هم به اندازه کافی GPU در دسترس ندارن و پدیده «همسایه پرسروصدا» (noisy neighbor) هنوز اتفاق میافته.
هزینه هوش مصنوعی به ازای هر توسعهدهنده بین شرکتها خیلی فرق میکنه؛ بعضیا ماهی ۱۵ هزار دلار برای یه نفر خرج میکنن و راضین چون بهرهوری بالا میره، اما اوبر طبق گفتهٔ الکس اینفانزون بهخاطر انگیزههای اشتباه (مثل رقابت و لیدربرد بین کارمندا) کل بودجه سالانهش رو تو چهار ماه اول خرج کرد. سیمروس ماهش میگه راهحل اینه که یه لایه observability و governance روی ایجنتها بذاری.
الکس اینفانزون هم توضیح میده که دیتابیس دیگه فقط محل ذخیره داده نیست، بلکه صفحه کنترل ایجنتهاست، چون هویت، حافظه و لاگ رفتار ایجنتها همونجا نگه داشته میشه؛ برای این کار بعضی تیمها از دیتابیسهای SQL توزیعشده استفاده میکنن تا هم سازگاری داده حفظ بشه و هم تأخیر برای کاربرای مناطق مختلف پایین بمونه.
سیمروس ماهش میگه برگردوندن کار یه ایجنت خودمختار خیلی سختتر از عقبگرد یه دیپلوی معمولیه، چون ایجنتها ممکنه فایل ساخته باشن، پولریکوئست باز کرده باشن یا APIهای ابری رو صدا زده باشن که برگشتناپذیرن. توصیهٔ پنلیستها اینه که بهجای تلاش برای برگردوندن بعد از اتفاق، از همون اول با feature flag، dry-run و approval gate جلوی اقدامهای غیرقابلبرگشت رو بگیری.
نکات کلیدی:
- هزینه توکن بهجای رشد ۱۰ برابری سالانه، داره حدود ۱۰۰ برابر میشه
- کمبود GPU و انرژی، مهمترین گلوگاه زیرساخت هوش مصنوعیه
- دیتابیس دیگه فقط انباره؛ صفحه کنترل هویت و حافظه ایجنتهاست
- برگردوندن کار یه ایجنت خودمختار، خیلی سختتر از عقبگرد یه دیپلوی معمولیه




