اپل میخواد Gemini غولپیکر گوگل رو روی آیفون فشرده کنه
خلاصهٔ کاملتر
اپل بعد از چند بار تعویق سیریِ مجهز به AI (که از ۲۰۲۴ وعده داده بود)، با یک قرارداد با گوگل قراره دستیارش رو امسال با Gemini ادغام کنه. اما یک گزارش تازه میگه با وجود تلاشهای اپل، نسخهی Geminiمحورِ سیری بهشدت به ابر گوگل و انویدیا تکیه میکنه؛ یعنی هم روی دستگاه و هم در ابر اجرا میشه، که عقبنشینی از ترجیح حریمخصوصیمحورِ اپل برای هوش مصنوعی محلیه.
چرا گوشی نمیتونه مدل بزرگ اجرا کنه؟ برخلاف زبان پرطمطراق تبلیغات تراشهها، GPU بیشتر گوشیها حتی بیشتر از NPUهای مخصوص AI توکن پردازش میکنه، اما گوشیها RAM کافی برای نگهداشتن مدلهای عظیم در حافظه ندارن. مدلهای روی گوشی حداکثر چند میلیارد پارامتر دارن و quantized (با دقت کمتر) اجرا میشن، در حالی که Gemini گوگل تریلیونها پارامتر داره.
اپل بعد از قرارداد، شروع به distill کردن مدلهای غولپیکر Gemini کرده؛ distillation یعنی یک مدل کوچک یاد میگیره مدل بزرگ رو تقلید کنه. این ممکنه به سیری اجازه بده بعضی کارها رو محلی انجام بده، اما یک جزء ابری اجتنابناپذیر به نظر میرسه. به گفتهی گزارش، اپل حتی برای اجرای مدلهای distillنشدهی Gemini روی زیرساخت Private Cloud Compute خودش (مبتنی بر تراشههای Mac سری M) به مشکل خورده.
نکتهی جالب اینه که اپل برای بخش ابری بهجای TPUهای گوگل، با انویدیا و پلتفرم Confidential Computingاش قرارداد بسته؛ این فناوری داده رو حین پردازش روی GPUهای انویدیا رمزنگاریشده نگه میداره، که میتونه به اپل کمک کنه همچنان ادعای حساسیت به حریم خصوصی کنه (شاید حتی برند Private Cloud Compute رو نگه داره). البته Confidential Computing کاملاً رمزنگاریشدهی انویدیا پردازش رو کندتر میکنه، پس کاربرها ممکنه وقتی سیری به سرور راه دور وصل میشه کندی رو حس کنن.
نکات کلیدی:
- سیریِ مجهز به Gemini هم روی دستگاه و هم در ابر اجرا میشه؛ عقبنشینی از هوش مصنوعی محلی
- گوشیها RAM کافی برای مدلهای تریلیونپارامتری ندارن؛ مدلهای محلی کوچک و quantized هستن
- اپل Gemini رو distill میکنه اما جزء ابری اجتنابناپذیره
- بخش ابری روی انویدیا (Confidential Computing) اجرا میشه، نه TPUهای گوگل




