جمّا ۴؛ نسل جدید مدلهای اوپنویت گوگل
خلاصهٔ کاملتر
تیم جمّا در گوگل دیپمایند گزارش فنی Gemma 4 رو منتشر کرده؛ نسلی جدید از مدلهای زبانی اوپنویت (open-weight) و ذاتاً چندوجهی (natively multimodal) که به گفته تیم، کارآمدترین و تواناترین نسل خانواده جمّا تا امروزه. این مدلها میتونن متن، تصویر و صدا رو بهصورت یکپارچه پردازش کنن و روی کارهای استدلالی پیچیده عملکرد سطحبالایی دارن.
خانواده جمّا ۴ هم معماری dense داره — با نسخههای مؤثر ۲.۳، ۴.۵، ۱۲ و ۳۱ میلیارد پارامتری — و هم یه نسخه Mixture-of-Experts با ۳.۸ میلیارد پارامتر فعال از مجموع ۲۶ میلیارد. طراحی هدفمند اینها برای اجرا روی سختافزارهای مختلف روی دستگاه (on-device) بوده.
طبق گزارش، مهمترین نوآوری اینه که به مدلها یه حالت فکر کردن (thinking mode) اضافه شده؛ یعنی مدل قبل از جواب دادن یه ردّ استدلال (reasoning trace) تولید میکنه که توی حوزههای استدلالمحور مثل ریاضی و کدنویسی عملکرد رو بهتر میکنه.
بخش مهمی از کار روی کارایی متمرکز بوده. برای کانتکست بلند، نسبت ۵ به ۱ بین توجه محلی (sliding window) و توجه سراسری نگه داشته شده و با ترفندهایی مثل اشتراکگذاری KV cache و استفاده مجدد از کلیدها بهجای مقادیر، ردّپای حافظه KV سراسری تا ۳۷.۵٪ کم شده. برای سرعت هم یه drafter head برای پیشبینی چندتوکنی (speculative decoding) و نسخههای کوانتیزهشده با آموزش QAT ارائه شده تا مصرف حافظه و تأخیر پایین بیاد.
یه نوآوری معماری جالب هم اینه که مدل ۱۲ میلیاردی یه معماری بدون اِنکودر (encoder-free) داره؛ بهجای اِنکودرهای جدا برای تصویر و صدا، تکههای خام صدا (چانکهای ۴۰ میلیثانیهای) و پچهای تصویر رو مستقیم به فضای امبدینگ مدل تصویر میکنه که باعث کمشدن پراکندگی حافظه میشه.
تیم جمّا میگه بر اساس بنچمارکها و ارزیابیهای انسانی مثل Arena، جمّا ۴ در سطح مدلهای اوپنسورس بزرگتر و پیشرو عمل میکنه و توی حوزههای STEM، چندوجهی و کانتکست بلند یه جهش داشته. مدلها هم با لایسنس Apache 2.0 منتشر شدن تا توسعهدهندهها و پژوهشگرها بتونن روشون بسازن.
نکات کلیدی:
- جمّا ۴ خانوادهای اوپنویت و ذاتاً چندوجهی (متن، تصویر، صدا) از گوگل دیپماینده
- شامل مدلهای dense از ۲.۳ تا ۳۱ میلیارد پارامتر و یه نسخه MoE (۳.۸B فعال از ۲۶B)
- حالت «فکر کردن» برای استدلال بهتر توی ریاضی و کدنویسی اضافه شده
- بهینهسازی حافظه: کاهش تا ۳۷.۵٪ در KV cache سراسری
- مدل ۱۲ میلیاردی معماری بدون اِنکودر داره و همه با لایسنس Apache 2.0 منتشر شدن




