LiteRT؛ اجرای مدلهای هوش مصنوعی روی خودِ دستگاه
خلاصهٔ کاملتر
LiteRT اسم تازهٔ چیزیه که سالها با اسم TensorFlow Lite میشناختیمش. تو صفحهٔ معرفی گوگل اومده که این فقط یه تغییر برند نیست و نسل بعدی همون رانتایمیه که الان روی میلیاردها دستگاه کار میکنه. هدفش هم روشنه: اجرای مدلهای یادگیری ماشین و مدلهای مولد مستقیم روی خود دستگاه، نه روی سرور.
منطق کار سه مرحلهست. اول مدل رو گیر میاری، یا یه مدل آمادهٔ .tflite برمیداری یا مدل PyTorch، JAX و TensorFlow خودتو تبدیل میکنی. بعد با جعبهابزار بهینهسازی و کوانتیزیشنِ بعد از آموزش سبکترش میکنی تا جا بشه. آخر هم با LiteRT اجراش میکنی و شتابدهندهٔ مناسب اپت رو انتخاب میکنی.
بخش تازهتر ماجرا NPUهاست، یعنی همون پردازندههای اختصاصی شبکهٔ عصبی که تو چیپهای موبایل نشستن. به گفتهٔ گوگل، CompiledModel API انتخاب سختافزار و اجرای ناهمزمان رو خودکار میکنه و پشتیبانی از NPU کوالکام و مدیاتک هم اضافه شده. روی مرورگر و دستگاههای کوچیکتری مثل Chromebook Plus و Pixel Watch، کار مدلهای زبانی رو LiteRT-LM جلو میبره.
روی بخش مولد، تیم گوگل مدلهای open-weight مثل Gemma رو هدف گرفته؛ از چتبات روی دستگاه تا قابلیتهای ایجنتی و برنامهریزی چندمرحلهای با خانوادهٔ Gemma 4. مدلهای آمادهٔ این خانواده روی Hugging Face منتشر شدن و یه اپ نمایشی به اسم Google AI Edge Gallery هم نمونهکارها رو نشون میده.
برای کسی که تا حالا با TFLite کار میکرده، حرف اصلی مسیر مهاجرت و APIهای یکدست بین اندروید، دسکتاپ و وبه. مزیت اجرای روی دستگاه هم همونیه که همیشه بود: تأخیر کم و حریم خصوصی بهتر، چون داده از دستگاه بیرون نمیره.
نکات کلیدی:
- LiteRT ادامهٔ TensorFlow Lite هست با APIهای یکدست بین اندروید، دسکتاپ و وب
- مسیر کار: تبدیل مدل به .tflite، کوانتیزه کردن، اجرا روی CPU یا GPU یا NPU
- CompiledModel API انتخاب شتابدهنده و اجرای ناهمزمان رو خودکار میکنه
- پشتیبانی از NPU کوالکام و مدیاتک، و اجرای مدلهای مولد مثل Gemma روی دستگاه




