LFM2.5-230M؛ مدلی که همهجا اجرا میشه
خلاصهٔ کاملتر
شرکت Liquid AI مدل LFM2.5-230M رو منتشر کرده؛ کوچکترین مدلی که تا حالا ساخته و به گفتهٔ خودشون یه پایهٔ سبک و سریع برای فاینتیون کردن و اجرا تو جریانهای کاری agenticـه. هم نسخهٔ پایه (Base) و هم نسخهٔ post-trained روی Hugging Face در دسترسه و وزنها بازه.
نقطهٔ فروش اصلی، سرعت روی سختافزار ارزونه: روی گلکسی S25 Ultra (اسنپدراگون) حدود ۲۱۳ توکن بر ثانیه و روی رزبریپای ۵ حدود ۴۲ توکن بر ثانیه دیکود میکنه — یعنی از ابر GPU تا CPU ارزون همهجا اجرا میشه. تیم میگه به لطف معماری LFM2، هم throughput بالاتری از مدلهای هماندازه (از جمله هیبریدهای SSM) داره و هم کمترین مصرف حافظه رو.
دربارهٔ آموزش: مدل با ۱۹ تریلیون توکن پیشآموزش دیده (با یه فاز گسترش کانتکست تا ۳۲ هزار توکن) و بعد یه دستور پخت سبک post-training روش اجرا شده که سه مرحله داره: فاینتیون نظارتشده با تقطیر (distillation) از LFM2.5-350M، بهینهسازی ترجیح مستقیم (DPO) و در آخر یادگیری تقویتی چنددامنهای. هدف این بوده که مدل هم بیرون از جعبه خوب کار کنه و هم برای تخصصیسازی دست توسعهدهنده رو باز بذاره.
تو بنچمارکها روی ده معیار سنجیده شده و ادعا اینه که اغلب با مدلهای بیش از دوبرابر بزرگتر رقابت میکنه یا ازشون جلو میزنه: تو IFEval نمرهٔ ۷۱.۷ گرفته (در برابر ۵۹.۹ برای Qwen3.5-0.8B و ۶۳.۵ برای Gemma 3 1B) و تو ابزارفراخوانی BFCLv3 نمرهٔ ۴۳.۳. در عوض تو دانش عمومی مثل MMLU-Pro با نمرهٔ ۲۰.۲ عقبـه و خود تیم صراحتاً میگه برای بار کاری استدلالمحور — ریاضی پیشرفته، تولید کد و نوشتن خلاقانه — این مدل رو توصیه نمیکنن.
نویسندهها میگن جای درست این مدل، خط لولههای استخراج داده در مقیاس بزرگ و بارهای agentic سبک روی دستگاهه. بهعنوان نمونهای از کار در جریان، مدل رو روی ربات انساننمای Unitree G1 و کاملاً روی خود دستگاه (NVIDIA Jetson Orin) اجرا کردن؛ اونجا مدل نقش لایهٔ انتخاب مهارت رو داره و یه دستور زبان طبیعی رو به زنجیرهای از فراخوانی ابزار تبدیل میکنه که مهارتهای سطحپایین از پیش آموزشدیده رو صدا میزنن.
از نظر اکوسیستم، مدل از روز اول روی llama.cpp (چکپوینت GGUF)، MLX برای اپل سیلیکون، vLLM و SGLang برای سرو کردن روی GPU و ONNX پشتیبانی میشه. تیم برای دیپلوی سازمانی هم یه استک اختصاصی GPU ساخته که ادعا میکنه تو همهٔ سطوح همزمانی، تأخیر انتها-به-انتهای کمتری از رقبا روی SGLang داره.
نکات کلیدی:
- LFM2.5-230M کوچکترین مدل خانوادهٔ LFM2.5 با وزن باز روی Hugging Face
- ۲۱۳ توکن بر ثانیه روی گلکسی S25 Ultra و ۴۲ توکن بر ثانیه روی رزبریپای ۵
- ۱۹ تریلیون توکن پیشآموزش + تقطیر از مدل ۳۵۰ میلیونی، DPO و RL چنددامنهای
- قوی تو دنبالکردن دستور، استخراج داده و ابزارفراخوانی؛ ضعیف تو ریاضی، کد و نوشتن خلاقانه
- پشتیبانی روز اول از llama.cpp، MLX، vLLM، SGLang و ONNX




