موندریم: مدلهای بینایی سبک برای استقرار واقعی
خلاصهٔ کاملتر
موندریم یه خانوادهٔ مدل بینایی-زبانی (VLM) متنباز و مناسب استفادهٔ تجاریه که به گفتهٔ سازندهش تا حالا بیش از پنج میلیون بار دانلود شده. تمرکز اصلیش رو دقت تنها نیست؛ بلکه رو اینه که مدل واقعاً تو محیط تولید، رو هر سختافزاری، سریع و ارزون کار کنه.
خط مدلها سه سطح داره: Moondream 3 Preview با معماری sparse mixture-of-experts و ۹ میلیارد پارامتر (فقط ۲ میلیاردش فعاله) برای استدلال بصری پیشرفته، Moondream 2 با ۲ میلیارد پارامتر متراکم بهعنوان نسخهٔ پایدار تولیدی، و یه نسخهٔ ۰.۵ میلیاردی سبک برای سختافزارای محدود. همهشون کارایی مثل caption، detect، point و segment رو رو تصویر انجام میدن.
بخش کلیدی پلتفرم، موتور اجرای Photon ـه. طبق بنچمارک داخلی خودشون رو یه H100، Moondream 3 روی Photon تو ۳۴ میلیثانیه جواب میده؛ در حالی که Qwen 3.5 4B رو vLLM حدود دو برابر کندتره، و مدلهای ابری مثل GPT-5.4 Mini و Gemini 2.5 Flash بهمراتب کندتر عمل میکنن. Photon رو طیفی از سختافزار، از Jetson AGX Orin تو لبه تا H100 تو سرور، اجرا میشه و هزینهٔ پردازش ابری هر هزار تصویر رو حدود ۶ سنت اعلام کردن.
برای وقتی که مدل پایه کافی نیست، پلتفرم Lens یه سرویس فاینتیون با API سادست؛ نیازی به آپلود دیتاست بزرگ یا تیم یادگیری ماشین نیست و طبق ادعای سازنده با همون ۲۰ عکس برچسبخورده هم میشه دقت رو قابلتوجه بهتر کرد. مدل فاینتیونشده هم بلافاصله رو Moondream Cloud یا لوکال با Photon قابل اجراست.
نکات کلیدی:
- موندریم سه ردهٔ مدل بینایی-زبانی متنباز داره: ۰.۵، ۲ و ۹ میلیارد پارامتری (mixture-of-experts)
- موتور Photon طبق ادعای سازنده رو H100 حدود دو برابر سریعتر از vLLM جواب میده
- هزینهٔ پردازش ابری حدود ۶ سنت بهازای هر هزار تصویر اعلام شده
- پلتفرم Lens امکان فاینتیون با تعداد کمی عکس برچسبخورده رو فراهم میکنه، بدون نیاز به تیم ML
import moondream as md
from PIL import Image
model = md.vl(model="moondream-2b")
image = Image.open("shelf.jpg")
print(model.caption(image).caption)



