MolmoMotion؛ پیشبینی حرکت سهبعدی با دستور زبانی
خلاصهٔ کاملتر
به گفتهٔ تیم Ai2، ماشینها تو تشخیص حرکت خیلی خوب شدن، ولی این کار فقط گذشتهنگره: حرکتی که قبلاً اتفاق افتاده رو توضیح میده. خیلی از کاربردها به جای این، نیاز دارن جلوتر رو ببینن — مثلاً یه ربات که میخواد یه فنجون رو برداره، باید قبل از لمس کردنش حدس بزنه فنجون چطور تکون میخوره. مدل جدیدشون MolmoMotion دقیقاً همینه: یه مدل پیشبینی حرکت.
کاری که میکنه اینه که یه فریم تصویر، چند نقطه که روی یه جسم مشخص شده و یه دستور نوشتاری مثل «کاسهٔ چوبی پر از میوه رو روی میز حرکت بده و بچرخون» میگیره، بعد پیشبینی میکنه اون نقطهها تو چند ثانیهٔ بعدی تو فضای سهبعدی کجا میرن. نویسنده میگه این مدل تو دقت، از روشهای پیشبینی موجود خیلی جلوتره.
نکتهٔ فنی جالبش نحوهٔ نمایش حرکته: بهجای رندر کردن کل ویدیو، حرکت رو با یه سری نقطهٔ سهبعدی چسبیده به جسم نشون میده. این روش سه تا خاصیت داره که دنبالش بودن — به نوع جسم وابسته نیست، از زاویههای مختلف دوربین پایدار میمونه، و مستقیم قابل استفاده برای سیستمهای پاییندستیه. برای اتصال دستور زبانی به نقطهها هم از مدل Molmo 2 بهعنوان ستون فقرات استفاده میکنه.
دو نسخه ازش آموزش دادن: نسخهٔ MolmoMotion-AR که مختصات آینده رو قدمبهقدم و بهصورت متن ساختاریافته میسازه و برای مسیرهای مشخص دقیقتره، و نسخهٔ MolmoMotion-FM که با تبدیل نویز به حرکت کار میکنه و وقتی یه دستور چند حالت ممکن داره بهتر عمل میکنه.
برای آموزشش دادهای لازم بود که وجود نداشت، برای همین یه خط لولهٔ خودکار ساختن که از ویدیوهای معمولی اینترنت، مسیرهای سهبعدی گرهخورده به جسم بیرون میکشه. نتیجهش دیتاست MolmoMotion-1M شد که از ۱٫۱۶ میلیون ویدیو ساخته شده و به گفتهٔ تیم، بزرگترین مجموعه از این نوعه. یه بنچمارک انسانیتأییدشده به اسم PointMotionBench با ۲٫۷ هزار کلیپ هم منتشر کردن.
تو آزمایشها، سیاست کنترلی که روی MolmoMotion ساخته شده تو شبیهسازی ۷۶٫۳٪ تسکهای بردار-و-بذار رو موفق انجام داده، در برابر ۵۶٪ برای همون سیاست روی Molmo 2، و سریعتر هم یاد میگیره. تو هدایت ساخت ویدیو هم روی هر پنج معیار حرکتی از مدل پایه بهتر بوده. تیم هم مدل، هم دیتاست و هم بنچمارک رو بازمتن منتشر کرده.
نکات کلیدی:
- MolmoMotion بهجای تشخیص حرکت گذشته، حرکت آیندهٔ یه جسم رو تو فضای سهبعدی پیشبینی میکنه.
- ورودیش یه فریم تصویر، چند نقطه روی جسم و یه دستور متنیه؛ ستون فقراتش هم مدل Molmo 2 هست.
- دو نسخه داره: AR برای مسیرهای مشخص و FM برای حالتهای نامطمئن.
- دیتاست MolmoMotion-1M از ۱٫۱۶ میلیون ویدیو ساخته شده و بزرگترین مجموعه از این نوعه.
- تو ربات و هدایت ساخت ویدیو نتیجهٔ بهتری از مدل پایه گرفته و همهچی بازمتن منتشر شده.




