Robostral Navigate؛ ناوبری ربات فقط با یه دوربین ساده
خلاصهٔ کاملتر
میسترال (Mistral) از Robostral Navigate رونمایی کرده؛ اولین مدلش که برای ناوبریِ تجسمیافته (embodied navigation) ساخته شده. این یه مدل ۸ میلیارد پارامتریه که تصویر RGB و یه دستور به زبان ساده رو میگیره و ربات رو تو یه محیط حرکت میده؛ مثلاً دستوری مثل «از لابی خارج شو، از راهرو رد شو، وارد انبار شو و روبهروی قفسهٔ دوم وایسا».
نکتهٔ اصلی اینه که برای این کار، مدلهای دیگه معمولاً از سنسور عمق، لیدار یا چند دوربین با هم استفاده میکنن، ولی Robostral Navigate فقط با یه دوربین معمولی RGB و بدون هیچ سنسور عمقی کار میکنه. با این حال روی بنچمارک R2R-CE (نسخهٔ محیطهای پیوسته) تو حالت «دیدهنشده» به موفقیت ۷۶.۶ درصد رسیده و بهترین روش تکدوربینه رو ۹.۷ امتیاز و بهترین سیستمِ مبتنی بر عمق یا چنددوربینه رو ۴.۵ امتیاز جلو زده.
به گفتهٔ تیم میسترال، مدل مسیر بعدی رو با روش «اشارهکردن» (pointing) پیشبینی میکنه؛ یعنی مختصات نقطهٔ هدف رو تو نمای فعلیِ دوربین ربات بهعلاوهٔ جهتگیریِ موردنظر موقع رسیدن حدس میزنه. این روش برخلاف دستورهای مبتنی بر جابهجاییِ متریک، نسبت به تغییر پارامترهای دوربین و مقیاس دنیا مقاومه. البته اگه هدف بیرون از میدان دید باشه، مدل به جابهجایی تو دستگاه مختصات محلیِ ربات برمیگرده.
این مدل کاملاً از صفر و داخلی ساخته شده و به VLMهای متنباز موجود تکیه نمیکنه. نقطهٔ شروعش یه مدل زبانی-تصویریِ خودِ میستراله که برای کارهای مبتنی بر مکان مثل اشارهکردن، شمردن و پیداکردن اشیا تخصص داره؛ ناوبری هم بهشکل طبیعی از همین تواناییها بیرون میاد. دادهها هم کاملاً تو شبیهسازی تولید شدن و به دیتاستی حدود ۴۰۰٬۰۰۰ مسیر تو ۶٬۰۰۰ صحنه رسیدن.
یکی از اجزای کلیدیِ کار، یه الگوریتم آموزش کارآمد بر پایهٔ prefix-caching هست. با یه استراتژیِ ماسکگذاریِ توجهِ درختی، کل یه اپیزود تو یه دنباله فشرده میشه و آموزش روی همهٔ گامهای زمانی تو یه پاس انجام میشه، بدون اینکه اطلاعات بین گامها نشت کنه. به گفتهٔ تیم، این کار تعداد توکنهای آموزش رو ۲۲ برابر کم میکنه و اجراهایی که ماهها طول میکشیدن رو به چند روز میرسونه.
بعد از مرحلهٔ آموزش نظارتشده، میسترال با یادگیری تقویتیِ آنلاین و الگوریتمی به اسم CISPO عملکرد مدل رو بالاتر برده تا مدل از آزمونوخطا یاد بگیره و از شکستها بلند شه؛ همین بهتنهایی نرخ موفقیت رو ۳.۲ درصد بهتر کرده. نویسندهها میگن هنوز به سقف نرسیدن و Robostral Navigate رو فقط اولین قدم به سمت یه ایجنتِ تجسمیافتهٔ یکپارچه میدونن.
نکات کلیدی:
- Robostral Navigate یه مدل ۸ میلیاردی برای ناوبری رباته
- فقط با یه دوربین RGB و بدون لیدار یا سنسور عمق کار میکنه
- روی بنچمارک R2R-CE به موفقیت ۷۶.۶ درصد رسیده
- روش «اشارهکردن» مسیر بعدی رو تو نمای دوربین پیشبینی میکنه
- prefix-caching توکنهای آموزش رو ۲۲ برابر کم کرده




