Cosmos 3 Edge؛ مدل جهان ۴ میلیاردی انویدیا برای رباتها
خلاصهٔ کاملتر
انویدیا تو یه پست روی Hugging Face از انتشار Cosmos 3 Edge خبر داده: یه مدل جهان اوپن با ۴ میلیارد پارامتر که کارش کمک به رباتها و ایجنتهای بینایی برای فهمیدن محیط، استدلال بلادرنگ و تولید اکشن روی دستگاههای لبهست. استدلال تیم انویدیا اینه که ماشینها تو کارخونه، انبار و بیمارستان کار میکنن، و برای عمل کردن تو همون محیطها به مدلی نیاز دارن که با حافظهٔ محدود، عملکردی در سطح دیتاسنتر بده.
مقاله اول توضیح میده مدل جهان چیه: مدلی که یاد میگیره محیط چطور تو زمان تغییر میکنه و اشیا، حرکت، روابط فضایی و اثر اکشنها رو نمایش میده. مثال خودشون یه ربات در حال برداشتن یه شیئه: تشخیص شیء تازه قدم اوله، ربات باید بدونه شیء کجاست، گریپرش چطور حرکت میکنه، وقتی تماس بگیره چی پیش میاد و کدوم اکشن احتمال بیشتری داره تسک رو کامل کنه.
معماری Cosmos 3 دو برج ترنسفورمری با یه نمایش مشترک داره. برج خودبازگشتی توکنهای بینایی و متن رو برای فهم و استدلال پردازش میکنه، و برج دیفیوژن توکنهای بینایی، صدا و اکشن رو برای پیشبینی، تولید و شبیهسازی نورونی. این دو لایههای نرمالسازی و MLP جدا دارن ولی لایههای توجه چندحالته رو به اشتراک میذارن، پس اطلاعات بین زبان، ویدیو، صدا و اکشن همتراز میشه. الگوی توجه هم با نوع اطلاعات عوض میشه: زبان توجه علّی داره و توکنهای دیفیوژن گستردهتر به کانتکست نگاه میکنن.
یه بخش مهم دیگه، نمایش مشترک اکشنه. سیستمهای فیزیکی اکشن رو جور مختلفی توصیف میکنن — خودرو با وضعیت و حرکت خودش، دوربین با حرکت دوربین، بازوی ربات با وضعیت مجری انتهایی، و دست یا گریپر با وضعیت گرفتن. Cosmos 3 همهٔ اینها رو به یه نمایش مشترک میبره و اکشنها رو بهشکل بردارهای هندسی فشرده رمزگذاری میکنه که جابهجایی، چرخش و وضعیت دستکاری رو در بر میگیره. نتیجهش اینه که ویدیوی تولیدشده فقط یه پیشبینی بصری نیست و نشون میده دنیا در پاسخ به یه اکشن چطور عوض میشه.
از نظر عدد و عملکرد: مدل بهعنوان یه مدل اکشن-جهان پستترینشده روی رزولوشن کنترل ربات (مشاهدات ۶۴۰×۳۶۰) کار میکنه و روی Jetson Thor در هر استنتاج ۳۲ اکشن تولید میکنه، با کنترل بلادرنگ ۱۵ هرتز. بین مدلهای ۴ میلیاردی، انویدیا میگه رتبهٔ اول VANTAGE-Bench برای تحلیل بینایی و سطح state-of-the-art برای یادگیری سیاست ربات رو داره. اجراش هم روی طیفی از سختافزارهای انویدیا شامل RTX PRO، DGX، GeForce RTX و ماژولهای تازهٔ Jetson T2000 و T3000 ممکنه.
کنار مدل پایه، چند چکپوینت پستترینشده و دستور پخت آموزش هم منتشر شده: از جمله Cosmos 3 Edge Policy با آموزش تکمیلی روی دیتاست DROID برای تسکهای بردار-و-بگذار، و چکپوینت Cosmos 3 Super 4-Step که با دیستیلیشن، مراحل دینویزینگ رو از ۳۵ تا ۵۰ به فقط ۴ میرسونه و ادعای تا ۲۵ برابر استنتاج سریعتر با حفظ کیفیت تصویر و ویدیو رو داره.
نقشهٔ راه هم اعلام شده: بهبود تولید جهان تعاملی، شبیهسازی سناریوی رانندگی و سیاستهای رباتیک، بهعلاوهٔ بهینهسازی چکپوینتها با فریمورکهای اوپن مثل vLLM.
نکات کلیدی:
- Cosmos 3 Edge یه مدل جهان اوپن ۴ میلیارد پارامتری برای اجرا روی دستگاه لبهست
- دو برج ترنسفورمری (خودبازگشتی و دیفیوژن) با لایههای توجه چندحالتهٔ مشترک
- نمایش مشترک اکشن برای بدنههای مختلف: جابهجایی، چرخش و وضعیت دستکاری
- روی Jetson Thor: ۳۲ اکشن در هر استنتاج و کنترل بلادرنگ ۱۵ هرتز روی مشاهدات ۶۴۰×۳۶۰
- ادعای رتبهٔ اول VANTAGE-Bench بین مدلهای همین اندازه
- انتشار چکپوینتهای پستترینشده شامل Policy روی DROID و Super 4-Step با ادعای ۲۵ برابر سرعت




