γ-World انویدیا؛ مدل جهانی چندایجنتی فراتر از دو بازیکن
خلاصهٔ کاملتر
مدلهای جهانی برای تولید ویدیوی تعاملی تا حالا بیشتر روی حالت تکایجنتی تمرکز داشتن، جایی که آینده از یک جریان کنش واحد ساخته میشه. اما خیلی از دنیاهای شبیهسازیشده ذاتاً پرجمعیتان: چند بازیکن، ربات یا ایجنت همزمان در یک محیط مشترک و در حال تحول عمل میکنن. انویدیا با γ-World یک طراحی اصولی برای این حالت ارائه میده.
اولین ایده، Simplex Rotary Agent Encoding است؛ یک بسط بدونپارامتر از 3D RoPE که ایجنتها رو بهعنوان رأسهای یک simplex منظم در فضای زاویهی چرخشی نمایش میده. این به هر ایجنت یک فاز متمایز میده ولی همهی ایجنتها رو متقارن (permutation-equivalent) نگه میداره؛ یعنی هویت ایجنت بدون نیاز به هویت یادگرفتهشده برای هر جایگاه یا ترتیب ثابت، مقیاسپذیر میشه.
ایدهی دوم، Sparse Hub Attention است؛ توکنهای hub یادگرفتنی ارتباط بین ایجنتها رو واسطهگری میکنن و هزینهی توجه بینایجنتی رو از درجهدو به خطی نسبت به تعداد ایجنتها کاهش میدن، که مقیاسپذیری به چهار یا بیشتر رو ممکن میکنه. در نهایت با distillation از یک معلم دوطرفهی چندایجنتی، مدل علّی نهایی میتونه از KV caching برای استریم استفاده کنه و به رولاوت بلادرنگ ۲۴ فریم در ثانیه برسه.
در آزمایشهای محیطهای چندنفره، γ-World نسبت به روشهای مبتنی بر slot و توجه متراکم، وفاداری ویدیو، کنترلپذیری کنش و سازگاری بینایجنتی بهتری داره و مهمتر اینکه از دو به چهار بازیکن بدون آموزش اضافه تعمیم پیدا میکنه. این مدل به هماهنگی چندرباتهی دنیای واقعی هم گسترش پیدا میکنه.
نکات کلیدی:
- γ-World چند ایجنت مستقل و متقارن رو همزمان در یک دنیای مشترک شبیهسازی میکنه
- Simplex Rotary Agent Encoding هویت ایجنت رو متقارن و مقیاسپذیر میکنه
- Sparse Hub Attention هزینهی توجه بینایجنتی رو از درجهدو به خطی میرسونه
- رولاوت بلادرنگ ۲۴ فریم بر ثانیه و تعمیم از دو به چهار بازیکن بدون آموزش تازه




