فلاکس ۳؛ یک مدل برای تصویر، ویدیو و ربات
خلاصهٔ کاملتر
تو این مقاله اومده که بلک فارست لبز، همون تیم پشت فلاکس ۲، حالا فلاکس ۳ رو معرفی کرده: یه مدل چندوجهی که بهجای چسبوندن چند مدل تخصصی به هم، یک بکبون واحد رو همزمان روی تصویر، ویدیو، صدا و دادهٔ رفتار ربات آموزش داده. یعنی همون درکی که مدل از رفتار نور تو یه فریم ویدیو پیدا کرده، برای حرکت گیرهٔ یه ربات هم به کار میره.
عرضه مرحلهایه: اول تولید ویدیو با صدای بومی، بعد پیشبینی کنش (action prediction) برای تعداد کمی شریک پژوهشی و تجاری، و بعد تولید و ویرایش تصویر. نویسنده این ترتیب رو غیرمنتظره میدونه، چون تولید تصویر عملاً مسئلهٔ حلشدهایه ولی ویدیو نه — سنگینتره، حفظ انسجام زمانی توش سخته و قویترین مدلهای این حوزه تقریباً همه بسته و برای اجرا در مقیاس گرونان.
بخش جالب ماجرا فلاکس میمیکه؛ همکاری با شرکت Mimic Robotics که بکبون فلاکس رو به چیزی تبدیل کرده که بهش مدل ویدیو-کنش میگن: مدلی که با دادهٔ رفتار ربات فاینتیون شده و بهجای پیکسل، حرکت فیزیکی بعدی رو پیشبینی میکنه. شرطبندی تیم اینه که پیشآموزش روی حجم عظیم ویدیو و تصویر، پایهٔ بهتری میسازه تا آموزش از صفر روی دادهٔ کمیاب نمایش ربات.
دموهایی که همراه این اعلام منتشر شده یه بازوی رباتیک رو موقع کار با کابل و اجسام با جهت نامنظم نشون میده، بهعلاوهٔ همکاری با آئودی روی کارهایی مثل جا زدن نوار دور شیشهٔ خودرو. نویسنده تأکید میکنه این هنوز کار پژوهشی با دسترسی محدوده، نه محصول مصرفی، و برای مقایسهٔ جدی با سورا ۲ هم باید منتظر تست مستقل موند. دسترسی فعلاً از راه فرم درخواست تو سایت شرکته.
نکات کلیدی:
- یک بکبون واحد برای تصویر، ویدیو با صدای بومی و پیشبینی کنش ربات
- عرضهٔ مرحلهای: اول ویدیو، بعد کنش، آخر تصویر و ویرایش
- فلاکس میمیک با Mimic Robotics برای کارهای دستکاری بیساختار
- وعدهٔ دسترسی به وزنهای باز، ولی بدون تاریخ مشخص




