A²RD: ساخت ویدیوهای طولانی با هوش مصنوعی اجنتمحور
خلاصهٔ کاملتر
ساخت ویدیوهای طولانی با هوش مصنوعی یه چالش قدیمیه — هر چی ویدیو طولانیتر بشه، مدلهای معمولی بیشتر دچار «دریفت معنایی» میشن؛ یعنی شخصیتها، محیط، و روایت به مرور از هم میپاشن. A²RD (که مخفف Agentic Autoregressive Diffusion هست) یه معماری جدید از محققان گوگل کلود AI و دانشگاه ملی سنگاپوره که این مشکل رو با جدا کردن «خلق محتوا» از «حفظ انسجام» حل میکنه.
قلب A²RD یه چرخهی چهار مرحلهایه: بازیابی → سنتز → پالایش → بهروزرسانی. سیستم ویدیو رو سگمنتبهسگمنت (بخشبهبخش) میسازه و بعد از هر بخش، حافظهاش رو آپدیت میکنه تا اطلاعات بخشهای قبلی رو از دست نده. این رویکرد کاملاً بدون نیاز به آموزش مجدد (training-free) روی مدلهای دیفیوژن موجود اجرا میشه.
سه ستون اصلی A²RD اینان: اول حافظهی چندوجهی ویدیو که اطلاعات رو در سه قالب نگه میداره — متن (هویت شخصیتها، تغییرات، روابط فضایی)، فریمهای کلیدی، و کلیپهای کامل برای تداوم حرکت. دوم تولید تطبیقی سگمنت که بین دو حالت «اکستراپولیشن» (ساخت از فریم شروع به جلو) و «اینترپولیشن» (اتصال دو فریم مشخص) بسته به نیاز جابجا میشه. سوم بهبود سلف-ایمپروومنت سلسلهمراتبی (HITS) که اول فریمهای مرزی و بعد کل سگمنت رو اصلاح میکنه تا خطاها انتشار پیدا نکنن.
گردش کار سیستم دو مرحله داره: در مرحله اول (مقداردهی اولیه حافظه)، یه «اجنت» روی روایت کلی استدلال میکنه، موجودیتها و محیطها رو شناسایی میکنه، یه گراف وابستگی میسازه و فریمهای مرجع اولیه رو تولید میکنه. در مرحله دوم، هر سگمنت به صورت اتورگرسیو (خودبازگشتی) ساخته، بهبود داده، و به حافظه اضافه میشه.
محققان همچنین یه بنچمارک جدید به اسم LVBench-C معرفی کردن که شامل داستانهای چند صحنهای در مقیاس ۳، ۵، و ۱۰ دقیقهست و بهطور خاص برای سناریوهایی طراحی شده که شخصیتها و محیطها ظاهر میشن، ناپدید میشن و دوباره برمیگردن — درست جایی که روشهای موجود بیشتر شکست میخورن.
نتایج نشون میده A²RD نسبت به بهترین روشهای رقیب مثل MovieAgent و ViMax تا ۳۰٪ در ثبات بصری و ۲۰٪ در انسجام روایت بهتر عمل میکنه. این سیستم قادره ویدیوهای یک تا ده دقیقهای رو با داستانهای پیچیده و چند صحنهای بسازه.
نکات کلیدی:
- A²RD با چرخهی بازیابی–سنتز–پالایش–بهروزرسانی، انسجام ویدیوهای بلند رو حفظ میکنه
- سیستم training-free هست و روی مدلهای دیفیوژن موجود کار میکنه
- حافظهی چندوجهی اطلاعات متنی، فریمهای کلیدی، و کلیپهای ویدیو رو ذخیره میکنه
- HITS خطاها رو در دو سطح فریم و سگمنت قبل از انتشار برطرف میکنه
- بنچمارک LVBench-C برای تست ویدیوهای ۳ تا ۱۰ دقیقهای معرفی شده
- تا ۳۰٪ بهبود در ثبات و ۲۰٪ بهبود در انسجام روایت نسبت به روشهای پیشین




