Toto 2.0: مدل پیشبینی سری زمانی Datadog که با بزرگتر شدن بهتر میشه
خلاصهٔ کاملتر
Datadog امروز Toto 2.0 رو منتشر کرد؛ یه خانواده از مدلهای پیشبینی سری زمانی با وزنهای باز که از ۴ میلیون تا ۲.۵ میلیارد پارامتر رو پوشش میده. سوال اصلی پشت این پروژه سادست: آیا مدلهای پایه سری زمانی (TSFM — Time Series Foundation Model) با بزرگتر شدن بهتر میشن؟ جواب Toto 2.0 مثبته؛ هر سایز بهتر از سایز پایینتر از خودشه و هیچ نشانهای از اشباع حتی در ۲.۵ میلیارد پارامتر دیده نمیشه.
در مقایسه با نسل اول، Toto 2.0 هفت برابر کارآمدتره؛ یعنی مدل ۲۲ میلیون پارامتری نسل جدید همون کیفیتی رو ارائه میده که قبلاً به ۱۵۰+ میلیون پارامتر نیاز داشت. یکی از بهبودهای معماری «Contiguous Patch Masking» یا CPM هست که اجازه میده مدل کل پیشبینی رو در یه پاس موازی تولید کنه به جای اینکه قدمبهقدم پیش بره. نتیجه عملی اینه که پیشبینی ۱۰۲۴ گامه که قبلاً ۱۶ مرحله متوالی میخواست، حالا با یه forward pass انجام میشه.
Toto 2.0 روی سه بنچمارک اصلی رتبه اول رو داره. روی BOOM (بنچمارک اختصاصی Datadog برای متریکهای observability مثل CPU، حافظه و latency) همه سایزها روی مرز Pareto قرار دارن. روی GIFT-Eval (بنچمارک عمومی با ۹۷ دیتاست از حوزههایی مثل انرژی، خردهفروشی و آبوهوا) سه سایز بزرگ در میان مدلهای پایه رتبه اول رو میگیرن. روی TIME که یه بنچمارک جدیدتره و به صورت خاص برای مقاوم بودن در برابر آلودگی داده تست طراحی شده، سه سایز بزرگ سه رتبه اول رو کامل میگیرن.
نکته قابلتوجه اینه که Toto 2.0 در pretraining هیچ داده عمومی پیشبینیای ندیده — فقط روی متریکهای observability و داده مصنوعی آموزش دیده — ولی در بنچمارکهای عمومی رتبه اول رو میگیره. این نشوندهنده قابلیت تعمیم قوی مدله. برای سناریوهای fine-tuning هم نتایج جالبه: یه ensemble از مدلهای Toto 2.0 که وزنگذاریاش رو یاد گرفته، در کل لیدربورد GIFT-Eval که شامل مدلهای fine-tuneشده و agentic هم هست، رتبه اول رو داره.
تیم Datadog در کنار وزنهای مدل، کتابخانه dd_unit_scaling رو هم منتشر کرده؛ یه wrapper برای آموزش توزیعشده با u-μP (روشی برای انتقال هایپرپارامترها از مدل کوچک به بزرگ بدون نیاز به tune مجدد) که با torch.compile، FSDP2 و DDP کار میکنه. هر دو زیر مجوز Apache 2.0 منتشر شدن.
در بخش چشمانداز آینده، تیم به چند چالش باز اشاره میکنه: پایداری در horizonهای بلند — حتی مدل ۲.۵ میلیارد پارامتری در ۸۱۹۲ گام ساختار رو کامل حفظ نمیکنه در حالی که یه مدل آماری کلاسیک روی همون سیگنال ساده extrapolate میکنه. کیورِیشن داده هم یه مشکل جدیه؛ فعلاً مثل NLP با آن برخورد نمیشه. هدف بلندمدتتر، ساختن یه world model کامل برای observability ست که نه فقط متریک، بلکه log، trace، تغییرات کد و رویدادها رو هم مدل کنه.
نکات کلیدی:
- پنج سایز: ۴m، ۲۲m، ۳۱۳m، ۱B، ۲.۵B — همه با مجوز Apache 2.0 روی Hugging Face
- اولین خانواده TSFM که scaling قابلاعتماد و بدون اشباع رو نشون میده
- ۷ برابر بهبود در کارایی پارامتر نسبت به Toto 1.0
- CPM اجازه میده پیشبینی کامل در یه forward pass انجام بشه
- رتبه اول روی BOOM، GIFT-Eval و TIME بدون دیدن داده عمومی در pretraining
- کتابخانه dd_unit_scaling برای آموزش توزیعشده با u-μP هم منتشر شده
- چالشهای آینده: پایداری long-horizon، کیورِیشن داده، و world model برای observability




