Stable Audio 3.0؛ خانواده مدلهای موسیقی متنباز Stability AI
خلاصهٔ کاملتر
Stability AI از Stable Audio 3.0 رونمایی کرد؛ خانوادهای از مدلهای تولید صدا که هدفشون گذاشتن یک پایه محکم برای جامعه توسعهدهندگان صوتیه. سه مدل از این چهار مدل، وزنهای باز (open-weight) دارن و رایگان قابل دانلود و استفادهان. نکته مهم اینه که تمام این مدلها روی دادههای کاملاً لایسنسدار آموزش دیدن، پس خروجیهایی که باهاشون میسازی متعلق به خودته.
این خانواده از چهار مدل تشکیل شده که هر کدوم برای یک سناریوی استفاده متفاوت طراحی شدن:
- Small SFX: ساخت افکتهای صوتی (sound effects) روی گوشی موبایل یا لپتاپهای معمولی
- Small: ساخت موسیقی کامل روی دستگاه (on-device)
- Medium: کیفیت موسیقایی بالاتر و تولید آهنگ تا ۶ دقیقه و ۲۰ ثانیه
- Large: پیشرفتهترین مدل خانواده، مخصوص پلتفرمهای موسیقی و اپلیکیشنهایی که به تولید با تأخیر کم و حجم بالا نیاز دارن
یکی از مهمترین پیشرفتهای فنی این نسخه، تولید با طول متغیر (variable-length generation) با دقت یک ثانیهایه. مدل Small میتونه تا دو دقیقه تولید کنه، که در مقایسه با ۱۱ ثانیه نسخه قدیمی Stable Audio Open Small، جهش بزرگیه. مدلهای Medium و Large هم بیش از شش دقیقه تولید میکنن.
قابلیت دیگهای که برای اولین باره معرفی میشه، پشتیبانی از LoRA برای فاینتیون مدلهاست. LoRA یک روش سبکوزن برای شخصیسازی مدلهای هوش مصنوعیه که اول در تولید تصویر رایج شد و حالا داره به حوزه صوت هم میرسه. Stability AI مستندات آموزشی LoRA رو همراه با وزنهای Small و Medium منتشر کرده.
قابلیت Audio Inpainting هم به این مدلها اضافه شده. یعنی میشه بخشی از یک آهنگ رو ویرایش کرد، چند بخش مختلف رو همزمان تغییر داد، یا آهنگ رو از نقطهای که تمام شده ادامه داد، بدون اینکه از صفر شروع کنی.
از نظر لایسنس، مدلهای Small SFX، Small و Medium برای همه آزادن. اگه درآمد سازمانت زیر یک میلیون دلار در ساله، با Stability AI Community License میتونی خروجیها رو توزیع و تجاریسازی کنی. سازمانهای بزرگتر باید از Enterprise License استفاده کنن که شامل پوشش قانونی (indemnification) هم میشه. مدل Large هم از طریق API و استقرار خصوصی برای سازمانها در دسترسه.
نکات کلیدی:
- چهار مدل با اندازههای مختلف برای نیازهای متفاوت، از موبایل تا سرور
- اولین مدل متنباز قادر به ساخت موسیقی کامل روی دستگاه بهصورت آفلاین
- تولید صدا با طول متغیر تا بیش از ۶ دقیقه در مدلهای Medium و Large
- پشتیبانی از LoRA برای شخصیسازی مدل با کتابخانه موسیقی خودت
- قابلیت Audio Inpainting برای ویرایش، بازسازی و ادامهدادن آهنگ
- آموزش روی دادههای کاملاً مجاز و مالکیت خروجی برای کاربر




