بنچمارکهای اورنیث ۱.۵: کجای Qwen3.6 و مدلهای بزرگتر رو زده؟
خلاصهٔ کاملتر
اورنیث ۱.۵ ۳۵B-A3B یه مدل زبانی از نوع mixture-of-experts هست (یعنی بهجای اینکه کل شبکه برای هر توکن فعال بشه، فقط چند تا «کارشناس» کوچیک از بین ۳۵ میلیارد پارامتر کل انتخاب و فعال میشن، حدود ۳ میلیارد پارامتر). این مدل رو شرکت Deep Reinforce با گسترش نسخه قبلی، اورنیث ۱.۰، ساخته که خودش روی Qwen3.5 و Gemma4 با آموزش اضافه بنا شده بود.
طبق کارت مدل رسمی، اورنیث ۱.۵ تو تقریباً همه بنچمارکهای کدنویسی و عاملمحور از رقیب همردهش یعنی Qwen3.6-35B-A3B جلو زده و حتی مدلهای بزرگتری مثل Gemma 4-31B و Muse Glimmer-30B رو هم با فاصله زیاد پشت سر گذاشته. مثلاً تو SWE-bench Verified نمره ۷۹ گرفته، در حالی که Qwen3.6-35B فقط ۷۳.۴ و حتی Qwen3.5-397B که ۱۱ برابر بزرگتره، ۷۶.۴ گرفته. تو DeepSWE فاصله از همه بیشتره: اورنیث ۱.۵ نمره ۲۲ گرفته ولی Qwen3.6-35B و Gemma 4-31B هر دو صفر شدن.
نویسنده میگه این عملکرد نتیجه یه حلقه خودبهبودیه که فراتر از چیزیه که تو اورنیث ۱.۰ بود: مدل بهجای اینکه فقط رو یه سری وظیفه ثابت انسانی تمرین ببینه، خودش وظیفه، اسکفولد (چارچوب حل مسئله) و چند راهحل کاندید تولید میکنه، به هر کدوم امتیاز میده و بعد با یادگیری تقویتی GRPO هم اسکفولد و هم راهحلها رو با هم بهبود میده.
تو بخش استدلال محض داستان فرق میکنه: رو HLE با ابزار، اورنیث ۱.۵ نمره ۳۳.۴ گرفته که خیلی از نمره ۴۸.۳ مدل غولپیکر Qwen3.5-397B عقبتره. یعنی برای وظایف کدنویسی و عاملمحور، اورنیث ۱.۵ گزینه قویایه، ولی برای استدلال محض هنوز مقیاس مدل حرف اول رو میزنه.
نویسنده تاکید میکنه چون فقط ۳ میلیارد از ۳۵ میلیارد پارامتر برای هر توکن فعال میشه، هزینه اجرا به یه مدل کوچیکتر نزدیکتره تا یه مدل ۳۵ میلیاردی معمولی؛ تو یه تست عملی، این مدل رو یه GPU A100 با vLLM اجرا شده و حدود ۷۴ گیگابایت حافظه گرفته.
نکات کلیدی:
- اورنیث ۱.۵ یه مدل MoE با ۳۵ میلیارد پارامتر کل و ۳ میلیارد فعاله.
- تو SWE-bench Verified نمره ۷۹ گرفته، بالاتر از Qwen3.6-35B (۷۳.۴) و حتی Qwen3.5-397B (۷۶.۴).
- تو DeepSWE نمره ۲۲ گرفته در حالی که رقبای همرده صفر شدن.
- تو HLE با ابزار (۳۳.۴) هنوز از Qwen3.5-397B (۴۸.۳) عقبه.
- روی یه GPU A100 با vLLM حدود ۷۴ گیگابایت حافظه مصرف میکنه.




