اجرای محلی اورنیث ۱.۵: مدلی که خودش کدشو تست میکنه
خلاصهٔ کاملتر
اورنیث ۱.۵ ۳۵B-A3B یه مدل زبانی mixture-of-experts هست که رو معماری Qwen3.5-MoE ساخته شده: ۳۵ میلیارد پارامتر کل داره ولی فقط حدود ۳ میلیاردش برای هر توکن فعال میشه. برخلاف اورنیث ۱، که حوزه محدودتری داشت، این نسخه بهعنوان یه مدل همهکاره برای کدنویسی، استدلال و وظایف عاملمحور معرفی شده. آموزشش هم با یه حلقه خودبهبودی انجام شده که همزمان تولید وظیفه، ساخت اسکفولد و تولید راهحل رو با یادگیری تقویتی GRPO بهینه میکنه، بهجای اینکه فقط رو دادههای ثابت انسانی تکیه کنه.
تو یه تست محلی، این مدل با vLLM روی یه GPU تک Nvidia A100 با ۸۰ گیگابایت حافظه سرو شده و مدل بههمراه کش KV حدود ۷۴ گیگابایت مصرف کرده، یعنی فضای زیادی برای context بلندتر یا درخواستهای همزمان نمیمونه مگر اینکه اندازه کش KV کم بشه. چون فقط ۳ میلیارد پارامتر از ۳۵ میلیارد فعال میشه، هزینه محاسباتی هر توکن خیلی کمتر از یه مدل معمولی هماندازهست، هرچند کل وزنها هنوز باید تو حافظه بمونن.
جالبترین بخش تست، یه وظیفه باز روی یه اپ واقعی و درحالکار بود: یه ردیاب قیمت کریپتو با بکاند FastAPI، پراکسی Nginx، فید قیمت WebSocket و لایه تاریخچه Redis که همه رو Docker اجرا میشدن. به مدل فقط گفته شد یه قابلیت هشدار قیمت لحظهای اضافه کنه و قبل از تموم کردن ثابت کنه که کار میکنه؛ مدل خودش کدبیس رو کاوش کرد، برنامهریزی کرد، متوجه شد یه پورت مورد نیازش قبلاً توسط خود vLLM اشغال شده، خودشو تطبیق داد، و در نهایت تست نوشت و نتیجه رو قبل از اعلام پایان کار بررسی کرد.
تو یه آزمون دیگه برای استدلال عمومی، از مدل خواسته شد یه نقش پیچیده بازی کنه: با دو تا اعتراف همزمان و متناقض که هر دو ریسک سیاستی داشتن روبهرو بشه و یه تصمیم روشن بگیره، اونم درحالیکه باید به ژاپنی رسمی و اسپانیایی طبیعی جواب بده. مدل تحت این فشار منسجم موند، یه تصمیم مشخص گرفت (رد هر دو طرف) و پاسخهای قابلفهم به هر دو زبون بههمراه ترجمه انگلیسی ارائه داد.
نویسنده نتیجه میگیره برای هرکسی که به یه GPU ۸۰ گیگابایتی دسترسی داره، اورنیث ۱.۵ گزینه واقعبینانهایه برای اجرای محلی کارهای کدنویسی عاملمحور و استدلال عمومی؛ نکته مهمتر از عدد بنچمارک، همین توانایی خودبررسی و خودتستزنی مدله که برای کارهای واقعی بیشتر به درد میخوره.
نکات کلیدی:
- اورنیث ۱.۵ یه مدل MoE با ۳۵ میلیارد پارامتر کل و ۳ میلیارد فعاله، ساختهشده رو معماری Qwen3.5-MoE.
- روی یه GPU A100 با ۸۰ گیگ حافظه و vLLM، مدل بههمراه کش KV حدود ۷۴ گیگ مصرف میکنه.
- تو یه تست عملی، بدون راهنمایی گامبهگام یه قابلیت هشدار قیمت به یه اپ کریپتو واقعی اضافه کرد و خودش تستش کرد.
- تو یه چالش استدلال چندزبانه (ژاپنی و اسپانیایی)، تصمیم منسجم و قابلفهمی گرفت.
- تحت لایسنس MIT روی Hugging Face منتشر شده و بهصورت ۱۶ shard safetensors توزیع میشه.




