کوئن ۳.۸ ۲۷B: مدل لوکالی که با غولها رقابت میکنه
خلاصهٔ کاملتر
به گزارش مایایندستودیو، کوئن ۳.۸ ۲۷B یه مدل متراکم (dense) با ۲۷ میلیارد پارامتره که تیم Qwen وابسته به علیبابا منتشرش کرده و یکی از قویترین مدلهاییه که میشه رو سختافزار شخصی یا نیمهحرفهای اجراش کرد. این مدل هم متن میفهمه هم تصویر (یعنی چندوجهیه) و یه تنظیم reasoning effort داره که میزان «فکر کردن» مدل قبل از جواب دادن رو کنترل میکنه.
تو بنچمارک artificial analysis agentic index که میزان توانایی مدل تو کارهای ابزارمحور و وظیفهمحور رو میسنجه، این مدل نمره ۵۱ گرفته و فقط از کیمی K2 -با ۲٫۸ تریلیون پارامتر- عقبتر مونده. نویسنده میگه این فاصلهٔ عجیب بین اندازه و عملکرد ممکنه نشونهٔ «بنچمکسینگ» (تنظیم مدل مخصوص بنچمارک) باشه، ولی چون تو تستهای واقعی کدنویسی و تحلیل تصویر هم نتیجه مشابه گرفته، این احتمال کمتره. سطح هوش عمومیش هم به کلود ۴.۸ روی حالت max reasoning نزدیکه، مدلی که چند ماه پیش state-of-the-art بود.
تو تستهای تصویری، مدل نهتنها توصیف دقیقی از عکس میده، بلکه وقتی خواستن با OpenCV تحلیلش کنه، خودش یه پایپلاین پایتون نوشته و لبهها و گوشههای اشیا رو تشخیص داده -بدون هیچ API بینایی بیرونی. تو شمارش اشیا هم که معمولاً نقطهضعف مدلهای زبان-تصویره، کوئن با تقسیم عکس به بخشهای کوچیکتر و شمارش قسمت به قسمت، به عدد نزدیک به واقعی رسیده (هرچند تو شمارش ماشینهای سفید، عدد رو کمی بیشتر اعلام کرد). جالبتر اینکه مدل میتونه مختصات پیکسلی دقیق دور اشیا بکشه، بدون استفاده از یه مدل تشخیص شیء جدا.
سطح reasoning effort چهار حالت داره: خاموش، کم، متوسط و خیلی زیاد، و تاثیرش رو کیفیت خروجی خیلی زیاده. تو یه تست ساخت وبسایت معرفی خود مدل، حالت خاموش خروجی پر از اطلاعات ساختگی داد، حالت کم نتیجهٔ قابل قبولی ساخت، و حالت متوسط با مصرف حدود ۸۶۰ هزار توکن ورودی و ۳۸ هزار خروجی تو ۶۳ دقیقه، از حالت خیلی زیاد (۵۰۰ هزار ورودی و ۶۰ هزار خروجی تو ۸۶ دقیقه) بیشتر توکن خورد. یعنی زیاد کردن reasoning همیشه نتیجهٔ بهتر نمیده و گاهی کل بودجهٔ توکن صرف فکر کردن میشه و چیزی برای جواب نمیمونه.
رو یه کلاستر دو تایی NVIDIA DGX Spark با نسخهٔ کوانتایز NVFP4، سرعت تولید تکرشتهای بین ۱۵ تا ۲۰ توکن در ثانیه بود که با اجرای همزمان چند درخواست به ۶۰ تا ۷۰ توکن در ثانیه میرسه. کاربرای اپل سیلیکون بهتره از نسخهٔ MLX استفاده کنن و رو لینوکس و ویندوز هم vLLM و SGLang گزینههای سرو هستن. این مدل با فریمورکهای agentic مثل DeepSeek Harness هم خوب جواب میده، ابزاری که تو یه هفته بعد از انتشار بیش از ۶۰ هزار ستاره تو گیتهاب گرفت و امکان ثبت کامل مسیر اجرای هر ابزار و استدلال مدل رو میده.
نکات کلیدی:
- کوئن ۳.۸ ۲۷B نمره ۵۱ رو بنچمارک artificial analysis agentic index گرفته، فقط پشت سر کیمی K2 با ۲٫۸ تریلیون پارامتر
- سطح هوشش به کلود ۴.۸ روی max reasoning نزدیکه
- رو دو تا DGX Spark با کوانتایز NVFP4، سرعتش بین ۱۵ تا ۷۰ توکن در ثانیه (بسته به همزمانی) بوده
- reasoning effort چهار حالت داره: خاموش، کم، متوسط، خیلی زیاد؛ حالت متوسط گاهی از خیلی زیاد هم بیشتر توکن مصرف میکنه
- با DeepSeek Harness که بیش از ۶۰ هزار ستارهٔ گیتهاب داره سازگاره




