مدلِ محلی، «تقریباً اپوس» نیست
خلاصهٔ کاملتر
نویسنده که بنیانگذارِ چند محصولِ زیرساختی مثلِ OpenFaaS و Actuated ـه، میگه برخلافِ ادعاهای پرسروصدا تو شبکههای اجتماعی، مدلهای محلی «تقریباً اپوس» نیستن. مثال میزنه که Qwen 3.6 27B تو بنچمارکِ SWE-Bench Verified نمرهی ۷۷.۲ میگیره در برابرِ ۸۸.۶ برای Claude Opus 4.8؛ ولی این فاصلهی ۱۲ درصدی گولزنندهست، چون تعدادِ پارامترها (نیم تا دو تریلیون برای مدلهای پیشرو) با سختِافزارِ خانگی اصلاً همرده نیست.
پس چرا سراغِ محلی میره؟ نویسنده میگه دلیلش هزینه، حاکمیت و حریمِ خصوصیه. برای بارِ کاریِ سنگین و حلقههای خودکار، هزینهی توکنیِ مدلِ ابری زود سر به فلک میذاره؛ حتی Uber سقفِ خرجِ AI رو ۱۵۰۰ دلار در ماه برای هر توسعهدهنده گذاشته. مهمتر از اون، اون نمیتونه دادهی حساسِ مشتری رو رو هیچ سرویسِ ابریای بریزه، پس مدلِ محلیِ ایزوله تنها گزینهست.
برای همین یه کارتِ RTX 6000 Pro Blackwell با ۹۶ گیگ حافظه خرید (حدودِ ۱۲ هزار دلار، الان نزدیکِ ۱۵ هزار). میگه این کارت هزینهشو درآورد: با اجرای مدل روی دادهی حساس، هم ابزارِ تشخیصِ مشکلِ مشتری رو تو یه ماشینِ مجازیِ ایزوله اجرا میکنن، هم یه بار از دلِ تلهمتری فهمیدن یه مشتری ۱۲ ماه لایسنسِ کمتری گزارش کرده و همون بازیابیِ درآمد پولِ کارت رو داد.
ولی ضعفِ اصلی رو هم رک میگه: حلقههای بیپایان و توهم. نویسنده اینو به فرآیندِ آبدیدنِ فولاد تشبیه میکنه که اگه یه درجه از رنگِ درست رد بشی باید از اول شروع کنی؛ مدلِ محلی هم انگار «داغ» کار میکنه، از هدف رد میشه و میافته تو تکرار. مثلاً وقتی خواسته دستوری به faas-cli اضافه کنه، نیمساعت همون پیشنهادها رو تکرار کرد و ۶۰۰ واتِ برق سوزوند.
ستاپِ فعلیِ تیمش دو نمونهی مستقلِ llama.cpp رو با کانتکستِ کامل سرو میکنه و با کدگشاییِ گمانهزنانهی MTP (نرخِ پذیرشِ ~۹۳٪) سرعت رو از ۶۷ به ۱۳۰ تا ۲۰۰ توکن بر ثانیه میرسونه. جمعبندیش اینه که مدلِ محلی یه ابزارِ متفاوته، نه یه Opusِ ارزون؛ برای کارهای مرزبندیشده و خوندنِ کدبیس عالیه، ولی نباید کارِ طولانی و بینظارت بهش سپرد.
نکات کلیدی:
- Qwen 3.6 27B نمرهی ۷۷.۲ در برابرِ ۸۸.۶ Opus میگیره، ولی فاصلهی واقعی خیلی بیشتره
- ارزشِ واقعیِ مدلِ محلی تو حریمِ خصوصی، حاکمیتِ داده و هزینهی ثابته، نه صرفاً ارزونبودن
- بزرگترین ضعفش حلقههای بیپایان و توهمه، مخصوصاً با کوانتیزهسازیِ پایین و کارهای طولانی
- کوانتیزهسازی، طولِ کانتکست و تنظیماتِ کارتِ مدل روی کیفیت خیلی اثر داره
- بهترین کاربردش پشتیبانیِ مشتری، نگهداریِ مرزبندیشده و خوندن/توضیحِ کدبیسه، نه نوشتنِ بینظارتِ کد




