تست کور مدلها: واقعاً فرقشون رو میفهمی؟
خلاصهٔ کاملتر
اندرو چن تو یه رشتهتوییت که خودش اسمش رو «چالش پپسی برای مدلهای زبانی» گذاشته، وسط هفتهای پر از عرضهٔ مدلهای تازه یه موضع خلاف جریان گرفته. حرفش اینه که همهٔ ما کلی «پرامپت معمولی» میزنیم: چیزهایی که در عمل شبیه سرچ گوگلن — «اسم فلان چی بود»، «راسته که…»، «بهترین فلان کدومه». اینا شاید سهم بزرگی از ارزش تولیدشده نداشته باشن، ولی سهم بزرگی از کل پرامپتها هستن.
سؤال اصلیش اینه: اگه همین پرامپتها رو به مدلهای مختلف پیشرو بدی، میتونی از روی کیفیت خروجی تشخیص بدی کدوم کدومه؟ به نظر او نه؛ همهٔ ما تو یه تست کور رد میشیم، چون مدلها دیگه «بهقدر کافی خوب»ـن. نتیجهگیریش اینه که برای بخش بزرگی از کاربردها به نقطهٔ بازده نزولی رسیدیم.
پیامد اولی که میشمره سهم مدلهای متنبازه. به گفتهٔ او مدلهای وزنباز حدود ۱۸ تا ۲۴ ماه عقبترن، ولی وقتی سؤال بالا رو دربارهٔ همونها بپرسی جواب فرقی نمیکنه؛ خودش با مدلهایی مثل Qwen 27b روی سختافزار مک همین تست رو کرده و میگه برای پرامپتهای معمولی عالیان. انگیزهٔ NVIDIA و اپل و حتی سازندههای گوشی مثل سامسونگ هم اینه که مدل وزنباز رو بهعنوان مکمل سختافزارشون میزبانی کنن.
پیامد دوم رفتن قیمت به سمت صفره. او پیشبینی میکنه هوش مصنوعی رایگان و تبلیغاتی تو بازار مصرفی جا باز کنه، بهویژه تو بازارهای در حال توسعه و بخشهایی که اشتراک ماهانه براشون معنا نداره، و اشتراک و مصرفمحور بیشتر تو کاربردهای B2B بمونه؛ افق زمانیای که میگه ۱۲ تا ۱۸ ماهه.
پیامد سوم و چهارم دربارهٔ میدان رقابته: وقتی تفاوت کیفیت کم شد، رقابت به حریم خصوصی، اتصالپذیری، رایگان بودن و بستهبندی منتقل میشه و به تعبیر او خندق واقعی همون لایهٔ محصول و harness دور مدله. البته تأکید میکنه مدلهای پیشرو از بین نمیرن؛ برای کدنویسی، علم، تولید جهان و جایگزینی نیروی کار همچنان یه مدل رو به بقیه ترجیح میدی — فقط به نظرش بیش از ۹۰ درصد کاربردهای مصرفی به مدل مرزی نیاز ندارن.
شاهدی که میآره خود بنچمارکهاست: میگه پررنگشدن بنچمارک تو معرفی مدلهای تازه دقیقاً یعنی تفاوتها دیگه به چشم نمیان و باید با عدد نشون داده بشن. خودش هم Grok 4.5 و Fable رو برای چند آزمایش کدنویسی امتحان کرده و میگه باید واقعاً وقت بذاری تا تفاوتها رو حس کنی.
قیاس پایانیش هم به دوران قدیم کامپیوتر برمیگرده: زمانی همهچیز با مگاهرتز و مگابایت سنجیده میشد و صنعت PC خودش رو همینجوری مقایسه میکرد، بعد جاش رو به طراحی و مصرف انرژی داد. به نظر او امروز هم با بنچمارک و هزینه بهازای توکن همون کار رو میکنیم و این معیارها بهزودی عوض میشن.
نکات کلیدی:
- سهم بزرگی از پرامپتها شبیه سرچهای سادهست، نه کارهای مرزی
- برای همین دسته، مدلها «بهقدر کافی خوب» شدن و تست کور فرقی نشون نمیده
- مدلهای وزنباز با تأخیر ۱۸ تا ۲۴ ماه، سهم اصلی کوئریها رو میگیرن
- قیمت به سمت صفر و مدل تبلیغاتی در بازار مصرفی
- تمایز به حریم خصوصی، بستهبندی و لایهٔ محصول منتقل میشه
- مدلهای پیشرو برای کد، علم و کارهای سنگین سر جاشون میمونن




