حالا سرعت مهمتر از هوش مدلهاست
خلاصهٔ کاملتر
تو این مقاله مارتین آلدرسون میگه برای اولین بار تو دوران کاریش، مدلهای روزمرهش رو بر اساس هوش خام انتخاب نمیکنه بلکه بر اساس سرعت. به گفتهٔ نویسنده، مدلهایی حدود سطح Opus 4.6 برای اکثر کارهای روزانهش — کدنویسی، جمعآوری تحقیق، ساخت اسلاید و تحلیل روی دیتابیسها — بهاندازهٔ کافی باهوش شدن. اون تعریف میکنه وقتی Fable با گاردریلهای بیشتر برگشت، اولین چیزی که حس کرد کندیش بود و خیلی زود برگشت سراغ Opus.
نویسنده یه معیار ساده پیشنهاد میده: همونطور که ۱۰۰ میلیثانیه برای آدم حس «آنی» داره، حدود ۱۰۰ توکن بر ثانیه هم تقریباً همون سرعتیه که آدم میتونه باهاش پیش بره. بازهٔ ۱۰۰ تا ۲۰۰ توکن بر ثانیه به نظرش خیلی سریعه، زیر ۵۰ توکن کند حس میشه و بالای ۲۰۰ حتی یهکم غیرعادیه. البته یادآوری میکنه این عدد دقیق نیست، چون بیشتر زمان مدل صرف استدلال میشه نه تولید خروجی، و نرخ توکن برای متن و کد فرق داره.
به گفتهٔ نویسنده، رسیدن مدلهای وزنباز و کوچیکتر مثل GLM5.2 و DeepSeek V4 Flash به همین سطح کیفیت، بازار رو باز کرده. روی OpenRouter سرعت ارائهدهندههای مختلف برای یه مدل واحد از زیر ۳۰ تا ۱۲۹ توکن بر ثانیه فرق داره، یعنی حالا سر سرعت هم رقابت هست نه فقط سر قیمت. قیمت GLM5.2 به ۰٫۴۲ و ۱٫۳۲ دلار به ازای هر میلیون توکن ورودی و خروجی رسیده؛ حدود ۵ درصد قیمت Opus.
ولی نویسنده هشدار میده این سرعت سقف داره. با اشاره به اصل پارتو و قانون امدال میگه وقتی مدل از ۵۰ به ۲۵۰ توکن بر ثانیه میرسه، پنج برابر شدن سرعت مدل شاید فقط دو برابر شدن سرعت کل نوبت رو بده، چون زمان tool callها روی ماشین محلی و تصمیمگیری خود آدم تکون نمیخوره. بدتر اینکه سریعتر کردن سختافزار محلی هم به خاطر گرون شدن قیمتها زیر فشار AI داره سخت میشه.
در آخر نویسنده پیشبینی میکنه با نسل بعدی GPUها — سری Vera Rubin انویدیا و MI400 ایامدی با حافظهٔ HBM4 — فقط از پهنای باند حافظه دو برابر سرعت خروجی به دست بیاد و تا ۲۰۲۷ مدلهای باکیفیت با قیمت معقول روی ۵۰۰ توکن بر ثانیه ببینیم. سؤال بازش اینه که آیا مدلهای غولپیکر ۲ تا ۳ تریلیون پارامتری واقعاً برای کارهای روزمره تفاوت چشمگیری میسازن یا نه.
نکات کلیدی:
- برای خیلی از کارهای روزمره مدلها بهاندازهٔ کافی باهوش شدن و معیار انتخاب داره میره سمت سرعت.
- حدود ۱۰۰ توکن بر ثانیه معادل حس آنیِ ۱۰۰ میلیثانیهست؛ زیر ۵۰ کنده و بالای ۲۰۰ کمی غیرعادی.
- مدلهای وزنباز مثل GLM5.2 رقابت روی سرعت و قیمت رو شدید کردن، حدود ۵ درصد قیمت Opus.
- سود سرعتِ مدل با گلوگاه tool callها و نظارت انسانی محدود میشه.
- نسل بعدی GPUها با HBM4 میتونه تا ۲۰۲۷ سرعت خروجی رو به ۵۰۰ توکن بر ثانیه برسونه.




