گرم نگهداشتن کش پرامپت: هر ۳۰ ثانیه اشتباهه
خلاصهٔ کاملتر
نویسنده میگه کش پرامپت یکی از بهترین معاملههای APIهای مدلهای زبانیه: اگه همون پیشوندی رو بفرستی که سرور لحظاتی پیش پردازشش کرده، حدود یکدهم قیمت ورودی رو میدی و بیشتر تأخیر prefill رو هم رد میکنی. مشکل اینجاست که این کش تو چند دقیقه منقضی میشه و ایجنتها بدترین مصرفکنندهشن؛ ایجنت یه درخواست میفرسته، بعد یه بیلد یا تست یا تأیید انسانی دهدقیقهای طول میکشه و وقتی برمیگرده، کش مرده و باید کل هزینه و تأخیر رو از اول بده.
دفاع شناختهشده اینه که وسط همون مکث، پیشوند رو با یه تایمر دوباره بفرستی تا TTL تازه بشه؛ اسمش keepalive ـه. عرف رایج پینگ هر ۳۰ ثانیهست، ولی به گفتهٔ نویسنده حسابکتابش سادهست: هر پینگ قیمت خوندن از کش (حدود ۱۰٪ ورودی) رو برمیداره، پس خرج هر ساعت با ۱/τ کم میشه و بازهٔ بزرگتر هیچ ضرری جز ریسک TTL نداره. یعنی بهترین بازه بزرگترین عددیه که امن زیر TTL بمونه — با TTL پنجدقیقهای Anthropic حدود ۴ دقیقه.
نویسنده چهار ارائهدهنده رو با دو اندازهٔ پیشوند، فاصلههای بیکاری تا ده دقیقه و سه اجرای مستقل تست کرده و میگه سه رژیم متفاوت دیده. Anthropic یه TTL سفت داره: تو ده دقیقه هیچکدوم از ۴۸ نمونهٔ بدون پینگ گرم نموند، ولی با keepalive هر ۴۰ نمونه گرم موند. DeepSeek نشتی داره، چون پینگ یه ماشین رو گرم میکنه و درخواست بعدی ممکنه جای دیگه بشینه. کش OpenAI و Google هم چسبندهست و اغلب خودش تا ده دقیقه زنده میمونه.
نتیجهٔ پولی جالبتره: تو مکث دهدقیقهای روی یه پیشوند ۱۰۰ هزار توکنی، فقط Anthropic با keepalive چهاردقیقهای صرفه داره و حدود ۳۸٪ ارزونتر از رها کردن کش تموم میشه. روی DeepSeek این کار فقط تأخیر رو کم میکنه (اولین توکن از ۵.۴ ثانیه به ۱.۴ تا ۲ ثانیه)، و روی OpenAI و Gemini هیچ فایدهای نداره؛ Gemini حتی ۴۰٪ گرونتر درمیاد چون خوندن از کشش ۰.۲۵ برابره نه ۰.۱. بازهٔ ۳۰ ثانیهای هم روی هر چهار تا ضرر میده و ۷.۸ برابر گرونتر از بازهٔ چهاردقیقهای بود.
نکتهای که نویسنده بیشتر از همه روش تأکید میکنه، نقطهٔ سربهسره: هر پینگ مثل حق بیمهست و تنها خسارتی که پوشش میده، همون prefill دوبارهست. با قیمتهای Anthropic این خط حدود ۴۶ دقیقه مکثه (حدود ۳۶ دقیقه برای OpenAI و DeepSeek و فقط ۱۲ دقیقه برای Google)؛ بعد از اون عاقلانهتره بذاری کش بمیره. نویسنده در آخر حدس میزنه اگه همه این کارو بکنن، رتبهبندی eviction ارائهدهندهها بیاثر میشه و مجبور میشن ماندگاری کش رو مستقیم بر اساس توکن-ساعت حساب کنن.
نکات کلیدی:
- بازهٔ بهینهٔ پینگ حدود ۴ دقیقهست، نه ۳۰ ثانیه؛ هزینه با بزرگتر شدن بازه کم میشه.
- تو مکث دهدقیقهای فقط Anthropic با keepalive صرفه داره، حدود ۳۸٪ ارزونتر.
- روی DeepSeek این کار یه بازی سرعته نه پول: تأخیر اولین توکن از ۵.۴ به ۱.۴ تا ۲ ثانیه میرسه.
- کش OpenAI و Gemini چسبندهست و اغلب خودش زنده میمونه، پس پینگ فقط خرج اضافهست.
- بعد از نقطهٔ سربهسر (حدود ۴۶ دقیقه با قیمتهای Anthropic) بهتره بذاری کش بمیره و دوباره prefill کنی.




