این پست توضیح میده چطور حافظهی مجازی سیستمعامل، با اسم PagedAttention، رو کش KV مدلهای زبانی پیاده شده و باعث میشه هر GPU دو تا چهار برابر کاربر بیشتر سرویس بده.
تیم IT الاستیک با رصد دقیق اپلیکیشنهای هوش مصنوعیش، ۲.۵ میلیون دلار زمان عملیاتی برگردوند؛ این مقاله میگه بیشتر شرکتها هنوز حتی این کارو شروع نکردن.
یه برنامهنویس با یه ترفند ریاضی کوچیک، الگوریتمی نوشته که فقط با یه ضرب و شیفت بیتی سریعتر از راهحلهای معروف مثل کار Cassio Neri روز هفته رو حساب میکنه.
با یه شبیهساز مرورگری از Kubernetes، ngrok نشون میده چرا بدون پراب درست، ریستارت یه کانتینر میتونه درخواستهای واقعی رو گم کنه.
یکی فصل معروف کتاب مقیاسدهی مدلهای ترنسفورمر (اثر تیم Jax-ML) رو تبدیل کرده به یه صفحهٔ تعاملی؛ هر فرمول رو با اعداد واقعی چند تراشه امتحان میکنی و میبینی کجا شبکه گلوگاه میشه.
سربراس با تراشه جدید CS-4 نشون داده که میشه پردازندههای عظیم رو بدون سوییچ شبکه به هم وصل کرد؛ کاری که هم تاخیر رو کم میکنه هم هزینه زیرساخت رو.
Vendo، پروژه متنباز مورد حمایت Y Combinator، به کاربرهای محصولت اجازه میده خودشون فیچر و اپ کوچیک بسازن، درست همونجا تو محصول.
سازمانهای دولتی چین با وجود نسخه اختصاصی و امنسازیشده ویندوز ۱۰ که مایکروسافت و یه شرکت چینی با هم ساخته بودن، دارن اون رو کنار میذارن و دنبال جایگزین بومی میگردن.
یه ابزار خطفرمانی متنباز به اسم CipherRun اومده که با Rust نوشته شده و میتونه امنیت TLS و SSL یه سایت رو از چند زاویه بررسی کنه، از پروتکل تا گواهی و باگهای شناختهشده.
Qwak یه پلتفرم رایگان و متنبازه که تولید متن، RAG، فاینتیون و حتی تولید تصویر و ویدیو رو با یه نصب NPM، کاملا آفلاین رو سیستم خودت اجرا میکنه.
بر اساس گزارش Ookla، پذیرش روترهای وایفای ۷ تو آمریکا از صفر به ۷.۲ درصد رسیده؛ این رشد بیشتر بهخاطر فشار خود ISPهاست، نه انتخاب مشتریها.
تیم LMSys با یه سری ترفند مهندسی سرعت اجرای DeepSeek-V4-Pro رو روی GPUهای ارزونتر H20 اونقدر بالا برده که فاصلهش با گرافیکهای گرونقیمت B300 به کمتر از یکونیم برابر رسیده.
یه روش تازه به اسم DFlash 2 با پیشبینی موازی توکنها، سرعت تولید متن مدل Qwen3.8-27B رو تقریبا دو برابر کرده، اونهم بدون اینکه کیفیت خروجی افت کنه.
به گفتهٔ یه تحلیل جدید از AMP PBC، خرید OpenRouter توسط استرایپ ربطی به روتینگ یا صورتحساب نداره؛ بلکه یه حرکت استراتژیک برای امنیت و آلاینمنت هوش مصنوعیه.
روش تازهای برای اجرای امن ایجنتهای کدنویسی مثل Claude Code و Codex: هرکدوم تو یه ماشین مجازی سبک و ایزوله اجرا میشن که دسترسی به فایل و شبکهشون کاملاً کنترلشدهست.
حتی اگه دو فروشنده روی فرمت کش KV توافق کنن، بازم جابهجا کردنش بین GPU و تراشهی ویفری Cerebras سخته؛ چون شبکه فقط به یه لایه از حافظه دسترسی داره.
گزارش تازه VDURA نشون میده قیمت SSDهای سازمانی توی یک سال به ۶.۵ برابر رسیده و این وضعیت داره معماری استوریج AI Factoryها رو عوض میکنه.
به گفتهی یه معمار AWS، اگه دیتایی که ایجنتهای هوش مصنوعی میخونن قدیمی باشه، تصمیمهاشون از پایه غلط میشه؛ این مقاله سه راهحل واقعی رو معرفی میکنه.
قبل از باز کردن هر ابزار هوش مصنوعی، اول ببین ایدهت به کدوم شکل نیاز داره: لوکال، وباپ، اپ نیتیو، سرویس بکگراند یا پروژه سختافزاری.
مدل ۲۷ میلیاردی Qwen 3 چطور رو سختافزار شخصی، عملکردی نزدیک به مدلهای غولپیکر نشون میده؟ و چرا تنظیم reasoning effort میتونه اجراش رو از چند دقیقه به بیش از یک ساعت برسونه؟