بنچمارک EVA-Bench حالا از یه حوزه به سه حوزهی سازمانی رسیده تا نشون بده ایجنتهای صوتی هوش مصنوعی تو شرایط واقعی، با احراز هویت و تماسهای دردسرساز، چقدر دووم میارن.
react-native-preflight یه کتابخونهست که تست end-to-end اپهای ریاکت نیتیو با Maestro رو ساده میکنه و کد تستی رو کاملاً از بیلد پروداکشن حذف میکنه.
سونار (سازندهی SonarQube) پلتفرم بازبینی کد Gitar را خرید تا با افزودن استدلال مبتنی بر LLM به تحلیل قطعیاش، مشکلاتی مثل ناسازگاری منطقی و نقص طراحی را که سخت کدگذاری میشن پیدا کنه.
ساختن اسکیمای Zod گرونه و هر بار صدا زدن یه تابع، دوباره ساختش میکنه؛ این پلاگین Babel اسکیماها رو میبره بالای فایل تا فقط یکبار ساخته بشن.
ایجنتهای هوش مصنوعی معمولاً تستهای بدی مینویسن. جیسون سوئت نشون میده با چه فرایندی میشه همون ایجنت رو وادار به نوشتن تستهای تمیز و معنادار کرد.
این مقاله میگه برای ارزیابی ایجنتهای طولانیافق، یک LLM judge ساده شکست میخوره و به یک «داور ایجنتی» نیاز داریم که بتونه جستوجو، راستیآزمایی و تطبیق کنه.
DeepSWE یک بنچمارک جدید برای سنجش ایجنتهای کدنویسیه که نشون میده مدلهایی که روی رقبای قدیمیتر خیلی به هم نزدیک به نظر میرسن، در واقع تفاوت چشمگیری با هم دارن.
هوش مصنوعی باز کردن PR رو برای همه آسون کرده، اما کدش قابلاعتماد نشده؛ و بار بازبینی این «اسلاپ» روی دوش توسعهدهندهها افتاده.
یه توسعهدهنده بعد از چند ماه کار با Claude Code میگه حالا خیلی کمتر کد مینویسه و بیشتر وقتش رو صرف فهمیدن و تست کدی میکنه که Claude نوشته.
aimock یه پکیج Node.jsه که تمام APIهای رایج هوش مصنوعی رو موک میکنه تا بتونی اپلیکیشنهای AI خودت رو بدون نیاز به کلید API یا اینترنت تست کنی.
شرکتها اغلب فرمول محصولاتشون رو عوض میکنن بدون اینکه کسی بفهمه. اما علم «تست تشخیص» دقیقاً به همین سوال جواب میده که آیا آدمها اصلاً متوجه فرق میشن یا نه.
سافاری دومین مرورگر پرکاربرد دنیاست و روی iOS و iPadOS هیچ جایگزینی نداره — ولی اگه مک نداری، تستش کار سختیه.
Pest v4.5.0 با قابلیت retry خودکار برای تستهای ناپایدار اومد — حالا میشه تستهایی که گاهی قطع میشن رو علامتگذاری کرد تا فریمورک خودش چند بار اجراشون کنه.
دو اسکیل (skill) برای ایجنتهای کدنویسی هوش مصنوعی که تست سیستمهای توزیعشده رو بر پایهی ادعاهای محصول طراحی و اجرا میکنن.
با رشد سرعت توسعه و استفاده گسترده از هوش مصنوعی، پایپلاینهای CI به یکی از بزرگترین منابع هزینه زیرساخت تبدیل شدن — و تستها مقصر اصلیان.
Orval یه ابزار متنبازه که از روی مستندات OpenAPI یا Swagger، کد کلاینت TypeScript کاملاً تایپسیف تولید میکنه — از هوکهای React Query گرفته تا Angular و Zod.
اوروال یه ابزار کدجنریشن هست که مشخصات OpenAPI رو به کلاینتهای تایپسیف، موک و ولیدیتور تبدیل میکنه. نسخه ۸ این ابزار منتشر شد.
agent-device یه CLI متنبازه که به ایجنتهای هوش مصنوعی اجازه میده اپهای واقعی رو روی iOS، Android و دسکتاپ اجرا، بررسی و تست کنن — بدون نیاز به دخالت مستقیم انسان.
وقتی یه باگ ساده رو درست میکنی و یه جای دیگه میشکنه، یا یه تغییر دو روزه دو هفته طول میکشه — اینا تصادفی نیستن، نشانهی طراحی بدن.
تیم Flare به جای mock کردن، یک اپلیکیشن لاراول واقعی با سرور HTTP و صف کارها راه انداخت تا مطمئن بشه همه چیز درست کار میکنه.