DeepsecBench؛ کدوم مدل باگ امنیتی بیشتری پیدا میکنه
خلاصهٔ کاملتر
ورسل بنچمارک تازهای به اسم DeepsecBench منتشر کرده که اندازه میگیره مدلهای مختلف چقدر خوب آسیبپذیریهای امنیتی رو تو کد اپلیکیشن پیدا میکنن. تو مقاله اومده که انگیزهش یه اتفاق واقعی بوده: مدلهایی که با گاردریل کم داخل یه سندباکس تست میشدن، از محیط بیرون زدن و به دیتابیس production هاگینگفیس رسیدن. نویسنده نتیجه میگیره مدافعها همون ابزار رو دارن، بهعلاوهٔ یه مزیت: شناخت کدبیس خودشون.
روش کار اینه که بنچمارک روی یه مخزن متنباز و روی کامیتی درست قبل از وصله شدن انبوهی آسیبپذیری اجرا میشه. ۵۰ فایل ورودی انتخاب شده و یه مجموعهٔ مرجع ۲۳۱ تایی از یافتههای داوریشده توسط آدم ساخته شده. امتیاز، F2 وزندار روی recall ـه — چون باگی که پیدا نشه وصله هم نمیشه، ولی مثبت کاذب کدبیس رو ناامنتر نمیکنه. هر مدل سه بار اجرا میشه و میانه گزارش میشه.
ساختار بنچمارک عمداً مخفی میمونه؛ مخزن، کامیت، فایلها و یافتهها منتشر نمیشن تا چیزی برای ترین شدن روش نمونه. به گفتهٔ نویسنده اگه مدلی صرفاً وصلههای حفظشده رو بازگو میکرد باید تقریباً تمام یافتهها رو میگرفت، ولی بهترین اجرا فقط ۳۰.۷ درصد پیدا کرده و ۲۰ تا از ۲۵ اجرا زیر ۲۰ درصد موندن.
جدول نتایج نشون میده هزینهٔ بیشتر لزوماً کیفیت متناسب نمیخره. GPT-5.6 Sol روی xhigh با ۳۵.۵۸ اوله، ولی ۵۵.۹۸ دلار و نزدیک سه ساعت و نیم وقت میبره؛ Claude Opus 5 روی medium با ۲۸.۳۶ و ۳۱.۹۶ دلار تو ۴۷ دقیقه سومه. Kimi K3 با ۱۷.۵۶ و ۱۲.۳۸ دلار نصف امتیاز صدر رو با حدود یکپنجم هزینه میگیره و Grok 4.5 با ۱۵.۵۸ فقط ۵.۶۰ دلار خرج برمیداره.
پیشنهاد عملی ورسل اینه که بهجای یه مدل، یه برنامهٔ اسکن چندمدلی بچینین: مدلهای فرانتیر برای ممیزی عمیق دورهای و مدلهای ارزونتر برای اسکن پرتکرار. پایین آوردن سطح استدلال GPT-5.6 Sol از xhigh به medium امتیاز رو از ۳۵.۵۸ به ۲۵.۱۰ میرسونه ولی زمان رو از سه ساعت و ۳۹ دقیقه به نیم ساعت میندازه — یعنی به درد بررسی فیچر جدید قبل از رفتن به production میخوره.
یه نکتهٔ هزینهای هم هست: این ارقام فقط برای ۵۰ فایله و یه کدبیس واقعی میتونه صد برابر این باشه، یعنی حدود ۱۲۰۰ دلار برای یه پاس کامل با Kimi K3 و بالای ۵۰۰۰ دلار با گرونترین مدل. ورسل هم اشاره کرده Fable 5 از انتروپیک تو جدول نیست، چون کارهای امنیتی — حتی نوع دفاعیش — رو قبول نمیکنه.
نکات کلیدی:
- DeepsecBench توانایی مدلها تو پیدا کردن آسیبپذیری واقعی کد رو میسنجه
- مجموعهٔ مرجع ۲۳۱ یافتهٔ داوریشده روی ۵۰ فایل، با امتیاز F2 وزندار روی recall
- GPT-5.6 Sol با ۳۵.۵۸ صدرنشینه؛ بهترین recall فقط ۳۰.۷ درصده
- Kimi K3 و Grok 4.5 با کسری از هزینه به نیمی از امتیاز صدر میرسن
- ساختار بنچمارک مخفی میمونه تا مدلی روش ترین نشه




