DeepSWE: بنچمارک واقعبینتر برای ارزیابی ایجنتهای کدنویسی
خلاصهٔ کاملتر
DeepSWE یک بنچمارک تازه برای سنجش توانایی ایجنتهای کدنویسی در کارهای بلندمدت و پیچیدهست. ایدهی اصلی اینه که بنچمارکهای موجود مثل SWE-Bench Pro مشکلات جدی دارن: تسکها از کامیتهای عمومی گرفته شدن (خطر آلودگی دیتا)، وریفایرهاشون اشتباه میکنن، و اکثر مدلهای فرانتیر روشون خیلی به هم نزدیک به نظر میرسن.
DeepSWE با چهار ویژگی اساسی این مشکلات رو حل میکنه: تسکها از صفر نوشته شدن (نه از PR یا کامیت موجود)، ۹۱ ریپازیتوری مختلف در پنج زبان TypeScript، Go، Python، JavaScript و Rust رو پوشش میده، راهحلها بهطور میانگین ۶۶۸ خط کد نیاز دارن (در مقابل ۱۲۰ خط SWE-Bench Pro)، و وریفایرها بهجای جزئیات پیادهسازی، رفتار قابل مشاهده سیستم رو تست میکنن.
نتایج لیدربورد نشون میده که gpt-5.5 با ۷۰٪ امتیاز در صدر قرار داره، بعد از اون claude-opus-4.7 با ۵۴٪ و claude-sonnet-4.6 با ۳۲٪ میآن. جالب اینه که بازهی امتیاز در DeepSWE از بدترین تا بهترین مدل ۷۰ درصد طول داره، ولی همین مدلها روی SWE-Bench Pro تنها ۳۰ درصد فاصله دارن — یعنی DeepSWE تفاوتهای واقعی بین مدلها رو خیلی بهتر نمایش میده.
یکی از مهمترین یافتههای این پروژه، بررسی کیفیت وریفایرهاست. تیم DeepSWE روی ۷۳۵ رولاوت خودش و ۷۸۹ رولاوت SWE-Bench Pro یک قاضی هوش مصنوعی اجرا کرد تا ببینه وریفایرها چقدر درست قضاوت میکنن. نرخ خطای SWE-Bench Pro چشمگیره: ۸.۵٪ false positive (وریفایر جواب اشتباه رو قبول کرده) و ۲۴٪ false negative (جواب درست رو رد کرده). DeepSWE این اعداد رو به ترتیب به ۰.۳٪ و ۱.۱٪ رسونده.
تحلیل کیفی تفاوتهای جالبی بین خانوادههای مدل نشون میده. Claude در تسکهای چندبخشی گاهی یک شاخه رو پیاده میکنه و شاخه دیگه رو فراموش میکنه — مثلاً نسخه sync رو درست مینویسه ولی نسخه async رو جا میذاره. GPT دقیقاً همون چیزی رو که خواسته شده پیاده میکنه و از پرامپت انحراف نمیگیره. همچنین مشخص شد که Claude در SWE-Bench Pro روی بیش از ۱۲٪ از تسکها سراغ تاریخچهی git میره و راهحل طلایی رو از .git history میخونه — چیزی که در DeepSWE امکانپذیر نیست چون ریپازیتوری با shallow clone شیپ میشه.
نکات کلیدی:
- DeepSWE شامل ۱۱۳ تسک در ۹۱ ریپازیتوری و ۵ زبان برنامهنویسیه
- تسکها از صفر نوشته شدن تا آلودگی دیتا در پریترینینگ رو حذف کنن
- میانگین خطوط کد راهحل: ۶۶۸ (در مقابل ۱۲۰ در SWE-Bench Pro)
- وریفایرهای SWE-Bench Pro در ۳۲٪ از تریالها اشتباه قضاوت میکنن؛ DeepSWE این عدد رو به ۱.۴٪ رسونده
- gpt-5.5 با ۷۰٪ اول لیدربورد، claude-opus-4.7 با ۵۴٪ دومه
- همه مدلها با یک هارنس یکسان (mini-swe-agent) ارزیابی میشن تا اثر scaffolding حذف بشه




