ProgramBench: آیا هوش مصنوعی میتونه یه برنامه رو از صفر بسازه؟
خلاصهٔ کاملتر
ProgramBench یه بنچمارک تازهست که از Meta Superintelligence Labs، Stanford و Harvard بیرون اومده و یه سوال خیلی جدی میپرسه: آیا مدلهای زبانی میتونن فقط با دیدن یه فایل اجرایی و مستنداتش، کل کدبیس اون برنامه رو از صفر بازسازی کنن؟
در هر تسک، ایجنت یه فایل کامپایلشده و داکیومنتیشنش رو میگیره. نه سورسکد، نه ساختار فایل، نه signature متدها — هیچی. ایجنت باید خودش زبان رو انتخاب کنه، معماری رو طراحی کنه، همه کد رو بنویسه و یه اسکریپت build هم بده. بعد از submit، رفتار برنامه تولیدشده با برنامه اصلی مقایسه میشه.
مجموعه تستها با agent-driven fuzzing تولید شده و شامل بیش از ۲۴۸,۰۰۰ تست رفتاری برای ۲۰۰ تسک مختلفه. تسکها از ابزارهای کوچیک مثل jq و ripgrep شروع میشن و تا پروژههای غولپیکری مثل PHP compiler، FFmpeg و SQLite میرسن.
نتایج لیدربورد واقعاً چشمگیره — ولی نه به شکل مثبت! هیچ مدلی نتونسته حتی یه تسک رو بهطور کامل حل کنه (یعنی Resolved rate همه مدلها ۰٪ هست). بهترین عملکرد رو Claude Opus 4.7 داشته که ۳٪ از تسکها رو «تقریباً» حل کرده (یعنی ۹۵٪+ تستها رو پاس کرده):
- Claude Opus 4.7: 0% حلشده، 3.0% تقریباً حلشده
- Claude Opus 4.6: 0% حلشده، 2.5% تقریباً حلشده
- GPT-5، Gemini Pro، Gemini Flash: 0% در هر دو دسته
تیم تحقیقاتی چند دلیل برای این امتیازهای پایین میآره. اول اینکه برخلاف بنچمارکهای دیگه، هیچ ساختار یا راهنماییای به ایجنت داده نمیشه و ایجنت واقعاً باید architect باشه. دوم اینکه ایجنتها داخل کانتینرهای sandbox بدون اینترنت اجرا میشن، پس نه میتونن سورسکد رو پیدا کنن و نه دیکامپایل کنن. سوم، هیچ tuning خاصی روی harness انجام نشده و یه harness عمومی برای همه تسکها استفاده شده.
نکته جالب اینه که تسکها در اصل قابل حل هستن — ایجنت میتونه برنامه اصلی رو با هر ورودیای اجرا کنه و رفتارش رو مشاهده کنه. ضمناً هزینه اجرای مدلها خیلی بالا بوده؛ مثلاً برای Claude Sonnet 4.5 تا ۵ هزار دلار هزینه شده. ProgramBench از ابزار mini-SWE-agent بهعنوان scaffold استفاده میکنه که یه baseline مینیمال و شناختهشدهست.
نکات کلیدی:
- ProgramBench میسنجه آیا ایجنتهای هوش مصنوعی میتونن یه برنامه رو فقط از روی فایل اجرایی و مستنداتش بازسازی کنن
- هیچ سورسکد، ساختار فایل یا راهنمایی طراحی به ایجنت داده نمیشه
- ۲۰۰ تسک با بیش از ۲۴۸,۰۰۰ تست رفتاری، از ripgrep تا FFmpeg و SQLite
- هیچ مدلی تاکنون حتی یه تسک رو کامل حل نکرده؛ بهترین امتیاز ۳٪ «تقریباً حلشده» توسط Claude Opus 4.7
- ایجنتها در محیط sandbox بدون اینترنت اجرا میشن تا تقلب غیرممکن بشه
- هدف بنچمارک اینه که توانایی واقعی مدلها در طراحی معماری نرمافزار رو بسنجه




