BenchBench: بنچمارکی که مدلهای AI را وادار میکنه برای هم آزمون بسازن
خلاصهٔ کاملتر
مشکل اصلی اینه که مدلهای امروزی دارن تقریباً همه بنچمارکهای موجود رو اشباع میکنن و ساختن یه آزمون چالشبرانگیز واقعی خودش به یه کار تخصصی تبدیل شده. Rohit Krishnan با این ایده ساده ولی هوشمندانه وارد شد: چرا از خود مدلها نخوایم که بنچمارک بسازن؟ حاصل کار پروژهای به اسم BenchBench شد.
در این آزمون، هر مدل گزارش کاملی از بنچمارکهای موجود دریافت میکنه و باید یه آزمون جدید طراحی کنه که هم برای مدلهای پیشرفته چالشبرانگیز باشه و هم عملاً قابل حل باشه — نه چیزی مثل اثبات P=NP. اگه در دور اول شکست بخوره، نتایج شکست بهش نشون داده میشه تا دوباره امتحان کنه.
نتیجه جالب بود: GPT 5.2 تنها مدلی بود که واقعاً موفق شد. بنچمارکی که ساخت «Reimbursement Forensics» نام داره — مجموعهای از فاکتورهای سفر با رسیدهای باطلشده و موارد تکراری، که مدل باید مبلغ دقیق قابل بازپرداخت رو به سِنت حساب کنه. بقیه مدلها یا خیلی ساده ساختن یا غیرقابلحل.
از دیگر مدلهای تستشده، Gemini 3.1 Pro خلاقترین آزمونها رو ساخت — از مسیریابی فضایی تا تطبیق اسناد اجاره — ولی خیلی شکننده و بعضاً بیش از حد معماگونه بود. Claude Opus 4.6 آزمونهای کلاسیک و تمیز ساخت که همین خوانایی باعث شد راحتتر حل بشن. جالب اینجاست که GPT 5.5 و Opus 4.6 که معمولاً در رتبهبندیها صدرنشینن، در نقش سازندهی بنچمارک عملکرد ضعیفتری داشتن.
BenchBench یه تمایز مهم رو آشکار میکنه: بهترین حلکنندهها لزوماً بهترین سازنده نیستن. مثلاً Gemini 3.5 Flash در ساختن آزمون از Opus 4.6 بهتر بود، ولی در حل کردن ضعیفتر. این شکاف بین نقش Creator و Solver چیزیه که اکثر بنچمارکهای معمول کاملاً نادیده میگیرن.
پروژه هنوز در مراحل اولیهست ولی سه چیز رو میسنجه که بقیه بنچمارکها از دستشون داده: خلاقیت مدل در طراحی مسئله، خودآگاهی از تواناییها و محدودیتهاش، و یه معیار جدید که با بنچمارکهای دیگه همبستگی بالایی نداره. کد پروژه روی GitHub در دسترسه.
نکات کلیدی:
- BenchBench مدلهای AI رو در نقش طراح بنچمارک میسنجه، نه فقط حلکننده
- تنها GPT 5.2 تونست آزمون واقعاً چالشبرانگیز و قابلحل بسازه
- مدلهای برتر در حل مسئله (مثل Claude Opus 4.6) لزوماً در ساختن مسئله برتر نیستن
- Gemini 3.1 Pro خلاقترین آزمونها رو ساخت ولی کیفیت ناپایداری داشت
- این رویکرد خلاقیت و خودآگاهی مدل رو میسنجه، نه فقط دانش




