PACE: تخمین ارزونِ توانایی ایجنتهای هوش مصنوعی
خلاصهٔ کاملتر
یه مقالهٔ پژوهشی جدید به اسم PACE یه روش ارزونتر واسه سنجش توانایی ایجنتهای هوش مصنوعی معرفی میکنه. مشکل اینه که ارزیابی ایجنتهای LLM روی بنچمارکهایی مثل SWE-Bench و GAIA خیلی گرونه؛ به گفتهٔ نویسندهها یه ارزیابی کامل میتونه هزاران دلار خرج برداره و چند روز طول بکشه و زیرساخت پیچیدهای هم میخواد.
در مقابل، بنچمارکهای غیرایجنتی که تکمهارتهایی مثل استدلال یا تولید کد رو تست میکنن، سریع و ارزونن. ایدهٔ اصلی مقاله اینه که ببینه آیا میشه عملکرد روی بنچمارکهای گرونِ ایجنتی رو از روی نتیجهٔ یه زیرمجموعهٔ کوچیک و با دقت انتخابشده از همین تستهای ارزون پیشبینی کرد یا نه.
روش کار اینجوریه که PACE از بین یه استخر از نمونههای ارزیابی، یه زیرمجموعهٔ فشرده انتخاب میکنه و بعد یه مدل رگرسیون میسازه که نمرهٔ مدل روی این زیرمجموعه رو به نمرهش روی بنچمارک ایجنتی هدف نگاشت میکنه. انتخاب نمونهها هم با ترکیب دو استراتژی انجام میشه: یکی نمونههای مرتبط با هدف رو محلی انتخاب میکنه و اون یکی نمونههای سراسری و پراطلاعات رو برمیداره.
به گفتهٔ نویسندهها، تو آزمایشها روی ۱۴ مدل، ۴ بنچمارک ایجنتی و ۱۹ بنچمارک غیرایجنتی، خروجی این روش (که PACE-Bench اسم داره) نمرهٔ ایجنتی رو با خطای مطلق میانگین زیر ۴٪، همبستگی اسپیرمن بالای ۰٫۸ و دقت رتبهبندی جفتیِ مدلها حدود ۸۵٪ پیشبینی کرده—اونم با کمتر از ۱٪ هزینهٔ ارزیابی کامل.
نویسندهها میگن این کار به تیمها اجازه میده حین توسعه، انتخاب یا مسیریابی مدل، یه تخمین قابلاعتماد از عملکرد ایجنتی بگیرن بدون اینکه هزینه و زحمت ارزیابی کامل ایجنت رو تحمل کنن. ضمناً تحلیل نمونههای انتخابشده نشون میده هر بنچمارک ایجنتی دقیقاً چه مهارتهایی رو میطلبه.
نکات کلیدی:
- ارزیابی کامل ایجنتهای LLM هزاران دلار و چند روز وقت میبره
- PACE از یه زیرمجموعهٔ کوچیک تست ارزون و یه مدل رگرسیون واسه پیشبینی نتیجه استفاده میکنه
- خطای مطلق میانگین زیر ۴٪ و دقت رتبهبندی حدود ۸۵٪ با کمتر از ۱٪ هزینه
- تحلیل نمونهها نشون میده هر بنچمارک چه مهارتهایی رو میطلبه




