ProEval: ارزیابی هوش مصنوعی با هزینهای ۱۰۰ برابر کمتر
خلاصهٔ کاملتر
ارزیابی دقیق مدلهای هوش مصنوعی مولد (GenAI) معمولاً گران و زمانبره؛ چون باید هزاران نمونه رو روی مدل اجرا کرد تا به یه تصویر قابل اعتماد از عملکردش رسید. ProEval یه فریمورک تحقیقاتی از DeepMind هست که دقیقاً این مشکل رو هدف گرفته و ادعا میکنه میتونه هزینههای ارزیابی رو تا ۱۰۰ برابر کاهش بده.
ایده اصلی ProEval اینه که بهجای اجرای کامل همه نمونههای ارزیابی، از یه مدل surrogate مبتنی بر Gaussian Process (GP) استفاده کنه که نرخ خطای مدل هدف رو با تعداد خیلی کمتری نمونه تخمین میزنه. این تخمین با دقت ±۱٪ انجام میشه که برای اکثر کاربردهای عملی کاملاً کافیه.
یکی از ویژگیهای جذاب ProEval قابلیت Transfer Learning روی بنچمارکهاست. یعنی surrogate های از پیش آموزشدیده میتونن بلافاصله روی مدلهای جدید هم کار کنن بدون اینکه نیاز به آموزش مجدد باشه. این قابلیت بهخصوص وقتی مدلهای جدید مرتباً منتشر میشن خیلی ارزشمنده.
ProEval فقط به تخمین عملکرد اکتفا نمیکنه؛ بلکه بهصورت فعالانه دنبال «کیسهای شکست» (Failure Cases) میگرده. یعنی سعی میکنه باگها و الگوهای خطای متنوع رو در بودجه ارزیابی محدود کشف کنه. این اطلاعات میتونه مستقیماً به تیم توسعه کمک کنه بفهمه مدل کجا ضعف داره.
این ابزار روی طیف متنوعی از بنچمارکها اعتبارسنجی شده؛ از جمله GSM8K و SVAMP برای استدلال ریاضی، MMLU و StrategyQA برای دانش عمومی و استدلال، و Jigsaw برای ایمنی و classification. این تنوع نشون میده ProEval به یه حوزه خاص محدود نمیشه.
استفاده از ProEval هم سادهست. با چند خط کد میشه نرخ خطای یه مدل رو تخمین زد و با مقدار واقعی مقایسه کرد:
from proeval import BQPriorSampler, LLMPredictor, DATASET_CONFIGS
from proeval.sampler import load_predictions, extract_model_predictions
import numpy as np
sampler = BQPriorSampler(noise_variance=0.3)
result = sampler.sample(predictions="svamp", target_model="gemini25_flash", budget=50)
df = load_predictions("svamp")
pred_matrix, model_names = extract_model_predictions(df)
true_mean = np.mean(pred_matrix[:, model_names.index("gemini25_flash")])
print(f"Estimated error rate: {result.estimates[-1]:.4f}")
print(f"MAE: {result.mae(true_mean):.4f}")در این مثال، با budget=50 یعنی فقط ۵۰ نمونه، میشه نرخ خطای مدل Gemini 2.5 Flash روی دیتاست SVAMP رو تخمین زد و MAE رو با مقدار واقعی مقایسه کرد.
ProEval تحت لایسنس Apache 2.0 منتشر شده و کدش در دسترس عموم هست. این پروژه یه محصول رسمی Google نیست اما توسط تیم DeepMind توسعه یافته و مقاله فنیاش روی arXiv موجوده.
نکات کلیدی:
- کاهش تا ۱۰۰ برابری هزینه ارزیابی مدلهای GenAI با دقت ±۱٪
- استفاده از Gaussian Process Surrogate برای تخمین نرخ خطا با نمونههای بسیار کمتر
- کشف فعالانه الگوهای شکست و باگهای مدل در بودجه محدود
- Transfer Learning روی بنچمارکها: surrogate های آموزشدیده بلافاصله روی مدلهای جدید هم کار میکنن
- اعتبارسنجیشده روی GSM8K، MMLU، StrategyQA، Jigsaw و بنچمارکهای دیگه
- متنباز با لایسنس Apache 2.0، توسعهیافته توسط DeepMind




