EVA-Bench نسخهی ۲: محکزنی ایجنتهای صوتی سازمانی
خلاصهٔ کاملتر
تیم ServiceNow-AI تو این پست از نسخهی ۲ بنچمارک EVA-Bench رونمایی کرده؛ یه مجموعه دادهی متنباز برای محکزدن ایجنتهای صوتی (voice agents)، یعنی همون دستیارهای هوش مصنوعی که پشت تلفن با آدما صحبت میکنن. ایدهی محوری مقاله اینه که خطاهای این ایجنتها خیلی وابسته به حوزهست: سیستمی که تو رزرو پرواز بینقص کار میکنه، ممکنه تو سیاستهای پیچیدهی منابع انسانی گیر کنه.
به همین خاطر EVA-Bench از یه حوزه به سه حوزه گسترش پیدا کرده: خدمات مشتری خطوط هوایی، مدیریت خدمات IT سازمانی (ITSM) و خدمات منابع انسانی حوزهی سلامت (HRSD). روی هم این سه حوزه ۲۱۳ سناریوی ارزیابی روی ۱۲۱ ابزار رو پوشش میدن که حدوداً ۴ برابر پوشش نسخهی اول این بنچمارکه. هر سه دیتاست هم متنبازن و با لایسنس MIT منتشر شدن.
نویسندهها میگن طراحی دیتاست بر اساس پنج اصل بوده. اول محدودهی صوتمحور: فقط کارهایی که واقعاً پشت تلفن انجام میشن انتخاب شدن. دوم واقعگرایی: مثلاً تو حوزهی سلامت سناریوها روی سیاستهای واقعی آمریکا مثل شمارهی NPI و قانون FMLA بنا شدن. سوم تنوع با سه نوع سناریو: تماسهای تکمنظوره، چندمنظوره و تماسهای خصمانه که کاربر سعی میکنه از مراحل عبور کنه یا به اطلاعاتی دسترسی پیدا کنه که اجازهشو نداره.
دو اصل آخر احراز هویت و تکرارپذیری هستن. به گفتهی نویسندهها، کارهای قبلی نشون دادن احراز هویت یکی از پایدارترین نقاط شکست ایجنتهای صوتیه، برای همین تو هر حوزه جریان احراز هویت گنجونده شده. برای تکرارپذیری هم هر سناریو دقیقاً یه مسیر درست برای حلشدن داره تا تفاوت نمره واقعاً نشوندهندهی شکاف توانایی باشه نه شانس.
برای ساخت سناریوها از یه خط لولهی تولید دادهی مصنوعی گرافمحور به اسم SyGra با مدل GPT-5.4 استفاده شده. هر سناریو سه بخشِ بههموابسته داره که با هم تولید میشن: هدف کاربر (که به شکل یه درخت تصمیم ساختار پیدا کرده)، پایگاه دادهی اولیه، و حالت نهایی مورد انتظار بهعنوان «حقیقت پایه». این سه بخش با همدیگه ساخته میشن چون اگه جدا تولید بشن، ناسازگاریهای پنهان مثل ارجاع به یه شناسهی پرونده که اصلاً تو دیتابیس نیست، کل سیگنال ارزیابی رو خراب میکنه.
برای اعتبارسنجی، بعد از هر تولید یه حلقهی چندمرحلهای اجرا میشه: یه بررسی ساختاری با اسکیمای Pydantic، یه اعتبارسنج مبتنی بر LLM برای سازگاری، و یه بازبینی کامل مسیر گفتگو. بعدش هم سناریوها چند دور بازبینی دستی شدن و در نهایت با سه مدل پیشرو (GPT-5.4، Gemini 3.1 Pro و Claude Opus 4.6) روی نسخهی متنی تست شدن تا مطمئن بشن هر سناریو حداقل با یکی از مدلها قابل حله. تیم همچنین از یه گسترش چندزبانه خبر داده که فراتر از انگلیسی، خود خط لولهی ارزیابی رو هم با هر زبان و فرهنگ هدف تطبیق میده.
نکات کلیدی:
- گسترش EVA-Bench از یک به سه حوزهی سازمانی: خطوط هوایی، IT و منابع انسانی سلامت
- ۲۱۳ سناریو روی ۱۲۱ ابزار، حدوداً ۴ برابر نسخهی اول
- تولید سناریو با خط لولهی گرافمحور SyGra و سه بخش بههموابسته که با هم ساخته میشن
- اعتبارسنجی چندلایه و تست با GPT-5.4، Gemini 3.1 Pro و Claude Opus 4.6
- متنباز با لایسنس MIT و در راه بودن نسخهی چندزبانه




