Agent Judge؛ ارزیابی ایجنتهای طولانیافق در پروداکشن
خلاصهٔ کاملتر
بیشتر تیمها مسیر یک ایجنت رو با یک LLM judge ساده ارزیابی میکنن: کوئری کاربر، خروجی نهایی و یک rubric رو میدن و میپرسن آیا ایجنت درست رفتار کرده. اما با حرکت صنعت به سمت ایجنتهای طولانیافق، این روش شکست میخوره. یک ایجنت فروش ممکنه سرنخها رو بررسی، CRM رو بهروز و ایمیل ارسال کنه؛ یا یک ایجنت کدنویسی دهها فایل رو ویرایش و یک PR باز کنه.
LLM judge ساده به سه دلیل میلنگه: مسیرهای بلند (ایجنتهایی مثل Codex و Claude Code با فشردهسازی متن میتونن میلیونها توکن مسیر تولید کنن که در پنجرهی یک judge جا نمیشه)، اقدامات stateful (ایجنت دیتابیس و API رو تغییر میده و ارزیاب باید اثرش رو در منبع حقیقت بررسی کنه)، و رفتار متغیر (rubricی که ماه قبل کار میکرد ممکنه کهنه بشه). به بیان نویسنده، ارزیابی دیگه قضاوت پاسخ نهایی نیست، بلکه تحقیق در کل مسیره.
Agent Judge این سه مشکل رو با سه قابلیت حل میکنه: جستوجو (مسیر طولانی رو به یک شیء قابلکوئری تبدیل میکنه و با ایجنتهای کارگر، شواهد دفنشده رو در همان مسیر یا مسیرهای قبلی پیدا میکنه)، راستیآزمایی (بررسی میکنه وضعیت محیط با اقدامات ادعایی ایجنت میخونه؛ مثلاً آیا رکورد درست بهروز شد، با اتصال فقطخواندنی به منابع حقیقت مثل دیتابیس و GitHub و سرور MCP)، و تطبیق (با Rubric Builder، بازخورد انسانی رو به نسخهی بعدی rubric تبدیل میکنه).
در آزمون داخلی روی تشخیص توهم در سطح مسیر، Agent Judge با rubric پالایششده به دقت ۰.۸۶ و F1 برابر ۰.۷۹ رسید؛ بالاتر از Claude Code (۰.۷۳)، Codex (۰.۶۹) و LLM judgeهای GPT-5.4 (۰.۷۴). نتیجهی کلی: ارزیابی ایجنتهای طولانیافق باید با ایجنتها و rubricهای پویا انجام بشه، نه با پرامپتهای ثابت LLM judge.
نکات کلیدی:
- LLM judge ساده روی ایجنتهای طولانیافق شکست میخوره (مسیر بلند، اقدام stateful، rubric کهنه)
- Agent Judge سه قابلیت داره: جستوجو، راستیآزمایی و تطبیق
- راستیآزمایی وضعیت محیط را با منابع حقیقت فقطخواندنی (دیتابیس، GitHub، MCP) چک میکنه
- با rubric پالایششده به دقت ۰.۸۶ رسید، بالاتر از Claude Code، Codex و LLM judgeها




