ارزیابی Mythos Preview برای امنیت تهاجمی توسط XBOW
خلاصهٔ کاملتر
چند هفته پیش Anthropic به تیم XBOW دسترسی زودهنگام به مدل Mythos Preview داد تا تواناییهاش رو در حوزهی امنیت سایبری بسنجن. XBOW یه شرکت تخصصی تست نفوذ (pentest) هست که از هوش مصنوعی برای پیدا کردن آسیبپذیری در وبسایتهای واقعی استفاده میکنه. یه تیم ۱۰ نفره از متخصصان مختلف این مدل رو از زوایای گوناگون ارزیابی کردن.
روش تست این بود که اپلیکیشنهای متنباز رو در نسخهی آسیبپذیرشون فریز میکنن و عوامل (agents) هوش مصنوعی رو روی اونها اجرا میکنن. یه «اکشن» یعنی اجرای یه اسکریپت شل یا پایتون. پاس شدن یه تست یعنی سیستم بتونه در ۸۰ اکشن، یه روش بهرهبرداری اثباتشده پیدا کنه.
نتایج بنچمارکها چشمگیر بود. Mythos Preview در مقایسه با Opus 4.6 تعداد آسیبپذیریهای جا مانده رو ۴۲٪ کاهش داد. وقتی سورسکد سایت هم در اختیارش بود، این عدد به ۵۵٪ رسید. این نشون میده که مدل در خواندن و تحلیل کد از نوشتن اون هم قویتره. از نظر توکن-به-توکن، دقت این مدل در رسیدن به آسیبپذیری بیسابقه توصیف شد.
یه نکتهی جالب اینه که حتی در تستهایی که آسیبپذیری کاملاً در کد بود، حذف دسترسی به سایت زنده بیشتر از حذف سورسکد به عملکرد مدل آسیب زد. این یعنی تعامل با رفتار واقعی اپلیکیشن همچنان اهمیت بالایی داره. بهترین نتیجه وقتیه که مدل هم سورسکد داشته باشه، هم به سایت زنده دسترسی: اول از کد سرنخ پیدا میکنه، بعد روی سایت تأیید میکنه، بعد اکسپلویت میسازه.
در حوزههای دیگه هم نتایج قابلتوجهی به دست اومد. در آنالیز کدهای native و مهندسی معکوس (reverse engineering)، مدل باگهای واقعی بیشتری با false positive کمتر پیدا کرد. در بینایی بصری برای تعامل با مرورگر هم عملکرد خوبی داشت و با Sonnet 4.6 برابری کرد. اما قضاوت مدل در مواردی مثل ایمنی دستورات و تشخیص تهدید، محافظهکارانه و کمی خشک بود — به قوانین کتبی پایبند میموند، نه روح اونها.
از نظر هزینه، Mythos Preview حدوداً ۵ برابر مدلهای Opus گرونتره. XBOW نشون داد که در بعضی کاربردها، دادن زمان بیشتر به یه مدل ارزونتر میتونه نتیجهی بهتری با هزینهی کمتر بده. بنابراین Mythos Preview قویترین گزینه برای همهی سناریوها نیست — انتخاب مدل باید بر اساس نوع وظیفه انجام بشه.
نکات کلیدی:
- Mythos Preview در تحلیل سورسکد برای کشف آسیبپذیری فوقالعاده قویه
- نسبت به Opus 4.6، خطاهای از دست رفته تا ۵۵٪ کاهش یافت (با دسترسی به سورسکد)
- دسترسی به سایت زنده همچنان از سورسکد مهمتره
- قضاوت مدل در موارد مرزی محافظهکارانه و بیش از حد literal هست
- در مهندسی معکوس و آنالیز کدهای native قدرت بالایی نشون داد
- هزینهی بالا (۵ برابر Opus) باید در انتخاب مدل لحاظ بشه




