آیا واقعاً فقط Mythos میتونه اون باگهای امنیتی رو پیدا کنه؟
خلاصهٔ کاملتر
نویسندهای که قبلاً ابزاری برای اتوماسیون باگیابی به اسم Nelson ساخته، برای این پروژه یه بنچمارک تازه درست کرده تا بفهمه آیا مدل Mythos آنتروپیک -که دسترسیش محدوده- واقعاً تو پیداکردن باگهای امنیتی سخت، از بقیهٔ مدلها بهتره یا صرفاً هایپه. اون ۹ باگ واقعی که تو مستندات Mythos بهعنوان کشفشده معرفی شدن رو جمع کرده، و مدلها رو بدون هیچ راهنمایی خاصی جلوی همون فایلهای آسیبپذیر قرار داده تا ببینه کدومشون خودشون باگ رو پیدا میکنن.
خودش چندتا محدودیت این آزمایش رو هم قبول داره: بعضی باگها چندفایلی و واقعاً سختان، مدلها احتمال داره (هرچند بعیده) به دادههای تاریخی یا CVEها دسترسی داشته باشن، و این فقط یه اجرا برای هر باگ روی هر مدل بوده، پس دادهها کمن و نمیشه نتیجهگیری قطعی کرد. اون همچنین متوجه شده اجرای مدلها تو یه ایجنت کامل (بهجز مدلهای کلود که تو Claude Code اجرا شدن) نهتنها کمکی نکرده، بلکه هزینه و زمان رو هم بیشتر کرده.
از نتایج کلی: هیچ مدل عمومیای به گَرد پای Mythos هم نرسیده، ولی Opus 4.8 وقتی مستقیم به سراغ باگ فرستاده میشه اون رو میفهمه، که نشون میده احتمالاً بهترین مدلهای عمومی هم میتونن با ابزار و زمان کافی به این باگها برسن. تو نسخهٔ بهروزشدهٔ بنچمارک، Gemma 4 MoE با پیداکردن ۴ باگ از ۹ تا، یکی از بهترینها بوده -از جمله یه باگ سخت که قبلش فقط Opus پیداش کرده بود.
جالبترین بخش گزارش، عملکرد مدلهای ارزونتره: Qwen 3.6 (که خود نویسنده رو دستگاه شخصیش اجرا کرده) با پیداکردن باگهای بیشتر و false-positive کمتر، از مدلهای بزرگتری مثل Sonnet و Gemini 3.1 Pro جلو زده. مدلهای چینیِ ارزون مثل MiMo و DeepSeek هم تقریباً همسطح Opus 4.8 و GPT 5.5 عمل کردن، اون هم با هزینهای حدود یکدهم.
از طرف دیگه، Antigravity (رابط CLI مدلهای جمینای) تو ۸ از ۹ مورد همون اول درخواست رو رد کرده و از انجام تحلیل امنیتی امتناع کرده. Mistral Medium هم بدون خطا، هیچ نتیجهای برنگردونده که نویسنده حدس میزنه بهخاطر یه محدودیت ایمنی نامشخصه. نویسنده همچنین میگه دیگه دلیلی برای استفاده از Haiku یا Sonnet تو ممیزی امنیتی نمیبینه، چون نه خیلی خوب عمل میکنن و نه واقعاً ارزونان -مخصوصاً Haiku که توکن مصرفیاش خیلی بالاتر از بقیه بود.
جمعبندی نویسنده اینه که جواب قطعی نداره: شاید Mythos واقعاً تو پیداکردن این باگهای خاص بیرقیب باشه (چهارتا باگ رو هیچ مدل دیگهای پیدا نکرد)، ولی چون Opus هم وقتی راهنمایی میگیره میتونه همون باگها رو بفهمه، احتمالش هست که با پرامپت، ابزار و هارنس بهتر، مدلهای عمومی هم بتونن به همون نتیجه برسن. نویسنده قول داده این بنچمارک رو ادامه بده.
نکات کلیدی:
- یه بنچمارک مستقل ۹ باگ امنیتی رو که Mythos آنتروپیک کشف کرده، جلوی مدلهای دیگه گذاشته تا ببینه کدومشون پیداشون میکنن
- هیچ مدل عمومیای بهاندازهٔ Mythos خوب نبود، ولی Gemma 4 و چندتا مدل ارزونتر عملکرد نسبتاً خوبی داشتن
- مدلهای ارزونی مثل Qwen 3.6، MiMo و DeepSeek از مدلهای گرونتری مثل Sonnet و Gemini جلو زدن
- Antigravity (رابط جمینای) اکثر درخواستهای تحلیل امنیتی رو رد کرد و Mistral Medium هم نتیجهای برنگردوند




