Mantis؛ اسکیلهای گوگل برای بازبینی امنیتی کد با ایجنت
خلاصهٔ کاملتر
گوگل مخزنی به اسم Mantis Skills منتشر کرده: یه مجموعهٔ ماژولار و ترتیبی از Skillها برای ایجنتهای کدنویسی که کارشون بازبینی امنیتی کده. تو مستندات پروژه اومده که این مجموعه قرار نیست یه دستورالعمل ثابت باشه، بلکه یه نقطهٔ شروع انعطافپذیره که هر تیم باید متناسب با استک نرمافزاری و سختافزاری خودش تنظیم و گسترشش بده.
خط لوله از ۱۵ جزء تشکیل شده: یه سوپروایزر به اسم mantis_meta_agent و ۱۴ مرحلهٔ اجرایی. مسیر کار اینه که اول تاریخچهٔ VCS و باگهای امنیتی گذشته استخراج میشه، بعد یه پایگاه دانش مارکداون از معماری کد ساخته میشه، روش مدل تهدید بنا میشه، بعد مرحلهٔ پلن و جستوجوی باگ میرسه و در آخر حذف تکراریها، اعتبارسنجی، نقد، بازتولید، زنجیرهسازی، پچ، کالیبراسیون ریسک و بازتاب. حالت همهجا تو فایلهای JSON داخل workspace/findings/ نگه داشته میشه.
دو تا فایل، حلقهٔ یادگیری رو میبندن: learnings.jsonl که فرضیههای غلط، شکست ابزارها و موفقیتها توش جمع میشه و historical_learnings.jsonl که الگوهای آسیبپذیری گذشتهٔ همون مخزن رو نگه میداره. به گفتهٔ مستندات، همین حلقه باعث میشه دورهای بعدی سراغ تحلیلهای تکراری نرن.
نویسندههای مخزن میگن این اسکیلها فقط برای کد اپلیکیشن نیستن و میشه اونا رو برای بازبینی طراحیهای سختافزاری RTL مثل SystemVerilog و VHDL، فایلهای Infrastructure-as-Code مثل ترافرم و RBAC کوبرنتیز، خطوط دادهٔ یادگیری ماشین (مثلاً خطر فرمت Pickle) یا حتی باینریهای کامپایلشده و فریمور با ابزارهایی مثل Ghidra و radare2 تنظیم کرد.
هشدارهای امنیتی پررنگترین بخش مستنداته. این مجموعه کدی رو اجرا میکنه که خود مدل تولید کرده، پس فقط باید تو محیطهای ایزوله بالا بیاد؛ نه روی ماشینی با دسترسی به سیستمهای پروداکشن، دادهٔ حساس یا شبکهٔ داخلی. مراحل بازتولید و پچ عمداً داخل کانتینر و با شبکهٔ قطع اجرا میشن و برای اجرای بدون نظارت، یه VM سختشده تو GCE با VPC-SC، سرویساکانت کمدسترسی و استوریج فقط-افزودنی الزامیه.
برای کارایی، پیشنهاد پروژه اینه که مدلها رو لایهلایه انتخاب کنین: مدلهای سبک و سریع برای تریاژ و حذف تکراریها، و مدلهای سنگین فرانتیر فقط برای مرحلههای بازتولید و پچ که استدلال عمیق میخوان. مرحلهٔ اعتبارسنجی هم با ۱۲ قاعدهٔ منفی، مثبتهای کاذب رو فیلتر میکنه، ولی مستندات تذکر میده که ریسک پایین با مثبت کاذب فرق داره و نباید باهم قاطی شن.
نویسندهها روی ذات ناقطعی مدلها هم تأکید دارن: ممکنه یه باگ منطقی تو پاس اول دیده نشه ولی تو پاس پنجم لو بره، برای همین اجرای چندبارهٔ حلقه توصیه شده. در عوض بعد از مدتی کیفیت یافتهها افت میکنه و مدل سراغ ایرادهای بیاهمیت میره. جدیترین توصیه هم اینه که هیچ یافتهای بدون تأیید یه متخصص امنیت گزارش نشه و گزارشهای انبوهِ تولیدشده با هوش مصنوعی برای نگهدارندههای پروژههای متنباز فرستاده نشه.
نکات کلیدی:
- خط لولهٔ ۱۵ مرحلهای بازبینی امنیتی روی ایجنتهای کدنویسی، با حالت مشترک تو فایلهای JSON
- حلقهٔ یادگیری بین دورها، از مثبتهای کاذب و شکست ابزارها درس میگیره
- قابل تنظیم برای RTL، IaC، پایپلاینهای ML و باینریهای کامپایلشده
- اجرا فقط تو محیط ایزوله؛ برای حالت بدون نظارت، VM سختشده الزامیه
- هر یافته باید دستی توسط متخصص امنیت تأیید شه




