AWS DevOps Agent: ساخت یه SRE خودکار از صفر تا صد
خلاصهٔ کاملتر
تیمهای SRE و DevOps معمولاً ساعتها وقت میذارن تا وقتی یه مشکل توی سیستم رخ میده، دادهها رو از ابزارهای مختلف کنار هم بذارن و ریشه اصلی خطا رو پیدا کنن. AWS DevOps Agent اومده تا این فرایند رو زیر و رو کنه؛ یه ایجنت خودکار و همیشهفعال که بلافاصله بعد از رخ دادن یه incident، خودش شروع به تحقیق میکنه و بدون دخالت مستمر انسان، ریشه مشکل رو پیدا میکنه.
معماری این راهحل روی سه اکانت AWS مجزا بنا شده: یکی برای اپلیکیشن اصلی که زیرساخت تحت مانیتورینگ توشه، یکی برای Splunk که لاگها رو جمعآوری و آنالیز میکنه، و یکی برای خود AWS DevOps Agent که موتور تحقیق خودکار توشه. جریان داده اینطوریه که وقتی یه CloudWatch Alarm فعال میشه، یه EventBridge اون رو به یه Lambda function میفرسته، و اون Lambda یه webhook به DevOps Agent میزنه تا تحقیق شروع بشه.
برای راهاندازی، اول باید یه Agent Space بسازی که دامنهی دسترسی و ابزارهای ایجنت رو تعریف میکنه. بعدش باید webhook ایجاد کنی؛ این webhook یه schema مشخص داره که شامل فیلدهایی مثل eventType، priority، incidentId و توضیح رویداده. برای امنیت ارتباط، از HMAC (یه روش رمزنگاری برای تأیید هویت پیامها) استفاده میشه:
const hmac = createHmac("sha256", secret);
hmac.update(`${timestamp}:${JSON.stringify(payload)}`, "utf8");
const signature = hmac.digest("base64");
fetch(webhookUrl, {
method: "POST",
headers: {
"x-amzn-event-timestamp": timestamp,
"x-amzn-event-signature": signature,
},
body: JSON.stringify(payload),
});برای یکپارچهسازی با Splunk، باید Splunk MCP Server رو فعال کنی تا ایجنت بتونه لاگها رو از طریق پروتکل MCP بخونه. چون webhook پیشفرض Splunk از هدرهای سفارشی و احراز هویت پشتیبانی نمیکنه، از افزونهای به اسم Better Webhooks استفاده میشه. اتصال به Slack هم سادهست: بعد از ثبت اپ در تنظیمات DevOps Agent، کافیه با تایپ کردن /invite @AWS DevOps Agent توی کانال، ایجنت رو دعوت کنی. برای GitHub هم یه OAuth flow داری که دسترسی read-only به ریپوها رو فعال میکنه تا ایجنت بتونه تاریخچه deploymentها رو با incidentها مقایسه کنه.
یه ویژگی مهم دیگه، DevOps Agent Skills هستن؛ دایرکتوریهایی از فایلهای Markdown که بهت اجازه میده رویهها و runbookهای تیمت رو به ایجنت یاد بدی. مثلاً میتونی مشخص کنی که برای آلارمها از Dynatrace، برای لاگها از Splunk، و برای لاگهای serverless از CloudWatch استفاده بشه.
بعد از اینکه ایجنت ریشه مشکل رو پیدا کرد، میتونی از قابلیت Generate Mitigation Plan استفاده کنی. این برنامه چهار فاز داره: Prepare، Pre-Validate، Apply، و Post-Validate. جالبتر اینه که ایجنت یه agent-ready spec هم تولید میکنه که میشه مستقیم به یه coding agent مثل Kiro داد تا تغییرات لازم رو توی کدبیس پیاده کنه — بدون اینکه لازم باشه مراحل رفع خطا رو دستی به کد ترجمه کنی.
نکات کلیدی:
- AWS DevOps Agent یه ایجنت خودکار SREه که incidentها رو بلافاصله بررسی میکنه
- با CloudWatch، Splunk، GitHub و Slack یکپارچه میشه
- Webhook با امنیت HMAC، پل بین CloudWatch Alarm و ایجنته
- Skills به ایجنت یاد میده از چه منابع و رویههایی پیروی کنه
- برنامه رفع خطا بهصورت agent-ready spec تولید میشه تا coding agentها مثل Kiro بتونن مستقیم اجراش کنن
- زمان رسیدن به ریشه مشکل (MTTR) از ساعتها به دقیقهها کاهش پیدا میکنه




