Graphsignal؛ پروفایلر inference که گلوگاه مدل رو تو پروداکشن نشون میده
خلاصهٔ کاملتر
Graphsignal یه پلتفرم پروفایلینگ در مقیاس پروداکشن برای بار inference ـه؛ ادعاش اینه که به مهندسها دید لازم رو تو کل استک میده تا کارایی رو روی مدلها، موتورهای inference، GPU و بقیهٔ شتابدهندهها بهینه کنن. چیزی که ارائه میده شامل تایملاینهای پیوسته و با رزولوشن بالاست که مدت اجرای هر عملیات و میزان مصرف منابع رو تو طول بار کاری نشون میده.
برای LLMها، ترسینگ تولید متن رو داره: زمانبندی هر مرحله (per-step)، توان عبور توکن و شکست جزئیات latency برای موتورهای اصلی inference. در کنارش متریکهای سطح سیستم برای موتورها و سختافزار (CPU، GPU و شتابدهندهها)، مانیتورینگ خطاهای سطح دیوایس و خطاهای inference، و تلهمتری مخصوص ایجنتهای هوش مصنوعی برای پیداکردن گلوگاهها هم هست.
نصب و راهاندازی سرراسته: پکیج رو با نسخهٔ متناسب CUDA (graphsignal[cu12] یا graphsignal[cu13]) نصب میکنی و بعد دستور اجرای سرویست رو با graphsignal-run میپیچی. تنها متغیر محیطی اجباری، کلید API ـه و با GRAPHSIGNAL_TAG_ هم میشه تگ دلخواه (مثل نام محیط دیپلوی) به همهٔ سیگنالها چسبوند.
export GRAPHSIGNAL_API_KEY=my-api-key
graphsignal-run vllm serve my-model --port 8001اگه اپلیکیشنت خودش رو بوتاسترپ میکنه، بهجای CLI میتونی از پایتون graphsignal.watch() رو صدا بزنی — منتها اون حالت لازم داره پکیج مستقیم توی محیط خود اپلیکیشن نصب باشه. مستندات ادغام برای PyTorch، vLLM و SGLang هم موجوده.
دو تا نکته که برای استفادهٔ پروداکشنی مهمه: سربار و حریم خصوصی. جمعآوری فعالیت کرنلهای CUDA از طریق CUPTI و APIهای کمسربار انجام میشه و تحلیل و آپلود هم توی یه پروسهٔ sidecar اتفاق میافته، پس اثرش روی کارایی حداقلیه. پروفایلر فقط اتصال خروجی به api.graphsignal.com باز میکنه — هیچ اتصال یا دستور ورودی ممکن نیست — و محتوا و اطلاعات حساس مثل پرامپتها و خروجیهای مدل ضبط نمیشه.
یه قابلیت جالب هم داره: میشه اسکیل Graphsignal رو نصب کرد تا ایجنت کدنویسیت (مثل Claude Code، Codex یا Gemini) مستقیم کانتکست سیگنالها رو بگیره و تحلیل کنه — یعنی بهینهسازی رو هم به خود ایجنت بسپاری.
نکات کلیدی:
- پروفایلینگ پیوستهٔ inference: تایملاین عملیاتها و مصرف منابع در مقیاس پروداکشن
- ترسینگ تولید LLM با زمان هر مرحله، throughput توکن و شکست latency
- راهاندازی با پیچیدن دستور اجرا در graphsignal-run؛ ادغام با PyTorch، vLLM و SGLang
- سربار کم با CUPTI و پروسهٔ sidecar؛ پرامپت و خروجی ضبط نمیشه
- اسکیل مخصوص ایجنتهای کدنویسی برای تحلیل سیگنالها




