سرور ۴۸ هزار دلاری با ۶ GPU: ارزشش داشت؟
خلاصهٔ کاملتر
نویسنده بعد از خروج از یه شغل در یه شرکت بزرگ فناوری (FAANG)، تصمیم گرفت بهعنوان محقق مستقل روی مدلهای زبانی بزرگ (LLM) کار کنه. برای این کار به GPU نیاز داشت و بهجای اجاره از ابر، یه سرور شخصی با ۶ عدد کارت گرافیک RTX 6000 Ada ساخت که اسمش رو گذاشت «grumbl».
انتخاب بین A100، H100 و RTX 6000 Ada بود. چون کارش بیشتر inference (اجرای مدل، نه فقط آموزش) داشت و نرخ قیمت به عملکرد 6000 Ada بهتر بود، این کارت رو انتخاب کرد. یه چالش مهم هم محدودیت برق آپارتمان بود؛ برای اینکه ۶ GPU به دو مدار برق جداگانه نیاز داشتن، مجبور شد از دو منبع تغذیه مجزا استفاده کنه — کاری که ریسک ایمنی داشت و برای انجام درستش از یه متخصص کمک گرفت.
برای اینکه بفهمه خرید GPU صرفه داشته یا نه، هر دقیقه مصرف هر GPU رو لاگ گرفت و با قیمت اجاره on-demand ابر مقایسه کرد. میانگین کلی استفاده ۷۶ درصد بود و از ابتدای ۲۰۲۵ به ۸۵ درصد رسید. نویسنده میگه انتظار داشت این عدد بالای ۹۵٪ باشه، ولی زمانهای بیکاری بین آزمایشها این رقم رو پایین آورد.
محاسبه نهایی اینه: هزینه خرید سرور ۴۸ هزار دلار، هزینه برق حدود ۳ هزار دلار (۱۲۵ دلار در ماه)، و اجاره معادل این پردازش از ابر تا مارس ۲۰۲۶ حدود ۶۸ هزار دلار تموم میشد. پس تا الان ۱۷ هزار دلار صرفهجویی شده و از این به بعد هر روز ۹۰ تا ۱۰۵ دلار هم اضافه میشه.
ولی نویسنده تأکید میکنه هدف اصلی صرفهجویی نبود، بلکه آزادی عمل در اجرای آزمایشهای ریسکپذیر بود. وقتی GPU خودته، احساس میکنی اجرا نکردن آزمایش هزینه داره، نه اجرا کردنش. این تغییر ذهنیت خیلی مهمه. در نهایت هم یه پروژه موفق داشت که ادعا میکنه یه مشکل اساسی LLMها رو حل کرده.
چند نکته مهم برای کسایی که میخوان همین کار رو بکنن:
- مادربردی که انتخاب کرد interconnect (ارتباط بین GPUها) کندی داشت، برای مدلهایی که روی چند GPU تقسیم میشن ضعیفه.
- بیمه رنتر معمولی این سرور رو پوشش نمیده، باید بیمه تجاری گرفت.
- اگه دوباره این کار رو میکرد، یه سرور دیتاسنتر استاندارد میخرید و توی یه colocation center (مرکز داده اشتراکی) قرارش میداد.
نکات کلیدی:
- ۶ عدد RTX 6000 Ada با هزینه کل ۴۸ هزار دلار
- صرفهجویی ۱۷ هزار دلاری نسبت به اجاره ابری
- میانگین استفاده ۷۶٪ (از ابتدای ۲۰۲۵: ۸۵٪)
- هزینه برق حدود ۱۲۵ دلار در ماه
- تغییر ذهنیت از «اجرا کردن آزمایش هزینه داره» به «اجرا نکردن هزینه داره»
- برای کارهای موازی روی مدلهای کوچک عالیه، برای مدلهای بزرگ multi-GPU ضعیفتره




