← Blog

فراتر از زمان‌داربودن: چگونه شرکت‌های جهانی زیرساخت مراکز داده را برای هوش مصنوعی، تاب‌آوری و انطباق بین‌المللی بازطراحی می‌کنند

مقدمه: زمانی که زیرساخت به گلوگاه — نه ستون فقرات — تبدیل می‌شود. برای مدیران ارشد اطلاعات (CIO) و رهبران زیرساخت در شرکت‌های چندملیتی، زیرساخت مراکز داده دیگر یک مرکز هزینهٔ ایستا نیست—بلکه عامل تعیین‌کننده (یا محدودکننده) سرعت آموزش مدل‌های هوش مصنوعی، همکاری بلادرنگ در ۱۲ منطقه زمانی مختلف و رعایت مقررات در حوزه‌های اتحادیه اروپا، آسیا-اقیانوسیه (APAC) و آمریکای لاتین (LATAM) است.

زیرساخت تاب‌آور مرکز داده

مقدمه: زمانی که زیرساخت به گلوگاه — نه ستون فقرات — تبدیل می‌شود

برای مدیران ارشد اطلاعات (CIO) و رهبران زیرساخت در شرکت‌های چندملیتی، زیرساخت مراکز داده دیگر یک مرکز هزینهٔ ایستا نیست—بلکه عامل تعیین‌کننده (یا محدودکننده) سرعت آموزش مدل‌های هوش مصنوعی، همکاری بلادرنگ در ۱۲ منطقه زمانی مختلف و رعایت مقررات در حوزه‌های اتحادیه اروپا، آسیا-اقیانوسیه (APAC) و آمریکای لاتین (LATAM) است. نظرسنجی گارتنر در سال ۲۰۲۳ نشان داد که ۶۸٪ از رهبران فناوری اطلاعات جهانی زیرساخت قدیمی مراکز داده را مهم‌ترین مانع پیاده‌سازی برنامه‌های ابرمحور (cloud-native) دانستند—بیش از نگرانی‌های امنیتی یا محدودیت‌های بودجه‌ای. گزارش مقایسه‌ای زیرساختی جوتو گلوبال (JOTO Global) در سال ۲۰۲۴، که بر اساس داده‌های ناشناس‌سازی‌شده از ۴۷ مشتری از فهرست فورچون ۵۰۰ تنظیم شده است، نشان داد که شرکت‌هایی که از زیرساخت مراکز داده ناهمگن و از نظر جغرافیایی پراکنده استفاده می‌کنند، ۳٫۲ برابر زمان بیشتری (میانگین زمان رفع خطا یا MTTR) برای واکنش به افزایش تاخیر در سطح بین‌مناطقی صرف می‌کنند و در دوره‌های حسابرسی GDPR، ۴۱٪ افزایش در زمان‌های توقف غیرمنتظره را تجربه می‌کنند. به عنوان مثال، اجرای تحلیل‌های زنجیره تأمین اروپا-خاورمیانه-آفریقا و آسیا-اقیانوسیه (EMEA-APAC) شرکت یونی‌لیور (Unilever) به دلیل عدم یکنواختی تراکم توان (کیلووات بر رک) و تفاوت در ضریب مصرف انرژی برای خنک‌سازی (PUE) (بیش از ۱٫۸ در جاکارتا در مقابل ۱٫۳ در دوبلین) ۱۱ هفته تأخیر داشت که مستقیماً بر دقت بهینه‌سازی موجودی تأثیر گذاشت. این مقاله به بررسی دقیق این موضوع می‌پردازد که چگونه سازمان‌های پیشرو در حال بازمهندسی زیرساخت — نه صرفاً ارتقای سخت‌افزار — هستند تا نتایج قابل‌اندازه‌گیری تجاری ایجاد کنند.

اول. توان، خنک‌سازی و تراکم فیزیکی: راننده‌های نادیده‌گرفته‌شدهٔ آمادگی برای هوش مصنوعی

طراحی حرارتی و پذیرش خنک‌سازی با غوطه‌وری مایع

بارهای کاری مدرن هوش مصنوعی به تراکم توان پایدار ۶ تا ۱۲ کیلووات بر رک نیاز دارند—که بسیار فراتر از نرمال‌های ۳ تا ۴ کیلووات بر رک در زیرساخت مراکز دادهٔ سنتی است. سیستم‌های خنک‌کننده با هوا در تراکم‌های بالاتر از ۵ کیلووات بر رک بدون استفاده از سیستم‌های جداسازی ردیف‌های گرم و سرد (hot/cold aisle containment) با مشکلاتی مانند محدودیت حرارتی (thermal throttling) و استفاده ناقص از GPU مواجه می‌شوند. خوشه محاسباتی فوق‌پیشرفته هوش مصنوعی آژور (Azure AI) مایکروسافت در کوئینسی، واشنگتن، با استفاده از خنک‌سازی دوفازی غوطه‌وری (two-phase immersion cooling)، توانست تراکم ۱۰۰ کیلووات بر رک را برای تنظیم دقیق (fine-tuning) مدل Llama-3 حفظ کند؛ این امر PUE را از ۱٫۵۲ به ۱٫۰۸ کاهش داد و نرخ خرابی GPU را در طی ۱۸ ماه ۶۳٪ کاهش داد. برای شرکت‌های جهانی، این بدان معناست که پیش از خرید سرورهای مبتنی بر GPUهای NVIDIA H100 یا Blackwell، باید فرضیات لایه فیزیکی را مجدداً ارزیابی کنند.

تاب‌آوری توان فراتر از سیستم UPS با پیکربندی N+1

ناپایداری شبکه برق همچنان شدید است: برزیل در سال ۲۰۲۳ میانگین ۱۲۴۷ دقیقه توقف سالانه در هر سایت را گزارش داد (ANATEL)؛ شبکه شمالی ویتنام در سه‌ماهه اول ۲۰۲۴، ۸۹ قطعی غیربرنامه‌ریزی‌شده بیش از ۵ دقیقه را ثبت کرد (EVN). امروزه تاب‌آوری واقعی نیازمند افزونگی چندمنبعی است: ریزشبکه‌های داخلی (مثلاً خورشیدی + باتری)، اتصالات به شبکه عمومی برق و پروتکل‌های خودکار کاهش بار (load shedding). جوتو گلوبال به یک تولیدکننده خودروی سطح اول در شهر مکزیک کمک کرد تا سیستم ترکیبی باتری لیتیوم-آهن-فسفات (LFP) و ژنراتور گاز طبیعی را راه‌اندازی کند که در طی ۲۲ ماه، زمان‌داربودن ۹۹٫۹۹۹۲٪ را تضمین کرد—که ۰٫۰۰۰۸٪ از سطح توافق‌نامه سطح خدمات (SLA) آن فراتر رفت. این دستاورد تنها زمانی ممکن شد که طراحی زیرساخت مراکز داده این شرکت، تله‌متی توان را در پلتفرم DCIM خود ادغام کرده بود تا نگهداری پیش‌بینی‌شونده امکان‌پذیر شود.

«محدودیت‌های حرارتی و توان امروزه دروازه‌بان اصلی مقیاس‌پذیری هوش مصنوعی هستند—نه مجوزهای نرم‌افزاری یا پهنای باند شبکه.» — دکتر لENA چو (Dr. Lena Cho)، معمار ارشد زیرساخت، جوتو گلوبال (سخنرانی کلیدی اوج گذار زیرساخت ۲۰۲۴)

دوم. معماری پارچه شبکه (Network Fabric): از تحمل تاخیر به قطعیت زیرمیلی‌ثانیه‌ای

تکامل معماری Spine-Leaf با اعمال سیاست‌های مبتنی بر قصد (Intent-Based)

شبکه‌های سنتی سه‌لایه، تاخیر شرقی-غربی (east-west) ۸ تا ۱۲ میلی‌ثانیه‌ای ایجاد می‌کنند—که برای خوشه‌های استنتاج توزیع‌شده در فرانکفورت، توکیو و سائوپائولو غیرقابل قبول است. زیرساخت مدرن مراکز داده از توپولوژی‌های spine-leaf مبتنی بر CLOS با ECMP و صفحه کنترل BGP EVPN استفاده می‌کند. اما صرفاً معماری کافی نیست: سیاست‌ها باید مبتنی بر قصد (intent-driven) باشند. در مرکز داده سنگاپور بانک HSBC، جوتو گلوبال با استفاده از Cisco ACI و ماژول‌های سفارشی Terraform، رویکردی را پیاده‌سازی کرد که لایه‌های VXLAN ریزتقسیم‌شده (microsegmented) را به‌صورت خودکار برای هر حوزه نظارتی (MAS، MAS-GL، PDPA) تخصیص دهد و زمان اعمال سیاست را از ۴٫۷ ساعت به ۹۲ ثانیه کاهش دهد.

اتصالات نوری برای خوشه‌بندی در مقیاس شهری (Metro-Scale)

برای شرکت‌هایی که از تکثیر همزمان پایگاه داده در سایت‌های شهری (<۸۰ کیلومتر) استفاده می‌کنند، اتصالات فیبر تاریک (dark fiber) مبتنی بر DWDM، جیتر را به کمتر از ۱٫۲ میکروثانیه کاهش می‌دهند—که برای تکثیر سیستم‌های SAP S/4HANA HANA حیاتی است. حلقه نوری فرانکفورت–مانهایم دویچه تله‌کام (Deutsche Telekom) به یک بیمه‌گر آلمانی کمک کرد تا RPO (Recovery Point Objective) خود را از ۴۷ ثانیه به صفر کاهش دهد و الزامات سخت‌گیرانهٔ تداوم عملیاتی بانک مرکزی آلمان (BaFin) را برآورده سازد.

سوم. مدیریت چرخه عمر سخت‌افزار: از نوسازی ۵ ساله به اعتبارسنجی مداوم اجزا

یکپارچگی زنجیره تأمین فرم‌웨ر

هشدار CISA AA23-244A در سال ۲۰۲۳، ۱۷ آسیب‌پذیری صفرروزه (zero-days) را که هدف BMC فرم‌웨ر در سیستم‌های Dell iDRAC و HPE iLO بودند، مستندسازی کرد. زیرساخت جهانی مراکز داده باید اعتبارسنجی SBOM (فهرست نرم‌افزاری مواد تشکیل‌دهنده یا Software Bill of Materials) را در زمان بوت (boot time) جاسازی کند. یکی از مشتریان جوتو گلوبال، یک شرکت داروسازی، به‌روزرسانی‌های فرم‌웨ر امضاشده را الزامی کرد که از طریق UEFI Secure Boot و تأییدیه TPM 2.0 تأیید می‌شدند—و در نتیجه ۳ حمله موفقیت‌آمیز به زنجیره تأمین را در سه‌ماهه دوم ۲۰۲۴ جلوگیری کرد.

چهارم. انطباق از طریق طراحی (Compliance-by-Design): جاسازی الزامات حقوقی منطقه‌ای در کد زیرساخت

ذخیره‌سازی و منطق پردازش با محدودیت جغرافیایی (Geo-Fenced)

مقاله ۴۴ GDPR و قانون حفاظت از اطلاعات شخصی چین (PIPL) هم‌زمان به «بومی‌سازی داده» (data residency) و «محل پردازش» (processing locality) احتیاج دارند. صرفاً برچسب‌گذاری جغرافیایی (geo-tagging) کافی نیست—زیرساخت باید این الزامات را اجرا کند. با استفاده از OpenStack Ironic + Kubernetes Topology Manager، جوتو گلوبال درگاه تخصیص خودخدمتی (self-service provisioning portal)‌ای را برای یک شرکت رسانه‌ای جهانی ساخت که انتخاب گزینه «فقط اتحادیه اروپا» به‌طور خودکار ماشین‌های مجازی (VM) را روی سخت‌افزار اختصاصی (bare metal) در فرانکفورت راه‌اندازی می‌کند و تمام ترافیک خروجی را از طریق نقاط دسترسی CDN (POP) در اتحادیه اروپا هدایت می‌کند—که این امر از طریق برچسب‌گذاری Netflow geoIP تأیید و با فیلترهای eBPF اجرا می‌شود.

پیشنهادات عملی

  1. قبل از خرید سخت‌افزار هوش مصنوعی، ارزیابی حرارتی و تراکم توان زیرساخت مراکز داده را انجام دهید—مقدار واقعی کیلووات بر رک را تحت بار پایدار اندازه‌گیری کنید، نه فقط بر اساس مقادیر اسمی (nameplate ratings).
  2. جایگزینی تیکت‌های دستی تغییرات شبکه با خطوط اجرای زیرساخت-به‌عنوان-کد (IaC) مبتنی بر GitOps با استفاده از Argo CD و ماژول‌های Terraform معتبر—مشتریان جوتو گلوبال در ۱۲ ماه، خطاهای پیکربندی شبکه را ۷۹٪ کاهش دادند.
  3. ادغام اسکن SBOM فرم‌웨ر سخت‌افزار در خطوط CI/CD با استفاده از Syft + Grype؛ الزامی کردن وضعیت «بدون CVE» برای تمام اجزای BMC و فرم‌웨ر.
  4. راه‌اندازی DCIM متن‌باز (مثلاً NetBox + Prometheus + Grafana) برای همبستگی معیارهای توان، حرارتی و شبکه—این روش در ۳۲٪ از ارزیابی‌های زیرساختی جوتو گلوبال در سال ۲۰۲۴، یک ناکارآمدی پنهان در سیستم خنک‌سازی را آشکار کرد.
  5. الزامی کردن ارائه گزارش‌های SOC 2 نوع II با گواهی ISO/IEC 27001 از تأمین‌کنندگان زیرساخت با دامنه‌ای که به‌وضوح شامل عملیات فیزیکی مراکز داده باشد، نه صرفاً APIهای ابری.

جمع‌بندی

زیرساخت مراکز داده دیگر درباره رک‌ها، توان و لوله‌ها نیست—بلکه پایه‌ای قابل‌برنامه‌نویسی، قابل‌حسابرسی و آگاه از مقررات منطقه‌ای برای سرعت‌بخشی به هوش مصنوعی، اعتماد نظارتی و تداوم عملیاتی جهانی است. همان‌طور که با تأخیرهای ناشی از تاخیر در اجرای Unilever، مزایای خودکارسازی سیاست در HSBC و تکثیر بدون RPO در دویچه تله‌کام نشان داده شد، صرفاً برتری فنی کافی نیست. آنچه شرکت‌های جهانی پرفورمنس بالا را از سایرین متمایز می‌کند، توانایی آن‌ها در برخورد با زیرساخت مراکز داده به‌عنوان یک اثر مهندسی درجه یک است: نسخه‌بندی‌شده، تست‌شده، مطابق با مقررات و به‌طور مداوم بهینه‌سازی‌شده. موج بعدی رهبری زیرساخت از واحد UPSهای بزرگ‌تر یا رک‌های متراکم‌تر نمی‌آید—بلکه از ادغام دقیق‌تر بین تله‌متی لایه فیزیکی، سیاست‌به‌عنوان-کد (policy-as-code) و معیارهای نتایج تجاری نشأت می‌گیرد. همان‌طور که چارچوب بلوغ زیرساختی جوتو گلوبال نشان می‌دهد، سازمان‌هایی که امتیاز ≥۴٫۲ از ۵ را در بلوغ قابلیت مشاهده‌پذیری زیرساخت (infrastructure observability maturity) کسب کنند، ۳٫۱ برابر سریع‌تر به ارزش (time-to-value) در ابتکارات هوش مصنوعی دست می‌یابند و ۴۷٪ کاهش در یافته‌های حسابرسی مرتبط با زیرساخت را تجربه می‌کنند. پشته زیرساخت امروزه مهم‌ترین پایگاه کد شماست.