اگر دو هارد RAID5 در سرور HP همزمان خراب شوند چه می‌شود؟

اگر دو هارد RAID5 در سرور HP همزمان خراب شوند چه می‌شود؟

RAID5 یکی از رایج‌ترین سطوح RAID در سرور HP است که برای ترکیب افزایش کارایی، استفاده بهینه از ظرفیت دیسک و محافظت در برابر خرابی یک هارد استفاده می‌شود. اما یک سؤال مهم برای مدیران شبکه و ادمین‌های سرور وجود دارد: اگر دو هارد RAID5 در سرور HP به‌صورت همزمان یا در فاصله زمانی کوتاه خراب شوند، چه اتفاقی برای اطلاعات می‌افتد؟ پاسخ کوتاه این است که RAID5 برای خرابی همزمان دو هارد طراحی نشده و در چنین شرایطی معمولاً آرایه RAID وارد وضعیت بحرانی می‌شود و دسترسی به اطلاعات ممکن است از بین برود.

در RAID5 اطلاعات و Parity بین تمام دیسک‌های آرایه توزیع می‌شوند. این ساختار باعث می‌شود در صورت خرابی یک هارد، اطلاعات با استفاده از داده‌های باقی‌مانده و Parity قابل بازسازی باشند. اما زمانی که دو دیسک به‌طور همزمان از دسترس خارج شوند، اطلاعات مورد نیاز برای بازسازی کامل آرایه دیگر کافی نیست. بنابراین برخلاف تصور رایج، RAID5 یک راهکار Backup نیست و نمی‌تواند در برابر خرابی همزمان دو هارد از داده‌ها محافظت کند.

برای درک اتفاقی که هنگام خرابی دو هارد رخ می‌دهد، ابتدا باید ساختار RAID5 را بشناسیم. در این RAID، داده‌ها بین حداقل سه دیسک توزیع شده و علاوه بر داده اصلی، اطلاعات Parity نیز روی دیسک‌های مختلف ذخیره می‌شود.

Parity نوعی اطلاعات محاسباتی است که کنترلر RAID از روی آن می‌تواند اطلاعات یک دیسک خراب را محاسبه و بازسازی کند. به همین دلیل اگر یکی از هاردهای RAID5 خراب شود، کنترلر می‌تواند آرایه را در حالت Degraded قرار دهد و پس از تعویض دیسک، فرآیند Rebuild را آغاز کند.

برای مثال، فرض کنید یک سرور HP دارای چهار هارد با ساختار RAID5 است:

  • Disk 1: Data
  • Disk 2: Data
  • Disk 3: Data
  • Disk 4: Data + Parity distribution

البته در عمل Parity روی دیسک‌ها به‌صورت چرخشی توزیع می‌شود و یک دیسک ثابت مخصوص Parity وجود ندارد. اگر یکی از این دیسک‌ها خراب شود، RAID5 همچنان می‌تواند اطلاعات را ارائه کند. اما اگر دو دیسک از آرایه RAID5 همزمان خراب شوند، کنترلر دیگر اطلاعات کافی برای بازسازی تمام Stripeها را در اختیار ندارد.

در ساده‌ترین حالت، با خرابی دو هارد، RAID5 دیگر نمی‌تواند آرایه را به شکل صحیح بازسازی کند. بسته به مدل کنترلر، نوع خرابی و وضعیت آرایه، ممکن است یکی از حالت‌های زیر اتفاق بیفتد:

  1. آرایه وارد وضعیت Failed شود.
  2. Logical Drive از دسترس خارج شود.
  3. سیستم‌عامل نتواند Volume مربوط به RAID را Mount کند.
  4. بخشی یا تمام اطلاعات غیرقابل دسترسی شود.
  5. در صورت ادامه فعالیت سیستم، احتمال Corruption داده‌ها افزایش پیدا کند.

نکته بسیار مهم این است که خاموش کردن یا روشن نگه داشتن سرور به‌صورت تصادفی می‌تواند شرایط Recovery را پیچیده‌تر کند. بنابراین اگر با چنین وضعیتی مواجه شدید، بهتر است قبل از هر اقدامی وضعیت RAID و دیسک‌ها را بررسی کنید.

خرابی دو هارد RAID5 -1

گاهی دو هارد واقعاً به‌صورت همزمان خراب نشده‌اند. ممکن است هارد اول خراب شده باشد و RAID5 وارد حالت Degraded شده باشد، اما قبل از اینکه Rebuild کامل شود، هارد دوم نیز Fail شود.

این سناریو بسیار خطرناک است.

فرض کنید در یک سرور HP، یکی از دیسک‌ها خراب می‌شود. کنترلر RAID با استفاده از دیسک جدید شروع به Rebuild می‌کند. در این مدت، فشار خواندن و نوشتن روی دیسک‌های باقی‌مانده افزایش پیدا می‌کند. اگر یکی از هاردهای قدیمی نیز وضعیت نامناسبی داشته باشد، ممکن است در همین فرآیند دچار خرابی شود.

در نتیجه:

Disk Failure → RAID5 Degraded → Rebuild → Second Disk Failure → RAID Failure

به همین دلیل، خرابی دوم لزوماً نباید در همان لحظه اتفاق بیفتد تا RAID5 از کار بیفتد.

اگر فقط یک هارد خراب شده و RAID5 هنوز در وضعیت Degraded قرار دارد، نباید تصور کنید که می‌توان بدون عجله هر زمانی دیسک را تعویض کرد. اول باید وضعیت آرایه بررسی شود. در سرورهای HP/HPE معمولاً می‌توان از ابزارهایی مانند HPE Smart Storage Administrator (SSA) یا ابزارهای مدیریتی مرتبط با کنترلر RAID برای بررسی وضعیت Logical Drive و Physical Drive استفاده کرد.

اطلاعات مهمی که باید بررسی شوند عبارت‌اند از:

  • وضعیت Logical Drive
  • وضعیت Physical Drive
  • مدل و ظرفیت دیسک
  • وضعیت Rebuild
  • نوع RAID Controller
  • خطاهای ثبت‌شده در کنترلر
  • وضعیت Hot Spare
  • خطاهای Predictive Failure

اگر هاردی دارای وضعیت Predictive Failure باشد، باید آن را جدی گرفت. چنین پیامی می‌تواند نشان دهد که دیسک هنوز کاملاً از کار نیفتاده، اما احتمال خرابی آن افزایش یافته است.

این موضوع کاملاً به شرایط خرابی بستگی دارد. اگر دو هارد از نظر فیزیکی خراب شده باشند و RAID5 واقعاً دو عضو خود را از دست داده باشد، تعویض ساده هر دو هارد به معنی بازگشت خودکار اطلاعات نیست. این یکی از مهم‌ترین نکاتی است که هنگام کار با RAID باید در نظر گرفت.

RAID Controller برای بازسازی اطلاعات به داده‌ها و Parity موجود در دیسک‌های سالم نیاز دارد. وقتی دو عضو RAID5 از دست رفته باشند، اطلاعات لازم برای Reconstruct کردن تمام Stripeها وجود ندارد. بنابراین نباید صرفاً دو هارد جدید را وارد آرایه کرد و انتظار داشت اطلاعات برگردد.

در شرایطی که اطلاعات مهم هستند، بهتر است قبل از هرگونه عملیات Initialize، Clear Configuration، Rebuild اجباری یا ساخت مجدد Logical Drive، وضعیت فعلی آرایه مستندسازی شود.

در بسیاری از سرورهای HP/HPE، مدیریت RAID توسط کنترلرهای Smart Array انجام می‌شود. مدل کنترلر بسته به نسل و مدل سرور متفاوت است. برای مثال، سرورهای مختلف HPE ممکن است از کنترلرهایی مانند خانواده‌های Smart Array استفاده کنند که امکاناتی مانند:

  • RAID 0
  • RAID 1
  • RAID 5
  • RAID 6
  • RAID 10
  • Hot Spare
  • Online Capacity Expansion

را ارائه می‌دهند. اما قابلیت‌های دقیق RAID به مدل کنترلر، Firmware و Configuration بستگی دارد. بنابراین هنگام بررسی خرابی RAID5، فقط دانستن مدل سرور کافی نیست و باید مدل دقیق RAID Controller نیز مشخص شود.

مقایسه RAID5 و RAID6

Hot Spare می‌تواند ریسک را کاهش دهد، اما RAID5 را به RAID6 تبدیل نمی‌کند. فرض کنید یک هارد در RAID5 خراب می‌شود و یک Hot Spare آماده در سرور وجود دارد. کنترلر می‌تواند از Hot Spare برای شروع Rebuild استفاده کند. این قابلیت باعث می‌شود زمان قرار گرفتن آرایه در حالت Degraded کاهش پیدا کند.

اما اگر در حین Rebuild، یکی دیگر از هاردهای اصلی خراب شود، RAID5 همچنان توان تحمل دو خرابی را ندارد. بنابراین:

RAID5 + Hot Spare ≠ تحمل خرابی همزمان دو هارد

Hot Spare سرعت Recovery را افزایش می‌دهد، اما سطح تحمل خرابی RAID را تغییر نمی‌دهد.

اگر احتمال خرابی چند دیسک یا اهمیت اطلاعات زیاد است، RAID6 می‌تواند انتخاب مناسب‌تری باشد. RAID5 معمولاً توان تحمل خرابی یک دیسک را دارد، در حالی که RAID6 برای تحمل خرابی دو دیسک طراحی شده است. به‌صورت ساده:

RAID Levelحداقل دیسکتحمل خرابی
RAID 02صفر دیسک
RAID 12یک دیسک
RAID 53یک دیسک
RAID 64دو دیسک
RAID 104وابسته به جفت‌های Mirror

البته انتخاب RAID فقط بر اساس تعداد خرابی قابل تحمل انجام نمی‌شود. Performance، ظرفیت قابل استفاده، Workload، نوع دیسک، زمان Rebuild و اهمیت سرویس نیز باید در نظر گرفته شوند.

خیر.

این یکی از مهم‌ترین مفاهیمی است که در طراحی Storage باید در نظر گرفته شود. RAID برای افزایش Availability و تحمل خرابی سخت‌افزار طراحی شده است، نه برای Backup. برای مثال اگر یک فایل اشتباهاً حذف شود، RAID5 نمی‌تواند نسخه قبلی آن را برگرداند. همچنین در صورت:

  • حذف تصادفی اطلاعات
  • Ransomware
  • خرابی File System
  • خطای نرم‌افزاری
  • خرابی چند دیسک
  • خرابی کنترلر
  • خطای انسانی

RAID الزاماً نمی‌تواند اطلاعات را Recover کند. بنابراین حتی اگر سرور HP شما دارای RAID5 باشد، باید یک Backup مستقل داشته باشید.

اگر با چنین سناریویی مواجه شدید، اقدامات عجولانه می‌تواند Recovery را سخت‌تر کند. بهتر است این مراحل را دنبال کنید:

1. وضعیت RAID را بررسی کنید

ابتدا مشخص کنید Logical Drive در چه وضعیتی قرار دارد و کدام Physical Driveها Failed یا Offline هستند.

2. مدل دقیق کنترلر را مشخص کنید

مدل Smart Array Controller و Firmware آن را بررسی کنید.

3. وضعیت هاردها را بررسی کنید

ممکن است یک دیسک واقعاً خراب شده باشد و دیسک دیگر فقط Offline شده باشد. این دو وضعیت کاملاً متفاوت هستند.

4. از Initialize کردن RAID خودداری کنید

اگر اطلاعات مهم هستند، بدون بررسی دقیق، Logical Drive جدید ایجاد نکنید.

5. دیسک‌ها را جابه‌جا نکنید

جابجایی فیزیکی دیسک‌ها بدون مستندسازی Slot و وضعیت RAID می‌تواند روند Recovery را پیچیده‌تر کند.

6. در صورت اهمیت داده‌ها، سراغ متخصص Recovery بروید

اگر RAID واقعاً دو عضو خود را از دست داده و Backup معتبر ندارید، قبل از هر عملیات بازسازی، وضعیت Storage باید توسط متخصص بررسی شود.

بهترین راهکار، جلوگیری کامل از خرابی نیست؛ بلکه کاهش احتمال خرابی دوم قبل از Recovery است. برای این کار:

  • از هاردهای مناسب Enterprise استفاده کنید.
  • وضعیت SMART و Predictive Failure را بررسی کنید.
  • Firmware کنترلر را مدیریت کنید.
  • از Hot Spare مناسب استفاده کنید.
  • دمای هاردها را کنترل کنید.
  • Backup مستقل داشته باشید.
  • وضعیت RAID را به‌صورت دوره‌ای Monitor کنید.
  • بعد از خرابی یک دیسک، Rebuild را بدون بررسی وضعیت سایر دیسک‌ها شروع نکنید.
  • برای Workloadهای حساس، RAID6 یا RAID10 را بررسی کنید.

همچنین باید توجه داشت که زمان Rebuild با افزایش ظرفیت دیسک‌ها اهمیت بیشتری پیدا می‌کند. یک هارد چند ترابایتی ممکن است برای بازسازی کامل RAID به زمان قابل توجهی نیاز داشته باشد و در این مدت آرایه آسیب‌پذیرتر است.

RAID5 برای سرورهای HP راهکاری مناسب برای ایجاد تعادل میان ظرفیت، Performance و تحمل خرابی یک دیسک است، اما برای خرابی همزمان دو هارد طراحی نشده است. اگر یک هارد خراب شود، RAID5 می‌تواند در حالت Degraded به کار خود ادامه دهد و پس از جایگزینی دیسک، Rebuild انجام شود. اما اگر قبل از تکمیل Recovery، دیسک دوم نیز از کار بیفتد، Logical Drive ممکن است Failed شود و دسترسی به اطلاعات از بین برود.

به همین دلیل، RAID5 نباید جایگزین Backup شود. اگر داده‌های سرور اهمیت بالایی دارند، باید علاوه بر RAID، یک استراتژی Backup مستقل و قابل بازیابی داشته باشید. در سرورهای HP/HPE نیز قبل از تعویض یا Rebuild باید وضعیت دقیق Smart Array Controller، Logical Drive و Physical Driveها بررسی شود. اگر دو دیسک واقعاً Failed شده‌اند و Backup در دسترس نیست، بهتر است بدون Initialize یا بازسازی مجدد RAID، ابتدا وضعیت آرایه توسط متخصص بررسی شود.

محصول با موفقیت به سبد خرید اضافه شد.
تماس با ما