RAID5 یکی از رایجترین سطوح RAID در سرور HP است که برای ترکیب افزایش کارایی، استفاده بهینه از ظرفیت دیسک و محافظت در برابر خرابی یک هارد استفاده میشود. اما یک سؤال مهم برای مدیران شبکه و ادمینهای سرور وجود دارد: اگر دو هارد RAID5 در سرور HP بهصورت همزمان یا در فاصله زمانی کوتاه خراب شوند، چه اتفاقی برای اطلاعات میافتد؟ پاسخ کوتاه این است که RAID5 برای خرابی همزمان دو هارد طراحی نشده و در چنین شرایطی معمولاً آرایه RAID وارد وضعیت بحرانی میشود و دسترسی به اطلاعات ممکن است از بین برود.
در RAID5 اطلاعات و Parity بین تمام دیسکهای آرایه توزیع میشوند. این ساختار باعث میشود در صورت خرابی یک هارد، اطلاعات با استفاده از دادههای باقیمانده و Parity قابل بازسازی باشند. اما زمانی که دو دیسک بهطور همزمان از دسترس خارج شوند، اطلاعات مورد نیاز برای بازسازی کامل آرایه دیگر کافی نیست. بنابراین برخلاف تصور رایج، RAID5 یک راهکار Backup نیست و نمیتواند در برابر خرابی همزمان دو هارد از دادهها محافظت کند.
برای درک اتفاقی که هنگام خرابی دو هارد رخ میدهد، ابتدا باید ساختار RAID5 را بشناسیم. در این RAID، دادهها بین حداقل سه دیسک توزیع شده و علاوه بر داده اصلی، اطلاعات Parity نیز روی دیسکهای مختلف ذخیره میشود.
Parity نوعی اطلاعات محاسباتی است که کنترلر RAID از روی آن میتواند اطلاعات یک دیسک خراب را محاسبه و بازسازی کند. به همین دلیل اگر یکی از هاردهای RAID5 خراب شود، کنترلر میتواند آرایه را در حالت Degraded قرار دهد و پس از تعویض دیسک، فرآیند Rebuild را آغاز کند.
برای مثال، فرض کنید یک سرور HP دارای چهار هارد با ساختار RAID5 است:
البته در عمل Parity روی دیسکها بهصورت چرخشی توزیع میشود و یک دیسک ثابت مخصوص Parity وجود ندارد. اگر یکی از این دیسکها خراب شود، RAID5 همچنان میتواند اطلاعات را ارائه کند. اما اگر دو دیسک از آرایه RAID5 همزمان خراب شوند، کنترلر دیگر اطلاعات کافی برای بازسازی تمام Stripeها را در اختیار ندارد.
در سادهترین حالت، با خرابی دو هارد، RAID5 دیگر نمیتواند آرایه را به شکل صحیح بازسازی کند. بسته به مدل کنترلر، نوع خرابی و وضعیت آرایه، ممکن است یکی از حالتهای زیر اتفاق بیفتد:
نکته بسیار مهم این است که خاموش کردن یا روشن نگه داشتن سرور بهصورت تصادفی میتواند شرایط Recovery را پیچیدهتر کند. بنابراین اگر با چنین وضعیتی مواجه شدید، بهتر است قبل از هر اقدامی وضعیت RAID و دیسکها را بررسی کنید.

گاهی دو هارد واقعاً بهصورت همزمان خراب نشدهاند. ممکن است هارد اول خراب شده باشد و RAID5 وارد حالت Degraded شده باشد، اما قبل از اینکه Rebuild کامل شود، هارد دوم نیز Fail شود.
این سناریو بسیار خطرناک است.
فرض کنید در یک سرور HP، یکی از دیسکها خراب میشود. کنترلر RAID با استفاده از دیسک جدید شروع به Rebuild میکند. در این مدت، فشار خواندن و نوشتن روی دیسکهای باقیمانده افزایش پیدا میکند. اگر یکی از هاردهای قدیمی نیز وضعیت نامناسبی داشته باشد، ممکن است در همین فرآیند دچار خرابی شود.
در نتیجه:
Disk Failure → RAID5 Degraded → Rebuild → Second Disk Failure → RAID Failure
به همین دلیل، خرابی دوم لزوماً نباید در همان لحظه اتفاق بیفتد تا RAID5 از کار بیفتد.
اگر فقط یک هارد خراب شده و RAID5 هنوز در وضعیت Degraded قرار دارد، نباید تصور کنید که میتوان بدون عجله هر زمانی دیسک را تعویض کرد. اول باید وضعیت آرایه بررسی شود. در سرورهای HP/HPE معمولاً میتوان از ابزارهایی مانند HPE Smart Storage Administrator (SSA) یا ابزارهای مدیریتی مرتبط با کنترلر RAID برای بررسی وضعیت Logical Drive و Physical Drive استفاده کرد.
اطلاعات مهمی که باید بررسی شوند عبارتاند از:
اگر هاردی دارای وضعیت Predictive Failure باشد، باید آن را جدی گرفت. چنین پیامی میتواند نشان دهد که دیسک هنوز کاملاً از کار نیفتاده، اما احتمال خرابی آن افزایش یافته است.
این موضوع کاملاً به شرایط خرابی بستگی دارد. اگر دو هارد از نظر فیزیکی خراب شده باشند و RAID5 واقعاً دو عضو خود را از دست داده باشد، تعویض ساده هر دو هارد به معنی بازگشت خودکار اطلاعات نیست. این یکی از مهمترین نکاتی است که هنگام کار با RAID باید در نظر گرفت.
RAID Controller برای بازسازی اطلاعات به دادهها و Parity موجود در دیسکهای سالم نیاز دارد. وقتی دو عضو RAID5 از دست رفته باشند، اطلاعات لازم برای Reconstruct کردن تمام Stripeها وجود ندارد. بنابراین نباید صرفاً دو هارد جدید را وارد آرایه کرد و انتظار داشت اطلاعات برگردد.
در شرایطی که اطلاعات مهم هستند، بهتر است قبل از هرگونه عملیات Initialize، Clear Configuration، Rebuild اجباری یا ساخت مجدد Logical Drive، وضعیت فعلی آرایه مستندسازی شود.
در بسیاری از سرورهای HP/HPE، مدیریت RAID توسط کنترلرهای Smart Array انجام میشود. مدل کنترلر بسته به نسل و مدل سرور متفاوت است. برای مثال، سرورهای مختلف HPE ممکن است از کنترلرهایی مانند خانوادههای Smart Array استفاده کنند که امکاناتی مانند:
را ارائه میدهند. اما قابلیتهای دقیق RAID به مدل کنترلر، Firmware و Configuration بستگی دارد. بنابراین هنگام بررسی خرابی RAID5، فقط دانستن مدل سرور کافی نیست و باید مدل دقیق RAID Controller نیز مشخص شود.

Hot Spare میتواند ریسک را کاهش دهد، اما RAID5 را به RAID6 تبدیل نمیکند. فرض کنید یک هارد در RAID5 خراب میشود و یک Hot Spare آماده در سرور وجود دارد. کنترلر میتواند از Hot Spare برای شروع Rebuild استفاده کند. این قابلیت باعث میشود زمان قرار گرفتن آرایه در حالت Degraded کاهش پیدا کند.
اما اگر در حین Rebuild، یکی دیگر از هاردهای اصلی خراب شود، RAID5 همچنان توان تحمل دو خرابی را ندارد. بنابراین:
RAID5 + Hot Spare ≠ تحمل خرابی همزمان دو هارد
Hot Spare سرعت Recovery را افزایش میدهد، اما سطح تحمل خرابی RAID را تغییر نمیدهد.
اگر احتمال خرابی چند دیسک یا اهمیت اطلاعات زیاد است، RAID6 میتواند انتخاب مناسبتری باشد. RAID5 معمولاً توان تحمل خرابی یک دیسک را دارد، در حالی که RAID6 برای تحمل خرابی دو دیسک طراحی شده است. بهصورت ساده:
| RAID Level | حداقل دیسک | تحمل خرابی |
|---|---|---|
| RAID 0 | 2 | صفر دیسک |
| RAID 1 | 2 | یک دیسک |
| RAID 5 | 3 | یک دیسک |
| RAID 6 | 4 | دو دیسک |
| RAID 10 | 4 | وابسته به جفتهای Mirror |
البته انتخاب RAID فقط بر اساس تعداد خرابی قابل تحمل انجام نمیشود. Performance، ظرفیت قابل استفاده، Workload، نوع دیسک، زمان Rebuild و اهمیت سرویس نیز باید در نظر گرفته شوند.
خیر.
این یکی از مهمترین مفاهیمی است که در طراحی Storage باید در نظر گرفته شود. RAID برای افزایش Availability و تحمل خرابی سختافزار طراحی شده است، نه برای Backup. برای مثال اگر یک فایل اشتباهاً حذف شود، RAID5 نمیتواند نسخه قبلی آن را برگرداند. همچنین در صورت:
RAID الزاماً نمیتواند اطلاعات را Recover کند. بنابراین حتی اگر سرور HP شما دارای RAID5 باشد، باید یک Backup مستقل داشته باشید.
اگر با چنین سناریویی مواجه شدید، اقدامات عجولانه میتواند Recovery را سختتر کند. بهتر است این مراحل را دنبال کنید:
ابتدا مشخص کنید Logical Drive در چه وضعیتی قرار دارد و کدام Physical Driveها Failed یا Offline هستند.
مدل Smart Array Controller و Firmware آن را بررسی کنید.
ممکن است یک دیسک واقعاً خراب شده باشد و دیسک دیگر فقط Offline شده باشد. این دو وضعیت کاملاً متفاوت هستند.
اگر اطلاعات مهم هستند، بدون بررسی دقیق، Logical Drive جدید ایجاد نکنید.
جابجایی فیزیکی دیسکها بدون مستندسازی Slot و وضعیت RAID میتواند روند Recovery را پیچیدهتر کند.
اگر RAID واقعاً دو عضو خود را از دست داده و Backup معتبر ندارید، قبل از هر عملیات بازسازی، وضعیت Storage باید توسط متخصص بررسی شود.
بهترین راهکار، جلوگیری کامل از خرابی نیست؛ بلکه کاهش احتمال خرابی دوم قبل از Recovery است. برای این کار:
همچنین باید توجه داشت که زمان Rebuild با افزایش ظرفیت دیسکها اهمیت بیشتری پیدا میکند. یک هارد چند ترابایتی ممکن است برای بازسازی کامل RAID به زمان قابل توجهی نیاز داشته باشد و در این مدت آرایه آسیبپذیرتر است.
RAID5 برای سرورهای HP راهکاری مناسب برای ایجاد تعادل میان ظرفیت، Performance و تحمل خرابی یک دیسک است، اما برای خرابی همزمان دو هارد طراحی نشده است. اگر یک هارد خراب شود، RAID5 میتواند در حالت Degraded به کار خود ادامه دهد و پس از جایگزینی دیسک، Rebuild انجام شود. اما اگر قبل از تکمیل Recovery، دیسک دوم نیز از کار بیفتد، Logical Drive ممکن است Failed شود و دسترسی به اطلاعات از بین برود.
به همین دلیل، RAID5 نباید جایگزین Backup شود. اگر دادههای سرور اهمیت بالایی دارند، باید علاوه بر RAID، یک استراتژی Backup مستقل و قابل بازیابی داشته باشید. در سرورهای HP/HPE نیز قبل از تعویض یا Rebuild باید وضعیت دقیق Smart Array Controller، Logical Drive و Physical Driveها بررسی شود. اگر دو دیسک واقعاً Failed شدهاند و Backup در دسترس نیست، بهتر است بدون Initialize یا بازسازی مجدد RAID، ابتدا وضعیت آرایه توسط متخصص بررسی شود.