بازسازی RAID یکی از مهمترین فرآیندهایی است که پس از خرابی یا تعویض یکی از هاردهای سرور HP انجام میشود. زمانی که یک دیسک در آرایه RAID از کار میافتد، کنترلر RAID تلاش میکند اطلاعات از دسترفته را روی هارد جایگزین بازسازی کند. این فرآیند که با عنوان RAID Rebuild شناخته میشود، بسته به نوع RAID، ظرفیت هاردها، نوع کنترلر، تعداد دیسکها و میزان فعالیت سرور میتواند از چند ساعت تا حتی چندین روز طول بکشد.
در سرورهای HP، که امروزه بیشتر با نام HPE شناخته میشوند، کنترلرهایی مانند Smart Array نقش اصلی را در مدیریت RAID و فرآیند بازسازی RAID بر عهده دارند. بنابراین نمیتوان برای تمام سرورها یک زمان ثابت تعیین کرد. برای مثال، بازسازی RAID یک آرایه کوچک با هاردهای 300GB ممکن است چند ساعت زمان ببرد، در حالی که بازسازی RAID روی آرایهای با چندین هارد 8TB یا 12TB میتواند مدت بسیار بیشتری طول بکشد.
بازسازی RAID فرآیندی است که در آن اطلاعات مربوط به یک دیسک خراب یا از دسترفته، با استفاده از اطلاعات موجود روی سایر دیسکهای آرایه و در صورت امکان Parity، روی هارد جدید ایجاد میشود. فرض کنید یک سرور HP دارای RAID 5 با چند هارد باشد و یکی از هاردها خراب شود. در این حالت، اطلاعات سرور معمولاً همچنان در دسترس هستند، اما آرایه وارد وضعیت Degraded میشود. پس از نصب یک هارد سالم و سازگار، کنترلر RAID فرآیند RAID Rebuild را آغاز میکند.
در طول بازسازی RAID، کنترلر دادهها را از دیسکهای موجود میخواند و اطلاعات موردنیاز را روی دیسک جایگزین مینویسد. به همین دلیل، سرعت بازسازی به شدت به سرعت خواندن و نوشتن دیسکها و همچنین وضعیت فعلی سرور وابسته است.

مدت زمان بازسازی RAID در سرور HP عدد ثابتی نیست. در شرایط مختلف ممکن است این فرآیند چند ساعت، یک روز یا حتی بیشتر طول بکشد. بهصورت تقریبی:
| ظرفیت هارد | نوع RAID | زمان احتمالی بازسازی |
|---|---|---|
| 300GB تا 600GB | RAID 1 / RAID 5 | چند ساعت |
| 900GB تا 1.2TB | RAID 5 / RAID 6 | حدود چند ساعت تا یک روز |
| 2TB تا 4TB | RAID 5 / RAID 6 | حدود 8 تا 24 ساعت یا بیشتر |
| 8TB | RAID 5 / RAID 6 | ممکن است بیش از یک روز طول بکشد |
| 10TB تا 12TB | RAID 5 / RAID 6 | ممکن است چند روز زمان نیاز داشته باشد |
این اعداد فقط تخمینی هستند و نباید بهعنوان زمان قطعی بازسازی RAID در نظر گرفته شوند. یک آرایه با هاردهای سریع و بار کاری کم ممکن است سریعتر Rebuild شود، در حالی که همان ظرفیت در یک سرور کاملاً مشغول میتواند بسیار دیرتر بازسازی شود.
عوامل مختلفی میتوانند سرعت بازسازی RAID را افزایش یا کاهش دهند. شناخت این عوامل برای عیبیابی سرور و تخمین زمان RAID Rebuild اهمیت زیادی دارد.
یکی از مهمترین عوامل، ظرفیت دیسک است. هرچه ظرفیت هارد بیشتر باشد، مقدار دادهای که باید بررسی، محاسبه و روی دیسک جایگزین نوشته شود نیز بیشتر خواهد بود. برای مثال، بازسازی RAID یک آرایه با هاردهای 600GB معمولاً بسیار سریعتر از آرایهای با هاردهای 10TB یا 12TB انجام میشود.
نکته مهم این است که حتی اگر هارد خراب تقریباً خالی بوده باشد، کنترلر RAID الزاماً فقط فضای پرشده را Rebuild نمیکند. بسته به نوع کنترلر، تنظیمات و ساختار RAID، ممکن است بخش بسیار بزرگی از آرایه نیاز به پردازش داشته باشد.
نوع RAID تأثیر مستقیمی روی فرآیند بازسازی RAID دارد.
نوع و سرعت دیسک نیز بسیار مهم است. هاردهای SAS Enterprise معمولاً برای استفاده در سرور طراحی شدهاند و میتوانند عملکرد متفاوتی نسبت به هاردهای SATA داشته باشند. همچنین سرعت چرخش دیسک، مثلاً 7.2K RPM یا 10K RPM، روی عملکرد I/O تأثیر میگذارد.
اگر سرور HP از SSD استفاده کند، در بسیاری از سناریوها سرعت عملیات I/O بسیار بالاتر از HDD خواهد بود و این موضوع میتواند روی زمان بازسازی RAID تأثیر مثبت داشته باشد. البته سرعت Rebuild فقط به سرعت یک هارد بستگی ندارد؛ کل آرایه و نحوه مدیریت I/O توسط کنترلر اهمیت دارد.
کنترلر RAID یکی از مهمترین قطعات در فرآیند بازسازی RAID سرور HP است. سرورهای HPE ممکن است از کنترلرهای مختلف خانواده Smart Array استفاده کنند. مدل کنترلر، میزان Cache، قابلیتهای پردازشی و تنظیمات آن میتواند روی عملکرد RAID Rebuild تأثیر بگذارد. برای مثال، اگر کنترلر RAID مجبور باشد همزمان حجم زیادی از درخواستهای I/O کاربران را پردازش کند، ممکن است منابع کمتری را به بازسازی RAID اختصاص دهد.
اگر سرور در زمان Rebuild تحت بار کاری سنگین باشد، فرآیند بازسازی ممکن است طولانیتر شود. فرض کنید روی سرور یک ماشین مجازی VMware، دیتابیس یا فایلسرور فعال باشد و کاربران دائماً در حال خواندن و نوشتن اطلاعات باشند. در این شرایط کنترلر باید بین سرویسدهی به کاربران و بازسازی RAID منابع I/O را تقسیم کند. بنابراین ممکن است Rebuild در ساعات کاری بسیار کندتر از ساعات کممصرف باشد.
بسیاری از کنترلرهای RAID امکان تنظیم اولویت Rebuild را دارند. اگر اولویت بازسازی RAID پایین تنظیم شده باشد، کنترلر منابع بیشتری را برای عملیات عادی سرور اختصاص میدهد و Rebuild آهستهتر انجام میشود. در مقابل، افزایش Rebuild Priority میتواند باعث شود فرآیند بازسازی سریعتر انجام شود؛ اما ممکن است عملکرد سرویسهای اصلی سرور در این مدت کاهش پیدا کند.
به همین دلیل انتخاب اولویت مناسب به شرایط کاری سرور بستگی دارد.

در بسیاری از سرورهای HP، پس از خرابی یک دیسک در آرایه Redundant، سرویسها همچنان قابل استفاده هستند و بازسازی RAID میتواند در پسزمینه انجام شود. اما این موضوع به نوع RAID و وضعیت آرایه بستگی دارد.
برای مثال، RAID 5 پس از خرابی یک دیسک معمولاً وارد وضعیت Degraded میشود اما همچنان میتواند به سرویسدهی ادامه دهد. با این حال، عملکرد ممکن است کاهش پیدا کند.
مهمتر از آن، در زمان بازسازی RAID آرایه آسیبپذیرتر است. اگر در یک RAID 5 دیسک دیگری نیز در زمان Rebuild خراب شود، ممکن است کل آرایه و اطلاعات آن در معرض از دست رفتن قرار بگیرد.
به همین دلیل نباید صرفاً به RAID بهعنوان جایگزین Backup اعتماد کرد.
اگر مشاهده میکنید بازسازی RAID سرور HP بسیار طولانی شده است، چند مورد را بررسی کنید:
گاهی اوقات کند بودن Rebuild به معنای خراب بودن کنترلر نیست. ممکن است کنترلر عمداً سرعت بازسازی RAID را محدود کرده باشد تا عملکرد سرویسهای اصلی سرور بیش از حد کاهش پیدا نکند.
در بعضی شرایط بله، اما افزایش سرعت Rebuild باید با احتیاط انجام شود.
اولین اقدام، بررسی وضعیت RAID Controller و تنظیمات آن است. در سرورهای HP میتوان از ابزارهای مدیریتی HPE برای مشاهده وضعیت Logical Drive، Physical Drive و RAID Controller استفاده کرد.
همچنین باید مطمئن شوید هارد جایگزین کاملاً سازگار است. استفاده از یک دیسک با ظرفیت یا مشخصات نامناسب میتواند باعث ایجاد مشکل در فرآیند بازسازی RAID شود.
اگر سرور در ساعات کاری بار بسیار زیادی دارد، انجام Rebuild با اولویت بالاتر ممکن است عملکرد سرویسها را تحت تأثیر قرار دهد. بنابراین در محیطهای Production باید بین سرعت بازسازی RAID و Performance سرویسها تعادل برقرار شود.

برای بررسی وضعیت بازسازی RAID باید وضعیت Logical Drive و Physical Drive را بررسی کنید. در محیط مدیریتی HPE، وضعیتهایی مانند:
میتوانند اطلاعات مهمی درباره وضعیت آرایه ارائه دهند. اگر Logical Drive از حالت Degraded خارج شده و وضعیت آن به حالت سالم تغییر کرده باشد، معمولاً فرآیند بازسازی RAID به پایان رسیده است. همچنین باید وضعیت تمام Physical Driveها بررسی شود تا مطمئن شوید دیسک دیگری خطا ندارد.
تمام شدن بازسازی RAID به معنی پایان بررسی نیست. بهتر است پس از تکمیل Rebuild، وضعیت سلامت تمام دیسکها، کنترلر و Logical Drive بررسی شود. اگر یکی از هاردهای دیگر خطاهای SMART، Media Error یا Predictive Failure داشته باشد، احتمال خرابی مجدد وجود دارد.
همچنین بررسی Backup بسیار مهم است. RAID برای افزایش Availability و تحمل خرابی دیسک طراحی شده است، اما Backup وظیفه حفاظت از اطلاعات در برابر حذف، خرابی گسترده، خطای انسانی و سایر اتفاقات را بر عهده دارد.
زمان بازسازی RAID سرور HP به عوامل مختلفی مانند ظرفیت دیسک، نوع RAID، نوع HDD یا SSD، سرعت دیسکها، مدل Smart Array Controller، میزان Load سرور و تنظیمات Rebuild Priority بستگی دارد. به همین دلیل نمیتوان گفت هر بازسازی RAID مثلاً دقیقاً 5 یا 10 ساعت طول میکشد. یک RAID کوچک ممکن است در چند ساعت بازسازی شود، اما یک آرایه سروری با هاردهای چند ترابایتی میتواند به یک روز یا حتی چند روز زمان نیاز داشته باشد.
اگر RAID Rebuild بیش از حد معمول طول میکشد، بهتر است قبل از متوقف کردن فرآیند یا انجام تغییرات، وضعیت کنترلر، دیسکها، Logical Drive و خطاهای ثبتشده بررسی شود. قطع کردن یا دستکاری اشتباه فرآیند بازسازی RAID میتواند ریسک از دست رفتن اطلاعات را افزایش دهد. در سرورهای HP/HPE، بهترین رویکرد این است که ابتدا وضعیت دقیق آرایه و هاردها مشخص شود و سپس بر اساس مدل سرور، کنترلر RAID و ظرفیت دیسکها درباره زمان موردنیاز برای بازسازی RAID تصمیمگیری شود