Smart Array چگونه خرابی هارد را پیش‌بینی می‌کند؟

Smart Array چگونه خرابی هارد را پیش‌بینی می‌کند

خرابی هارد سرور یکی از مشکلاتی است که می‌تواند از یک اختلال ساده در عملکرد سیستم تا از دست رفتن دسترسی به اطلاعات را به دنبال داشته باشد. در سرور HP، کنترلرهای Smart Array با استفاده از اطلاعاتی که از وضعیت هارد دیسک‌ها دریافت می‌کنند، می‌توانند بعضی از نشانه‌های خرابی را قبل از از کار افتادن کامل هارد تشخیص دهند. این قابلیت باعث می‌شود مدیر شبکه فرصت داشته باشد هارد معیوب را پیش از ایجاد مشکل جدی تعویض کند.

اما Smart Array دقیقاً چگونه متوجه می‌شود که یک هارد در حال خراب شدن است؟ آیا می‌تواند خرابی را به‌طور قطعی پیش‌بینی کند؟ در این مقاله، مکانیزم Predictive Failure در Smart Array، نقش S.M.A.R.T، وضعیت RAID و هشدارهای کنترلر را بررسی می‌کنیم.

HPE Smart Array مجموعه‌ای از کنترلرهای RAID است که برای مدیریت هاردهای متصل به سرورهای HPE طراحی شده‌اند. این کنترلرها وظایفی مانند ایجاد و مدیریت RAID، بررسی وضعیت درایوها، مدیریت Hot Spare و بازسازی آرایه را انجام می‌دهند.

Smart Array فقط داده‌ها را بین سرور و هارد جابه‌جا نمی‌کند؛ بلکه دائماً وضعیت درایوها را نیز زیر نظر دارد. اگر کنترلر متوجه شود که یک هارد رفتار غیرعادی دارد، می‌تواند وضعیت آن را به شکل‌هایی مانند OK، Predictive Failure، Failed یا وضعیت‌های مشابه گزارش کند. همین قابلیت یکی از دلایل مهم استفاده از RAID در سرورهاست؛ چون هدف فقط افزایش سرعت یا ایجاد افزونگی نیست، بلکه تشخیص و مدیریت خرابی هم اهمیت زیادی دارد.

Smart Array برای تشخیص وضعیت هارد تنها به یک پارامتر وابسته نیست. اطلاعات مختلفی از درایو و کنترلر بررسی می‌شود. یکی از مهم‌ترین منابع این اطلاعات، قابلیت‌های مانیتورینگ داخلی هارد است. بسیاری از هاردهای SAS و SATA اطلاعاتی درباره سلامت و عملکرد خود ارائه می‌کنند. این اطلاعات می‌تواند شامل خطاهای خواندن و نوشتن، خطاهای رسانه، وضعیت مکانیزم داخلی هارد و سایر شاخص‌های مرتبط با سلامت درایو باشد.

کنترلر Smart Array این اطلاعات را دریافت و تحلیل می‌کند. اگر تعداد یا الگوی خطاها به حدی برسد که احتمال خرابی آینده درایو بالا باشد، ممکن است وضعیت آن به Predictive Failure تغییر کند. بنابراین Predictive Failure به این معنی نیست که هارد حتماً در چند ساعت آینده از کار می‌افتد؛ بلکه یعنی کنترلر شواهدی پیدا کرده که نشان می‌دهد ادامه استفاده از این درایو می‌تواند ریسک خرابی را افزایش دهد.

آیا Smart Array می‌تواند خرابی هارد را 100 درصد پیش‌بینی کند؟

یکی از فناوری‌های مهم در این زمینه S.M.A.R.T (Self-Monitoring, Analysis and Reporting Technology) است. این فناوری برای پایش پارامترهای مختلف سلامت درایو استفاده می‌شود. برای مثال، هارد ممکن است اطلاعاتی درباره تعداد خطاهای خواندن، سکتورهای مشکل‌دار، سکتورهای Remap شده یا سایر شاخص‌های داخلی در اختیار سیستم قرار دهد.

البته نباید تصور کرد Smart Array صرفاً یک عدد S.M.A.R.T را می‌خواند و بر اساس آن درباره خرابی تصمیم می‌گیرد. نحوه گزارش وضعیت به مدل هارد، نوع رابط، Firmware، نسل کنترلر و معماری ذخیره‌سازی بستگی دارد. در هاردهای Enterprise، مخصوصاً درایوهای SAS مورد استفاده در سرورهای HPE، کنترلر و Firmware نقش مهمی در مدیریت وضعیت درایو دارند.

فرض کنید یک هارد هنوز کاملاً کار می‌کند و سرور نیز بدون مشکل در حال سرویس‌دهی است، اما هارد شروع به تولید خطاهای غیرعادی کرده است. در چنین شرایطی ممکن است کنترلر Smart Array هنوز درایو را Failed اعلام نکند، زیرا هارد هنوز قابل استفاده است. اما اگر شواهد موجود نشان دهند که احتمال خرابی در آینده افزایش یافته، کنترلر می‌تواند آن را Predictive Failure گزارش کند.

تفاوت این دو وضعیت بسیار مهم است:

  • OK: درایو از نظر کنترلر وضعیت عادی دارد.
  • Predictive Failure: هارد هنوز کار می‌کند، اما نشانه‌هایی از احتمال خرابی وجود دارد.
  • Failed: درایو دیگر قابل اعتماد یا قابل استفاده نیست و باید تعویض شود.

به همین دلیل، مشاهده Predictive Failure را نباید نادیده گرفت.

خیر. هیچ سیستم مانیتورینگی نمی‌تواند خرابی تمام هاردها را با قطعیت پیش‌بینی کند. ممکن است یک هارد بدون هیچ هشدار قبلی به دلیل خرابی ناگهانی قطعات الکترونیکی، آسیب فیزیکی، مشکل Firmware یا عوامل دیگر از کار بیفتد. از طرف دیگر، ممکن است درایوی که Predictive Failure گرفته، برای مدتی همچنان بدون مشکل کار کند.

بنابراین بهتر است Predictive Failure را به عنوان هشدار افزایش ریسک خرابی در نظر بگیریم، نه یک زمان‌بندی دقیق برای پایان عمر هارد.

یکی از مزایای اصلی Smart Array این است که تشخیص خرابی با مدیریت RAID ترکیب می‌شود. برای مثال، در یک RAID 5 اگر یکی از هاردها Failed شود، اطلاعات همچنان می‌توانند از طریق Parity در دسترس باشند. اما این وضعیت نباید باعث شود تعویض هارد را به تأخیر بیندازیم.

در RAID 6 تحمل خرابی بیشتر است و آرایه می‌تواند همزمان خرابی تعداد بیشتری از درایوها را تحمل کند. با این حال، حتی در RAID 6 نیز Predictive Failure باید جدی گرفته شود. زیرا هرچه تعداد هاردهای مشکل‌دار بیشتر شود، ریسک خرابی‌های بعدی و فشار روی آرایه افزایش پیدا می‌کند.

در سرورهایی که Hot Spare پیکربندی شده است، مدیریت خرابی هارد می‌تواند سریع‌تر انجام شود. اگر یک درایو واقعاً Failed شود، کنترلر می‌تواند از Hot Spare برای شروع فرآیند بازسازی RAID استفاده کند. در برخی سناریوها نیز تشخیص Predictive Failure می‌تواند باعث شود مدیر سیستم قبل از خرابی کامل درایو برای تعویض آن اقدام کند.

این موضوع در سرورهای تولیدی اهمیت زیادی دارد؛ زیرا هدف اصلی، کاهش زمان قرار گرفتن RAID در وضعیت Degraded است.

برای بررسی وضعیت هاردهای سرور HPE می‌توان از ابزارهای مختلف استفاده کرد. یکی از ابزارهای شناخته‌شده، HPE Smart Storage Administrator یا HPE SSA است. در محیط SSA می‌توان اطلاعاتی مانند:

  • وضعیت Logical Drive
  • وضعیت Physical Drive
  • نوع RAID
  • وضعیت Hot Spare
  • ظرفیت و مدل درایو
  • وضعیت Health
  • هشدارهای مربوط به درایو

را بررسی کرد.

در بعضی سرورها نیز وضعیت درایوها از طریق iLO قابل مشاهده است. iLO می‌تواند اطلاعات مربوط به Storage و Health سرور را در اختیار مدیر سیستم قرار دهد.

از کجا بفهمیم هارد Predictive Failure دارد؟

اولین کار، تهیه یا بررسی وضعیت Backup است. RAID به هیچ عنوان جایگزین Backup نیست. بعد از آن باید مشخص شود کدام Physical Drive هشدار گرفته و آرایه در چه وضعیتی قرار دارد. بهتر است قبل از تعویض، مدل دقیق هارد، Interface، ظرفیت، فرم‌فاکتور و سازگاری آن با کنترلر و سرور بررسی شود.

در سرورهای HP معمولاً استفاده از درایوهای سازگار و دارای Firmware مناسب اهمیت زیادی دارد.

اگر سرور از RAID استفاده می‌کند، هارد معیوب را نباید بدون توجه به وضعیت آرایه خارج کرد. تعویض اشتباه یک درایو سالم می‌تواند وضعیت RAID را بدتر کند. پس از تعویض، کنترلر معمولاً فرآیند Rebuild را آغاز می‌کند. مدت زمان Rebuild به ظرفیت درایو، نوع RAID، میزان I/O سرور و تنظیمات کنترلر بستگی دارد.

Predictive Failure یک سیستم پیش‌بینی کامل نیست. بعضی خرابی‌ها به شکل تدریجی ایجاد می‌شوند و نشانه‌هایی دارند؛ اما برخی خرابی‌ها ناگهانی هستند. برای مثال، خرابی برد الکترونیکی هارد یا برخی مشکلات مکانیکی ممکن است بدون ایجاد هشدار قابل‌توجه اتفاق بیفتند.

به همین دلیل، حتی اگر تمام هاردهای Smart Array وضعیت OK داشته باشند، باز هم باید Backup، مانیتورینگ و وضعیت RAID به صورت منظم بررسی شود.

گاهی اوقات مشاهده خطا در یک هارد الزاماً به معنی خراب بودن خود هارد نیست. کابل، Backplane، اتصال SAS، Firmware کنترلر یا حتی مشکل در مسیر ارتباطی می‌تواند باعث ایجاد خطا شود. بنابراین اگر یک درایو خطا می‌دهد، نباید بدون بررسی سایر عوامل فوراً آن را تعویض کرد.

بررسی Event Log، وضعیت سایر درایوها، خطاهای کنترلر و وضعیت Backplane می‌تواند به تشخیص دقیق‌تر کمک کند. این موضوع مخصوصاً زمانی مهم است که چند هارد به صورت همزمان رفتار غیرعادی نشان دهند. خرابی همزمان چند درایو معمولاً نیازمند بررسی زیرساخت و مسیر ارتباطی نیز هست.

در یک سرور حیاتی، معمولاً بهتر است Predictive Failure را جدی بگیرید و برای تعویض درایو برنامه‌ریزی کنید. اما نحوه تعویض به وضعیت RAID بستگی دارد. اگر آرایه سالم است و فقط یک درایو Predictive Failure دارد، می‌توان با برنامه‌ریزی مناسب و در نظر گرفتن Backup، هارد را تعویض کرد.

اگر RAID در وضعیت Degraded قرار دارد یا چند درایو مشکل دارند، موضوع حساس‌تر می‌شود و قبل از هر اقدامی باید وضعیت آرایه و Backup بررسی شود.

Smart Array با بررسی اطلاعات سلامت و خطاهای درایو و تحلیل وضعیت Storage، می‌تواند در برخی موارد قبل از خرابی کامل هارد، احتمال خرابی آن را تشخیص دهد. نتیجه این فرآیند ممکن است به شکل Predictive Failure نمایش داده شود.

با این حال، Predictive Failure یک پیش‌بینی قطعی نیست و نمی‌تواند زمان دقیق خرابی را مشخص کند. بهترین رویکرد این است که این هشدار را جدی بگیریم، وضعیت RAID و Backup را بررسی کنیم و در صورت تأیید مشکل، درایو را با یک مدل سازگار جایگزین کنیم.

در نهایت، Smart Array زمانی بیشترین ارزش را دارد که در کنار RAID، Hot Spare، iLO، HPE SSA و Backup منظم استفاده شود. این ترکیب به مدیر سرور اجازه می‌دهد بسیاری از مشکلات Storage را قبل از تبدیل شدن به یک خرابی جدی شناسایی و مدیریت کند.

محصول با موفقیت به سبد خرید اضافه شد.
تماس با ما