مدیریت و عیب‌یابی Cluster در Dell PowerStore؛ راهنمای Service Scripts قسمت سوم

مدیریت Cluster در Dell PowerStore با Service Scripts این قسمت، سه حوزه اصلی را پوشش می‌دهد: خاموش‌کردن SAN Cluster، عیب‌یابی Failureهای ایجاد یا تغییر Cluster و بازیابی Cluster در شرایط خرابی Appliance. ابزارهای اصلی این بخش svc_cluster، svc_cluster_diag و svc_cluster_management هستند.

این مقاله ادامه قسمت دوم راهنما است. در قسمت قبل، Service Scriptهای مربوط به CAC/PIV، نگهداری پارتیشن root، پاک‌کردن وضعیت DIMM و Firmware Update Alert بررسی شدند. در این قسمت تمرکز به عملیات Cluster و Recovery منتقل می‌شود.

خلاصه مقاله

svc_cluster برای Shutdown تمام Applianceهای SAN Cluster استفاده می‌شود. svc_cluster_diag خطاهای مرتبط با ایجاد Cluster، افزودن Appliance یا حذف Appliance را بررسی می‌کند و svc_cluster_management برای مشاهده وضعیت، Detach، آماده‌سازی Reattach، Reattach و انتقال Primary Appliance به کار می‌رود.

مسیر مطالعه این راهنما

جایگاه قسمت سوم در مجموعه

قسمت قبلی: مدیریت امنیت و Maintenance در Dell PowerStore

قسمت فعلی: مدیریت و عیب‌یابی Cluster در Dell PowerStore

قسمت بعدی: Counter Collection و پیکربندی SLIC در Dell PowerStore

Service Scriptهای Cluster در این قسمت

سه Service Script این قسمت وظایف متفاوتی در سطح Cluster و Appliance دارند. تفاوت در دامنه، Mode، سطح دسترسی و اثر احتمالی عملیات باعث می‌شود پیش از اجرای هر Command، مشخصات همان Script بررسی شود.

مقایسه Service Scriptهای Cluster
Service Scriptکاربرد اصلیدامنه
svc_clusterShutdown تمام Applianceهای SAN ClusterCluster
svc_cluster_diagعیب‌یابی Failureهای ایجاد یا تغییر ClusterNode و Cluster
svc_cluster_managementRecovery و مدیریت Applianceهای ClusterAppliance

خاموش کردن SAN Cluster با svc_cluster

Service Script با نام svc_cluster برای خاموش‌کردن همه Applianceهای یک SAN Cluster استفاده می‌شود. عملیات Shutdown این Script فقط برای SAN Clusterها مجاز است.

کاربرد و الزامات svc_cluster

این عملیات در سطح Cluster اجرا می‌شود و Master Appliance باید در Normal Mode قرار داشته باشد. گذرواژه Service لازم است، اما root access نیاز نیست.

مشخصات عملیاتی svc_cluster
ویژگیمقدار
کاربردService
گذرواژه Serviceلازم است
دسترسی rootلازم نیست
احتمال عدم دسترس‌پذیری دادهبله
احتمال از دست رفتن دادهخیر
دامنهCluster
پیش‌نیازMaster Appliance باید در Normal Mode باشد

فرمت دستور و پارامترها

فرمت دستور
svc_cluster [-h] {shutdown} [-f] [-d]
پارامترهای svc_cluster
پارامترتوضیح
-h, --helpپیام Help را نمایش می‌دهد و خارج می‌شود.
-d, --debugDebugging را برای Verbose Logging فعال می‌کند.
-f, --forceWarningها را نادیده می‌گیرد و Shutdown را به‌اجبار انجام می‌دهد.
هشدار

استفاده از پارامتر -f برای اجبار Shutdown می‌تواند باعث عدم دسترس‌پذیری داده شود.

عملیات Shutdown و محدودیت SAN Cluster

عملیات shutdown همه Applianceهای یک SAN Cluster را خاموش می‌کند. این عملیات فقط برای SAN Clusterها مجاز است.

عیب‌یابی ایجاد Cluster با svc_cluster_diag

svc_cluster_diag برای کمک به عیب‌یابی مشکلاتی طراحی شده است که هنگام ایجاد Cluster، افزودن Appliance یا حذف Appliance رخ می‌دهند. فرآیند Diagnostics شامل بررسی Journal، Hardware Check و در صورت نیاز Data Collection است.

فرآیند تشخیص Hardware Fault

مرحله اول، بررسی Journal برای Hardware Checkهای قبلی است. هدف، شناسایی Hardware Faultهایی است که ممکن است پیش از عملیات ایجاد Cluster رخ داده باشند.

سپس Hardware Check فعلی سیستم اجرا می‌شود. این بررسی مشکلات Hardware موجود در سیستم را نمایش می‌دهد.

  1. Journal برای Hardware Checkهای قبلی بررسی می‌شود.
  2. Hardware Check فعلی سیستم اجرا می‌شود.
  3. در صورت نیاز، Data Collection انجام می‌شود.

بررسی وضعیت FAULTED_UNCONFIGURED

Hardware Check زمانی اهمیت ویژه دارد که عملیات ایجاد Cluster با وضعیت FAULTED_UNCONFIGURED شکست خورده باشد.

اگر Hardware Fault وجود داشته باشد، عملیات ایجاد Cluster قابل انجام نیست. در صورت تشخیص Fault، وضعیت به FAULTED_UNCONFIGURED تغییر می‌کند و Cluster Creation شکست می‌خورد.

Data Collection پس از Failure

پس از بررسی Hardware، از کاربر پرسیده می‌شود که آیا Data Collection انجام شود یا خیر. این مرحله پس از Failure ایجاد Cluster امکان جمع‌آوری داده پیش از Log Rotation را فراهم می‌کند.

در این مرحله امکان تنظیم IP برای سیستم نیز وجود دارد تا Collect Data از مسیر مستقیم و IP Address از سیستم کپی شود.

فرمت دستور و سطوح Log

فرمت دستور
svc_cluster_diag [-h] [-w] [-d] [-e] [-i]
سطوح Log در svc_cluster_diag
پارامترعملکرد
-h, --helpنمایش Help و خروج
-w, --warningLevelنمایش Logهای WARN
-i, --infoLevelنمایش Logهای INFO
-e, --errorLevelنمایش Logهای ERROR
-d, --debugLevelنمایش Logهای DEBUG
مشخصات عملیاتی svc_cluster_diag
ویژگیمقدار
کارکردعیب‌یابی
ModeNormal و Service
کاربرداستفاده عمومی
گذرواژه Serviceخیر
دسترسی rootخیر
احتمال عدم دسترس‌پذیری دادهبله
احتمال از دست رفتن دادهبله
دامنهNode و Cluster
پیش‌نیازهیچ‌کدام

نمونه اجرای svc_cluster_diag

در نمونه زیر Logهای موردنیاز دیگر در دسترس نیستند. پس از اجرای Command، سیستم امکان Data Collection را پیشنهاد می‌دهد.

نمونه دستور
svc_cluster_diag -w
The log statements that are needed to collect information for the command:
 'journalctl --utc -t control-path | egrep "\[CC\]" | grep WARN' are no longer
available
Would you like to perform a data collection? Please enter 'yes' or 'no'
yes
Running data collection - This might take awhile
data collection ID f10a1ebb-5727-4a84-aa29-58df29274bcc
Status OK
HTTP Code 201

مدیریت Cluster با svc_cluster_management

svc_cluster_management به Service Provider اجازه می‌دهد Appliance موجود در Cluster را Attach یا Detach کرده و وضعیت آن را مشاهده کند. این Script برای سناریوهای Recovery استفاده می‌شود.

سناریوی Recovery در Cluster دو-Appliance

اگر در یک Cluster دو-Appliance یکی از Applianceها Fail شود یا دیگر نتواند با Appliance دیگر ارتباط برقرار کند، Appliance باقی‌مانده ممکن است غیرقابل‌مدیریت شود.

در این شرایط Appliance معیوب می‌تواند از Cluster جدا شود تا قابلیت مدیریت Appliance باقی‌مانده بازیابی شود. پس از رفع مشکل، Appliance جداشده برای Reattach آماده و دوباره به Cluster متصل می‌شود.

الزامات و سطح دسترسی

مشخصات عملیاتی svc_cluster_management
ویژگیمقدار
کارکردبازیابی
ModeNormal
کاربردService
گذرواژه ServiceN/A
دسترسی rootبله
احتمال عدم دسترس‌پذیری دادهبله
احتمال از دست رفتن دادهخیر
دامنهAppliance
پیش‌نیازهیچ‌کدام

عملیات و پارامترهای svc_cluster_management

فرمت دستور
svc_cluster_management [-h] [e] [-n <value>]
{GetClusterStatus,DetachFailedAppliance,PrepReattachAppliance,ReattachAppliance,MovePrimaryAppliance}
عملیات Cluster Management
عملیاتکاربرد
GetClusterStatusوضعیت فعلی Cluster را نمایش می‌دهد.
DetachFailedApplianceAppliance معیوب را Detach می‌کند.
PrepReattachApplianceAppliance را برای Reattach آماده می‌کند.
ReattachApplianceAppliance را Reattach می‌کند.
MovePrimaryApplianceنقش Primary را به Appliance دیگری منتقل می‌کند.

پارامتر --check_eligibility یا -e Nodeهایی را نمایش می‌دهد که واجد شرایط Primary Node شدن هستند. پارامتر --nodeid یا -n Node موردنظر برای تبدیل‌شدن به Primary Node جدید Cluster را مشخص می‌کند.

انتقال Primary Appliance

عملیات MovePrimaryAppliance نقش Primary را به Appliance دیگری منتقل می‌کند. Node مقصد با شناسه آن مشخص می‌شود.

انتخاب Primary Node جدید

در نمونه زیر Node دارای ID برابر 4 به‌عنوان Primary Appliance در Cluster انتخاب می‌شود.

نمونه دستور
svc_cluster_management MovePrimaryAppliance -n 4

محدودیت Data Path

هشدار

اگر Data Path آفلاین است یا در Read-only Mode قرار دارد، عملیات MovePrimaryAppliance را اجرا نکنید. اجرای این عملیات در چنین شرایطی باعث از دست رفتن امکان مدیریت Cluster می‌شود.

حذف و اتصال مجدد Appliance

در Cluster دو-Appliance، اگر یک Appliance معیوب باشد، svc_cluster_management امکان Detach کردن آن و سپس Reattach کردن Appliance پس از رفع مشکل را فراهم می‌کند.

  1. وضعیت Cluster و Applianceها را بررسی کنید.
  2. Appliance معیوب را Detach کنید.
  3. پس از رفع مشکل، Appliance را برای Reattach آماده کنید.
  4. Appliance را دوباره به Cluster متصل کنید.

بررسی وضعیت Cluster

نمونه دستور
svc_cluster_management status
---CLUSTER STATUS---
local is primary: False
master id: 0
---APPLIANCE LIST---
id: 2
name: appliance_j8xxmd2
ip address: fd73:51fc:80d:0:201:4471:dcbb:4bce
online: False
id: 1
name: appliance_j8y1nd2
ip address: fd73:51fc:80d:0:201:4432:1df9:41da
online: True

خروجی وضعیت مشخص می‌کند کدام Appliance Online و کدام Appliance Offline است و مبنای تشخیص Appliance معیوب برای مرحله Detach قرار می‌گیرد.

Detach کردن Appliance معیوب

نمونه دستور
svc_cluster_management detach
detach failed appliance success!

آماده‌سازی Appliance برای Reattach

پس از رفع مشکل Appliance، مرحله آماده‌سازی برای اتصال مجدد اجرا می‌شود.

نمونه دستور
svc_cluster_management prep_attach
prep reattach appliance success

اتصال مجدد Appliance

پس از تکمیل مرحله آماده‌سازی، Appliance دوباره به Cluster متصل می‌شود.

نمونه دستور
svc_cluster_management attach
reattach appliance success

خلاصه:

ترتیب Workflow بازیابی Appliance شامل بررسی status، اجرای detach، آماده‌سازی با prep_attach و در نهایت اجرای attach است.

نکات و هشدارهای عملیاتی

Shutdown در سطح Cluster

svc_cluster همه Applianceهای SAN Cluster را خاموش می‌کند و ممکن است باعث عدم دسترس‌پذیری داده شود.

Cluster Diagnostics

svc_cluster_diag در Normal و Service Mode قابل استفاده است و در مشخصات آن احتمال عدم دسترس‌پذیری و از دست رفتن داده ذکر شده است.

Cluster Recovery

svc_cluster_management به root access نیاز دارد و MovePrimaryAppliance در وضعیت Offline یا Read-only بودن Data Path نباید اجرا شود.

جمع‌بندی مدیریت Cluster

مدیریت Cluster در Dell PowerStore با Service Scripts این قسمت سه Workflow متفاوت را پوشش می‌دهد. svc_cluster برای Shutdown در سطح SAN Cluster، svc_cluster_diag برای بررسی Failureهای Cluster Creation و تغییرات Appliance و svc_cluster_management برای Recovery و مدیریت Applianceهای Cluster استفاده می‌شود.

در سناریوی خرابی Appliance، ترتیب بررسی وضعیت، Detach، رفع مشکل، آماده‌سازی Reattach و اتصال مجدد اهمیت دارد. انتقال Primary Appliance نیز باید با توجه به وضعیت Data Path انجام شود.

سوالات متداول

آیا svc_cluster برای همه Clusterهای PowerStore قابل استفاده است؟

خیر. عملیات Shutdown این Service Script فقط برای SAN Clusterها مجاز است.

آیا اجرای svc_cluster به root access نیاز دارد؟

خیر. گذرواژه Service لازم است، اما root access برای این Script نیاز نیست.

svc_cluster_diag چه زمانی کاربرد دارد؟

برای عیب‌یابی مشکلاتی که هنگام ایجاد Cluster، افزودن Appliance یا حذف Appliance رخ می‌دهند طراحی شده است.

وجود Hardware Fault چه اثری روی Cluster Creation دارد؟

اگر Hardware Fault وجود داشته باشد، ایجاد Cluster انجام نمی‌شود و در صورت تشخیص Fault وضعیت به FAULTED_UNCONFIGURED تغییر می‌کند.

آیا Cluster Diagnostics می‌تواند Data Collection انجام دهد؟

بله. در فرآیند Diagnostics از کاربر درباره انجام Data Collection سؤال می‌شود تا اطلاعات موردنیاز، به‌خصوص پس از Failure، جمع‌آوری شوند.

برای Reattach کردن Appliance چه ترتیبی وجود دارد؟

ابتدا وضعیت Cluster بررسی و Appliance معیوب Detach می‌شود. پس از رفع مشکل، Appliance برای Reattach آماده و سپس دوباره به Cluster متصل می‌شود.

چه زمانی MovePrimaryAppliance نباید اجرا شود؟

زمانی که Data Path آفلاین یا در Read-only Mode قرار دارد، این عملیات نباید اجرا شود.

ادامه راهنمای Dell PowerStore Service Scripts

قسمت بعدی این مجموعه به Counter Collection و پیکربندی SLIC در Dell PowerStore اختصاص دارد. در عملیات Service و Recovery روی Cluster، سطح دسترسی، Mode عملیاتی و هشدارهای هر Script باید پیش از اجرای Command بررسی شوند.
ارتباط با کارشناسان آکو