مدیریت و عیبیابی Cluster در Dell PowerStore؛ راهنمای Service Scripts قسمت سوم
مدیریت Cluster در Dell PowerStore با Service Scripts این قسمت، سه حوزه اصلی را پوشش میدهد: خاموشکردن SAN Cluster، عیبیابی Failureهای ایجاد یا تغییر Cluster و بازیابی Cluster در شرایط خرابی Appliance. ابزارهای اصلی این بخش svc_cluster، svc_cluster_diag و svc_cluster_management هستند.
این مقاله ادامه قسمت دوم راهنما است. در قسمت قبل، Service Scriptهای مربوط به CAC/PIV، نگهداری پارتیشن root، پاککردن وضعیت DIMM و Firmware Update Alert بررسی شدند. در این قسمت تمرکز به عملیات Cluster و Recovery منتقل میشود.
svc_cluster برای Shutdown تمام Applianceهای SAN Cluster استفاده میشود. svc_cluster_diag خطاهای مرتبط با ایجاد Cluster، افزودن Appliance یا حذف Appliance را بررسی میکند و svc_cluster_management برای مشاهده وضعیت، Detach، آمادهسازی Reattach، Reattach و انتقال Primary Appliance به کار میرود.
مسیر مطالعه این راهنما
قسمت قبلی: مدیریت امنیت و Maintenance در Dell PowerStore
قسمت فعلی: مدیریت و عیبیابی Cluster در Dell PowerStore
قسمت بعدی: Counter Collection و پیکربندی SLIC در Dell PowerStore
Service Scriptهای Cluster در این قسمت
سه Service Script این قسمت وظایف متفاوتی در سطح Cluster و Appliance دارند. تفاوت در دامنه، Mode، سطح دسترسی و اثر احتمالی عملیات باعث میشود پیش از اجرای هر Command، مشخصات همان Script بررسی شود.
| Service Script | کاربرد اصلی | دامنه |
|---|---|---|
| svc_cluster | Shutdown تمام Applianceهای SAN Cluster | Cluster |
| svc_cluster_diag | عیبیابی Failureهای ایجاد یا تغییر Cluster | Node و Cluster |
| svc_cluster_management | Recovery و مدیریت Applianceهای Cluster | Appliance |
خاموش کردن SAN Cluster با svc_cluster
Service Script با نام svc_cluster برای خاموشکردن همه Applianceهای یک SAN Cluster استفاده میشود. عملیات Shutdown این Script فقط برای SAN Clusterها مجاز است.
کاربرد و الزامات svc_cluster
این عملیات در سطح Cluster اجرا میشود و Master Appliance باید در Normal Mode قرار داشته باشد. گذرواژه Service لازم است، اما root access نیاز نیست.
| ویژگی | مقدار |
|---|---|
| کاربرد | Service |
| گذرواژه Service | لازم است |
| دسترسی root | لازم نیست |
| احتمال عدم دسترسپذیری داده | بله |
| احتمال از دست رفتن داده | خیر |
| دامنه | Cluster |
| پیشنیاز | Master Appliance باید در Normal Mode باشد |
فرمت دستور و پارامترها
svc_cluster [-h] {shutdown} [-f] [-d]| پارامتر | توضیح |
|---|---|
-h, --help | پیام Help را نمایش میدهد و خارج میشود. |
-d, --debug | Debugging را برای Verbose Logging فعال میکند. |
-f, --force | Warningها را نادیده میگیرد و Shutdown را بهاجبار انجام میدهد. |
استفاده از پارامتر -f برای اجبار Shutdown میتواند باعث عدم دسترسپذیری داده شود.
عملیات Shutdown و محدودیت SAN Cluster
عملیات shutdown همه Applianceهای یک SAN Cluster را خاموش میکند. این عملیات فقط برای SAN Clusterها مجاز است.
عیبیابی ایجاد Cluster با svc_cluster_diag
svc_cluster_diag برای کمک به عیبیابی مشکلاتی طراحی شده است که هنگام ایجاد Cluster، افزودن Appliance یا حذف Appliance رخ میدهند. فرآیند Diagnostics شامل بررسی Journal، Hardware Check و در صورت نیاز Data Collection است.
فرآیند تشخیص Hardware Fault
مرحله اول، بررسی Journal برای Hardware Checkهای قبلی است. هدف، شناسایی Hardware Faultهایی است که ممکن است پیش از عملیات ایجاد Cluster رخ داده باشند.
سپس Hardware Check فعلی سیستم اجرا میشود. این بررسی مشکلات Hardware موجود در سیستم را نمایش میدهد.
- Journal برای Hardware Checkهای قبلی بررسی میشود.
- Hardware Check فعلی سیستم اجرا میشود.
- در صورت نیاز، Data Collection انجام میشود.
بررسی وضعیت FAULTED_UNCONFIGURED
Hardware Check زمانی اهمیت ویژه دارد که عملیات ایجاد Cluster با وضعیت FAULTED_UNCONFIGURED شکست خورده باشد.
اگر Hardware Fault وجود داشته باشد، عملیات ایجاد Cluster قابل انجام نیست. در صورت تشخیص Fault، وضعیت به FAULTED_UNCONFIGURED تغییر میکند و Cluster Creation شکست میخورد.
Data Collection پس از Failure
پس از بررسی Hardware، از کاربر پرسیده میشود که آیا Data Collection انجام شود یا خیر. این مرحله پس از Failure ایجاد Cluster امکان جمعآوری داده پیش از Log Rotation را فراهم میکند.
در این مرحله امکان تنظیم IP برای سیستم نیز وجود دارد تا Collect Data از مسیر مستقیم و IP Address از سیستم کپی شود.
فرمت دستور و سطوح Log
svc_cluster_diag [-h] [-w] [-d] [-e] [-i]| پارامتر | عملکرد |
|---|---|
-h, --help | نمایش Help و خروج |
-w, --warningLevel | نمایش Logهای WARN |
-i, --infoLevel | نمایش Logهای INFO |
-e, --errorLevel | نمایش Logهای ERROR |
-d, --debugLevel | نمایش Logهای DEBUG |
| ویژگی | مقدار |
|---|---|
| کارکرد | عیبیابی |
| Mode | Normal و Service |
| کاربرد | استفاده عمومی |
| گذرواژه Service | خیر |
| دسترسی root | خیر |
| احتمال عدم دسترسپذیری داده | بله |
| احتمال از دست رفتن داده | بله |
| دامنه | Node و Cluster |
| پیشنیاز | هیچکدام |
نمونه اجرای svc_cluster_diag
در نمونه زیر Logهای موردنیاز دیگر در دسترس نیستند. پس از اجرای Command، سیستم امکان Data Collection را پیشنهاد میدهد.
svc_cluster_diag -w
The log statements that are needed to collect information for the command:
'journalctl --utc -t control-path | egrep "\[CC\]" | grep WARN' are no longer
available
Would you like to perform a data collection? Please enter 'yes' or 'no'
yes
Running data collection - This might take awhile
data collection ID f10a1ebb-5727-4a84-aa29-58df29274bcc
Status OK
HTTP Code 201مدیریت Cluster با svc_cluster_management
svc_cluster_management به Service Provider اجازه میدهد Appliance موجود در Cluster را Attach یا Detach کرده و وضعیت آن را مشاهده کند. این Script برای سناریوهای Recovery استفاده میشود.
سناریوی Recovery در Cluster دو-Appliance
اگر در یک Cluster دو-Appliance یکی از Applianceها Fail شود یا دیگر نتواند با Appliance دیگر ارتباط برقرار کند، Appliance باقیمانده ممکن است غیرقابلمدیریت شود.
در این شرایط Appliance معیوب میتواند از Cluster جدا شود تا قابلیت مدیریت Appliance باقیمانده بازیابی شود. پس از رفع مشکل، Appliance جداشده برای Reattach آماده و دوباره به Cluster متصل میشود.
الزامات و سطح دسترسی
| ویژگی | مقدار |
|---|---|
| کارکرد | بازیابی |
| Mode | Normal |
| کاربرد | Service |
| گذرواژه Service | N/A |
| دسترسی root | بله |
| احتمال عدم دسترسپذیری داده | بله |
| احتمال از دست رفتن داده | خیر |
| دامنه | Appliance |
| پیشنیاز | هیچکدام |
عملیات و پارامترهای svc_cluster_management
svc_cluster_management [-h] [e] [-n <value>]
{GetClusterStatus,DetachFailedAppliance,PrepReattachAppliance,ReattachAppliance,MovePrimaryAppliance}| عملیات | کاربرد |
|---|---|
| GetClusterStatus | وضعیت فعلی Cluster را نمایش میدهد. |
| DetachFailedAppliance | Appliance معیوب را Detach میکند. |
| PrepReattachAppliance | Appliance را برای Reattach آماده میکند. |
| ReattachAppliance | Appliance را Reattach میکند. |
| MovePrimaryAppliance | نقش Primary را به Appliance دیگری منتقل میکند. |
پارامتر --check_eligibility یا -e Nodeهایی را نمایش میدهد که واجد شرایط Primary Node شدن هستند. پارامتر --nodeid یا -n Node موردنظر برای تبدیلشدن به Primary Node جدید Cluster را مشخص میکند.
انتقال Primary Appliance
عملیات MovePrimaryAppliance نقش Primary را به Appliance دیگری منتقل میکند. Node مقصد با شناسه آن مشخص میشود.
انتخاب Primary Node جدید
در نمونه زیر Node دارای ID برابر 4 بهعنوان Primary Appliance در Cluster انتخاب میشود.
svc_cluster_management MovePrimaryAppliance -n 4محدودیت Data Path
اگر Data Path آفلاین است یا در Read-only Mode قرار دارد، عملیات MovePrimaryAppliance را اجرا نکنید. اجرای این عملیات در چنین شرایطی باعث از دست رفتن امکان مدیریت Cluster میشود.
حذف و اتصال مجدد Appliance
در Cluster دو-Appliance، اگر یک Appliance معیوب باشد، svc_cluster_management امکان Detach کردن آن و سپس Reattach کردن Appliance پس از رفع مشکل را فراهم میکند.
- وضعیت Cluster و Applianceها را بررسی کنید.
- Appliance معیوب را Detach کنید.
- پس از رفع مشکل، Appliance را برای Reattach آماده کنید.
- Appliance را دوباره به Cluster متصل کنید.
بررسی وضعیت Cluster
svc_cluster_management status
---CLUSTER STATUS---
local is primary: False
master id: 0
---APPLIANCE LIST---
id: 2
name: appliance_j8xxmd2
ip address: fd73:51fc:80d:0:201:4471:dcbb:4bce
online: False
id: 1
name: appliance_j8y1nd2
ip address: fd73:51fc:80d:0:201:4432:1df9:41da
online: Trueخروجی وضعیت مشخص میکند کدام Appliance Online و کدام Appliance Offline است و مبنای تشخیص Appliance معیوب برای مرحله Detach قرار میگیرد.
Detach کردن Appliance معیوب
svc_cluster_management detach
detach failed appliance success!آمادهسازی Appliance برای Reattach
پس از رفع مشکل Appliance، مرحله آمادهسازی برای اتصال مجدد اجرا میشود.
svc_cluster_management prep_attach
prep reattach appliance successاتصال مجدد Appliance
پس از تکمیل مرحله آمادهسازی، Appliance دوباره به Cluster متصل میشود.
svc_cluster_management attach
reattach appliance successخلاصه:
ترتیب Workflow بازیابی Appliance شامل بررسی status، اجرای detach، آمادهسازی با prep_attach و در نهایت اجرای attach است.
نکات و هشدارهای عملیاتی
Shutdown در سطح Cluster
svc_cluster همه Applianceهای SAN Cluster را خاموش میکند و ممکن است باعث عدم دسترسپذیری داده شود.
Cluster Diagnostics
svc_cluster_diag در Normal و Service Mode قابل استفاده است و در مشخصات آن احتمال عدم دسترسپذیری و از دست رفتن داده ذکر شده است.
Cluster Recovery
svc_cluster_management به root access نیاز دارد و MovePrimaryAppliance در وضعیت Offline یا Read-only بودن Data Path نباید اجرا شود.
جمعبندی مدیریت Cluster
مدیریت Cluster در Dell PowerStore با Service Scripts این قسمت سه Workflow متفاوت را پوشش میدهد. svc_cluster برای Shutdown در سطح SAN Cluster، svc_cluster_diag برای بررسی Failureهای Cluster Creation و تغییرات Appliance و svc_cluster_management برای Recovery و مدیریت Applianceهای Cluster استفاده میشود.
در سناریوی خرابی Appliance، ترتیب بررسی وضعیت، Detach، رفع مشکل، آمادهسازی Reattach و اتصال مجدد اهمیت دارد. انتقال Primary Appliance نیز باید با توجه به وضعیت Data Path انجام شود.
سوالات متداول
آیا svc_cluster برای همه Clusterهای PowerStore قابل استفاده است؟
خیر. عملیات Shutdown این Service Script فقط برای SAN Clusterها مجاز است.
آیا اجرای svc_cluster به root access نیاز دارد؟
خیر. گذرواژه Service لازم است، اما root access برای این Script نیاز نیست.
svc_cluster_diag چه زمانی کاربرد دارد؟
برای عیبیابی مشکلاتی که هنگام ایجاد Cluster، افزودن Appliance یا حذف Appliance رخ میدهند طراحی شده است.
وجود Hardware Fault چه اثری روی Cluster Creation دارد؟
اگر Hardware Fault وجود داشته باشد، ایجاد Cluster انجام نمیشود و در صورت تشخیص Fault وضعیت به FAULTED_UNCONFIGURED تغییر میکند.
آیا Cluster Diagnostics میتواند Data Collection انجام دهد؟
بله. در فرآیند Diagnostics از کاربر درباره انجام Data Collection سؤال میشود تا اطلاعات موردنیاز، بهخصوص پس از Failure، جمعآوری شوند.
برای Reattach کردن Appliance چه ترتیبی وجود دارد؟
ابتدا وضعیت Cluster بررسی و Appliance معیوب Detach میشود. پس از رفع مشکل، Appliance برای Reattach آماده و سپس دوباره به Cluster متصل میشود.
چه زمانی MovePrimaryAppliance نباید اجرا شود؟
زمانی که Data Path آفلاین یا در Read-only Mode قرار دارد، این عملیات نباید اجرا شود.
قسمت بعدی این مجموعه به Counter Collection و پیکربندی SLIC در Dell PowerStore اختصاص دارد. در عملیات Service و Recovery روی Cluster، سطح دسترسی، Mode عملیاتی و هشدارهای هر Script باید پیش از اجرای Command بررسی شوند.
ارتباط با کارشناسان آکو
HPE
DELL
Broadcom
HPE
DELL
Broadcom
Vmware