故障排除概覽
在深入探究特定領域之前,請先利用此頁面對 CubeCOS 的問題進行初步篩選。 請先從以下全叢集範圍的健康檢查開始,接著再參閱受影響工作負載的指南。
開始之前
以下各節中的某些檢查,需要以 admin 使用者身分透過 SSH 存取 CubeCOS 叢集的虛擬 IP (VIP),或存取控制器節點上的 OpenStack 命令列介面 (CLI)。 若您尚未取得存取權限,請向您的平台管理員申請。
檢查叢集的整體運作狀態
首先進行全叢集的健康狀態檢查。 許多實例、網路和儲存問題,其根源皆可追溯至此處所報告的某項服務。
-
網頁使用者介面:檢視儀表板中的系統狀態指標面板。 如果系統顯示錯誤訊息,請按一下 修復 以執行自動修復程序。
-
CLI:透過 SSH 登入 VIP,然後執行
cluster check_repair。Check cluster service healthssh admin@<cluster-vip>Run a service health checkcontroller> cluster check_repair每一行列出一個服務(例如
Network、Compute、Storage)及其狀態,狀態可為ok或FIXING。FIXING列會以括號標示出發生故障的元件,例如網路問題為neutron(3),運算問題則為nova(8)。如需查看完整的指令輸出內容以及各項服務的說明,請參閱 使用網頁介面或命令列介面監控與修復 CubeCOS 服務。
檢視日誌與事件
如果叢集狀態檢查無法解釋此問題,請檢視受影響資源的日誌。
- 實例操作記錄:導航至 運算 > 實例,選取該實例,開啟 操作記錄 標籤頁,然後在您要調查的事件上點擊 分析。
- 全叢集日誌搜尋:請瀏覽至
http://<cluster-vip>:5601/opensearch-dashboards/app/data-explorer/discover,以查詢所有 CubeCOS 服務的日誌。
如需更多資訊,請參閱 CubeCOS 中的日誌分析。
檢查是否已有警示
請前往 「事件」>「觸發器」,查看是否已有現有的觸發器偵測到此問題,並檢視該觸發器所發送的任何通知。 如需更多資訊,請參閱 管理觸發器。