跳到主內容
版本:3.0

故障排除概覽

在深入探究特定領域之前,請先利用此頁面對 CubeCOS 的問題進行初步篩選。 請先從以下全叢集範圍的健康檢查開始,接著再參閱受影響工作負載的指南。

開始之前

以下各節中的某些檢查,需要以 admin 使用者身分透過 SSH 存取 CubeCOS 叢集的虛擬 IP (VIP),或存取控制器節點上的 OpenStack 命令列介面 (CLI)。 若您尚未取得存取權限,請向您的平台管理員申請。

檢查叢集的整體運作狀態

首先進行全叢集的健康狀態檢查。 許多實例、網路和儲存問題,其根源皆可追溯至此處所報告的某項服務。

  • 網頁使用者介面:檢視儀表板中的系統狀態指標面板。 如果系統顯示錯誤訊息,請按一下 修復 以執行自動修復程序。

  • CLI:透過 SSH 登入 VIP,然後執行 cluster check_repair

    Check cluster service health
    ssh admin@<cluster-vip>
    Run a service health check
    controller> cluster check_repair

    每一行列出一個服務(例如 NetworkComputeStorage)及其狀態,狀態可為 okFIXINGFIXING 列會以括號標示出發生故障的元件,例如網路問題為 neutron(3),運算問題則為 nova(8)

    如需查看完整的指令輸出內容以及各項服務的說明,請參閱 使用網頁介面或命令列介面監控與修復 CubeCOS 服務

檢視日誌與事件

如果叢集狀態檢查無法解釋此問題,請檢視受影響資源的日誌。

  • 實例操作記錄:導航至 運算 > 實例,選取該實例,開啟 操作記錄 標籤頁,然後在您要調查的事件上點擊 分析
  • 全叢集日誌搜尋:請瀏覽至 http://<cluster-vip>:5601/opensearch-dashboards/app/data-explorer/discover,以查詢所有 CubeCOS 服務的日誌。

如需更多資訊,請參閱 CubeCOS 中的日誌分析

檢查是否已有警示

請前往 「事件」>「觸發器」,查看是否已有現有的觸發器偵測到此問題,並檢視該觸發器所發送的任何通知。 如需更多資訊,請參閱 管理觸發器