高可用性(HA)は、稼働時間の究極の目標として宣伝されることが多い。クラスター、冗長サーバー、マルチゾーン展開は、「99.9 災害復旧 (DR) 独立した学問分野として扱われなければならない。 RELIANOID堅牢なHAアーキテクチャを提供するだけでなく、テスト済みの 災害復旧戦略 組織に真のセーフティネットを提供するもの。
高可用性 vs. 災害復旧
HA(高可用性)とDR(災害復旧)は互いに補完し合う関係にあるものの、その目的と手法は大きく異なります。真のレジリエンスを構築するには、この違いを理解することが不可欠です。
| 属性 | 高可用性 | Disaster Recovery
|
| 対象領域 | 局所的な故障 | 地域的/壊滅的な障害 |
| 例 | ノードのクラッシュ、AZの障害 | データ破損、ランサムウェア、地域全体の障害 |
| DevOps Tools Engineer試験のObjective | 稼働時間を維持する | 災害後のサービスとデータの復旧 |
| ツール | ロードバランサー、クラスタリング、オートスケーリング | バックアップ、レプリケーション、複数リージョン展開 |
| フォーカス | 安全防災 | 修復サービス |
例えば、複数のアベイラビリティゾーンに分散されたKubernetesクラスターは、リージョン内で高可用性(HA)を提供します。しかし、リージョン全体が障害を起こしたり、ランサムウェア攻撃によってデータが破損したりした場合、HAは役に立ちません。バックアップ、オフサイトレプリケーション、自動フェイルオーバーなどの災害復旧(DR)計画は、HAが機能しなくなった場合でも復旧を保証します。
実体験に基づく教訓:HAだけでは不十分だった場合
いくつかの大規模なシステム障害は、災害復旧があらゆる組織のDNAに組み込まれるべき理由を明確に示している。
- GitLab(2017年): 誤ってデータベースを削除してしまったことで、冗長システム全体に影響が及び、会社は古いバックアップデータで対応に追われることになった。教訓:冗長性は復旧を保証するものではない。
- コードスペース(2014年): クラウドアカウントの乗っ取りにより、サーバーとバックアップが完全に削除された。クラウド以外の復旧手段がなかったため、会社は閉鎖に追い込まれた。教訓:災害復旧(DR)は隔離され、独立したシステムでなければならない。
- マールスク(2017年): NotPetyaマルウェアは世界中のシステムを暗号化した。会社を救ったのは、オフラインバックアップ用のドメインコントローラー1台だけだった。教訓:オフラインバックアップと地理的に隔離されたバックアップは重要である。
- フェイスブック(2021年): BGPの設定ミスにより、社内ツールを含むグローバルサービスが停止した。教訓:災害復旧はデータだけでなく、復旧ツールへのアクセス性も重要である。
主要指標:RTOとRPO
災害復旧は、2つの重要な指標によって評価されます。
- 目標復旧時間 (RTO): 許容可能な最大ダウンタイム。サービスをどれくらいの速さで復旧させる必要がありますか?
- 復旧ポイント目標 (RPO): 許容できる最大データ損失量(時間単位で測定)。直近のデータであれば、どれくらいの損失まで許容できますか?
例:RTOが1時間、RPOが15分の場合、午後12時に障害が発生した場合、サービスは午後1時までに復旧し、データは少なくとも午前11時45分までに復旧する必要があります。RTOとRPOの目標を厳しくすると、災害復旧(DR)インフラへの投資額が増加しますが、ダウンタイムコストの削減という点では、多くの場合、はるかに大きなメリットが得られます。
災害復旧アーキテクチャ
組織は、重要度と予算に応じて、いくつかの災害復旧戦略から選択できます。
- バックアップと復元(コールドDR): コストは最低、復旧時間は最長。重要度の低いワークロードに適しています。
- 表示灯: 別のリージョンに複製された最小限のスタンバイ環境は、フェイルオーバー時に起動される。
- ウォームスタンバイ: 部分的に規模を縮小した災害復旧環境は常に稼働しており、パイロットランプよりも迅速な復旧を実現します。
- ホットスタンバイ(アクティブ/パッシブ): 完全にミラーリングされた環境は、障害発生時に引き継ぐ準備ができています。
- アクティブ/アクティブ(マルチサイト): 複数の拠点がトラフィックを処理している。最高の耐障害性を持つが、コストも最高レベル。
認定条件 RELIANOID 高可用性と災害復旧機能を提供します
At RELIANOID私たちは両方を統合します 高可用性 (NAIST) と Disaster Recovery
回復力はどちらか一方だけでは達成できないため、私たちのソリューションにこれらを組み込む必要があります。
- 高可用性: 現場の声を力強いメッセージへ。 アプリケーション配信コントローラ (ADC) クラスタリング、負荷分散、自動フェイルオーバー機能を提供し、局所的な障害発生時にも稼働時間を維持します。
- 災害からの回復: 我々はデザインする 複数地域にわたるオフサイト複製戦略 自動フェイルオーバー機構を備えているため、壊滅的な障害発生時でも事業継続性を確保できます。
- バックアップとテスト: 保守します 安全で改ざん不可能なバックアップ また、災害復旧計画が実際に必要な時に機能することを確認するため、定期的に復旧訓練を実施する。
- RTO/RPOの整合性: 当社のソリューションは、お客様のSLAに合わせてカスタマイズされており、コスト、複雑さ、重要度のバランスを取りながら、ビジネスで定義されたRTOおよびRPOの目標を達成します。
HAとDRの両方を提供することで、 RELIANOID 通常のストレス下での継続性を確保するだけでなく、人為的災害であろうと環境災害であろうと、異常な災害下での復旧も保証する。
私たちが実践するベストプラクティス
- 単一障害点の発生を防ぐため、環境を分離する。
- ランサムウェアや誤削除に強い、変更不可能なバージョン管理付きバックアップ。
- Infrastructure-as-Codeツールを使用した災害復旧(DR)インフラストラクチャの自動プロビジョニング。
- 定期的な災害復旧テストとカオスシミュレーション。
- 迅速なインシデント対応のための詳細な手順書と文書。
結論
高可用性は不可欠ですが、それだけでは不十分です。インフラストラクチャが分散化し、脅威が予測不可能になるにつれて、 災害復旧はもはや選択肢ではないHA(高可用性)は軽微な障害発生時にシステムを安定させ、DR(災害復旧)は壊滅的な障害発生時にもシステムの存続を保証します。これら二つが一体となって、真のレジリエンス(回復力)の基盤を形成します。
At RELIANOID当社は、実績のあるHAメカニズムと厳密にテストされたDR戦略を組み合わせたアーキテクチャを提供します。ロードバランシングクラスタからマルチリージョンフェイルオーバー、不変バックアップまで、当社のアプローチは、壊滅的なダウンタイムになりかねない事態を管理可能な障害へと変えます。予防コストは常に障害コストよりも低く抑えられます。そして、お客様は当社がその点においてお客様を支援することをご存知です。 両方に備えてください。
RELIANOID稼働時間を超えて。回復力を目指して。