お問い合わせ
 期間 14 時間

コース概要

予測的AIOpsの紹介

  • IT運用における予測分析の概要
  • 予測用のデータソース(ログ、メトリック、イベント)
  • 時系列予測と異常パターンの主要な概念

インシデント予測モデルの設計

  • 過去のインシデントとシステム挙動のラベリング
  • モデルの選択と訓練(例:LSTM、Random Forest、AutoML)
  • モデル性能の評価と偽陽性の取り扱い

データ収集と特徴量エンジニアリング

  • モデル入力用のログおよびメトリックデータのインジェストとアライメント
  • 構造化データと非構造化データからの特徴量抽出
  • 運用パイプラインにおけるノイズと欠損データの取り扱い

根本原因分析(RCA)の自動化

  • サービスとインフラストラクチャのグラフベースの相関
  • イベントチェーンからMLを用いて推定される根本原因を推論する
  • トポロジー認識ダッシュボードによるRCAの可視化

是正とワークフローの自動化

  • 自動化プラットフォームとの統合(例:Ansible、Rundeck)
  • ロールバック、再起動、またはトラフィックのリダイレクトのトリガー
  • 自動介入の監査と文書化

インテリジェントなAIOpsパイプラインのスケーリング

  • オブザーバビリティ向けMLOps:再訓練とモデルのバージョン管理
  • 分散ノード間でリアルタイムに予測を実行する
  • 本番環境でのAIOpsデプロイメントのベストプラクティス

ケーススタディと実践的な応用

  • 予測的AIOpsモデルを用いた実際のインシデントデータの分析
  • シンセティックデータと本番データを使用したRCAパイプラインのデプロイメント
  • 業界のユースケースのレビュー:クラウド障害、マイクロサービスの不安定性、ネットワーク劣化

まとめと次のステップ

要求

  • PrometheusやELKなどの監視システムの経験
  • Pythonおよび基礎的な機械学習の知識
  • インシデント管理ワークフローの理解

対象読者層

  • シニア・サイト信頼性エンジニア(SRE)
  • IT自動化アーキテクト
  • DevOpsおよびオブザーバビリティプラットフォームのリーダー

参加者の人数


参加者1人あたりの価格

今後のコース

関連カテゴリー