お問い合わせを送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
予約を送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
期間 14 時間
コース概要
予測的AIOpsの紹介
- IT運用における予測分析の概要
- 予測用のデータソース(ログ、メトリック、イベント)
- 時系列予測と異常パターンの主要な概念
インシデント予測モデルの設計
- 過去のインシデントとシステム挙動のラベリング
- モデルの選択と訓練(例:LSTM、Random Forest、AutoML)
- モデル性能の評価と偽陽性の取り扱い
データ収集と特徴量エンジニアリング
- モデル入力用のログおよびメトリックデータのインジェストとアライメント
- 構造化データと非構造化データからの特徴量抽出
- 運用パイプラインにおけるノイズと欠損データの取り扱い
根本原因分析(RCA)の自動化
- サービスとインフラストラクチャのグラフベースの相関
- イベントチェーンからMLを用いて推定される根本原因を推論する
- トポロジー認識ダッシュボードによるRCAの可視化
是正とワークフローの自動化
- 自動化プラットフォームとの統合(例:Ansible、Rundeck)
- ロールバック、再起動、またはトラフィックのリダイレクトのトリガー
- 自動介入の監査と文書化
インテリジェントなAIOpsパイプラインのスケーリング
- オブザーバビリティ向けMLOps:再訓練とモデルのバージョン管理
- 分散ノード間でリアルタイムに予測を実行する
- 本番環境でのAIOpsデプロイメントのベストプラクティス
ケーススタディと実践的な応用
- 予測的AIOpsモデルを用いた実際のインシデントデータの分析
- シンセティックデータと本番データを使用したRCAパイプラインのデプロイメント
- 業界のユースケースのレビュー:クラウド障害、マイクロサービスの不安定性、ネットワーク劣化
まとめと次のステップ
要求
- PrometheusやELKなどの監視システムの経験
- Pythonおよび基礎的な機械学習の知識
- インシデント管理ワークフローの理解
対象読者層
- シニア・サイト信頼性エンジニア(SRE)
- IT自動化アーキテクト
- DevOpsおよびオブザーバビリティプラットフォームのリーダー