お問い合わせを送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
予約を送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
期間 14 時間
コース概要
オープンAIOpsアーキテクチャの設計
- オープンAIOpsパイプラインの主要コンポーネントの概要
- 収集からアラーティングまでのデータフロー
- ツールの比較と統合戦略
データ収集と集約
- Prometheusによる時系列データの収集
- LogstashとBeatsによるログのキャプチャ
- クロスソース相関のためのデータ正規化
オブザーバビリティダッシュボードの構築
- Grafanaによるメトリクスの可視化
- ログ分析のためのKibanaダッシュボードの構築
- Elasticsearchクエリを使用して運用インサイトを抽出する
異常検知とインシデント予測
- オブザーバビリティデータをPythonパイプラインへエクスポートする
- アウター検出と予測のためのMLモデルの学習
- オブザーバビリティパイプラインにおけるライブ推論のためのモデルデプロイメント
オープントールによるアラーティングと自動化
- PrometheusアラートルールとAlertmanagerルーティングの作成
- 自動応答のためのスクリプトまたはAPIワークフローのトリガー
- オープンソースオーケストレーションツールの使用(例:Ansible、Rundeck)
統合とスケーラビリティの考慮事項
- 大量の収集と長期保持の処理
- オープンソーススタックにおけるセキュリティとアクセス制御
- 各層(収集、処理、アラーティング)を独立してスケーリングする
実世界のアプリケーションと拡張
- ケーススタディ:性能チューニング、ダウンタイム防止、コスト最適化
- トーリングツールやサービスグラフを使用してパイプラインを拡張する
- 本番環境でのAIOpsの運用と維持のためのベストプラクティス
まとめと次のステップ
要求
- PrometheusやELKなどのオブザーバビリティツールの利用経験
- Pythonおよび機械学習の基礎に関する実務知識
- IT運用およびアラーティングワークフローの理解
対象者
- 上級サイト信頼性エンジニア(SRE)
- 運用領域で活動するデータエンジニア
- DevOpsプラットフォームリーダーおよびインフラストラクチャアーキテクト