お問い合わせ

コース概要

序論

本セクションでは、「機械学習」を使用すべきタイミング、考慮すべき事項、そしてその意味(長所と短所を含む)について一般的な紹介を行います。データ型(構造化/非構造化/静的/ストリーミング)、データの妥当性/容量、データ駆動型とユーザー駆動型の分析、統計モデルと機械学習モデル、教師なし学習の課題、バイアスと分散のトレードオフ、反復/評価、交差検証の手法、教師あり/教師なし/強化学習について解説します。

主要トピック

1. ネイティブベイズの理解

  • ベイズ方法の基本概念
  • 確率
  • 同時確率
  • ベイズの定理による条件付き確率
  • ネイティブベイズアルゴリズム
  • ネイティブベイズ分類
  • ラプラス推定
  • ネイティブベイズでの数値特徴の使用

2. 決定木の理解

  • 分割統治法
  • C5.0決定木アルゴリズム
  • 最善のスプリットの選択
  • 決定木の枝刈り(プルーニング)

3. ニューラルネットワークの理解

  • 生物学的ニューロンから人工ニューロンへ
  • 活性化関数
  • ネットワークトポロジー
  • 層の数
  • 情報の伝達方向
  • 各層のノード数
  • 逆伝播を用いたニューラルネットワークの学習
  • ディープラーニング

4. サポートベクターマシン(SVM)の理解

  • 超平面による分類
  • 最大マージンの探索
  • 線分離可能なデータの場合
  • 線分離不可能なデータの場合
  • 非線形空間のためのカーネルの使用

5. クラスタリングの理解

  • クラスタリングを機械学習タスクとして捉える
  • クラスタリング用のk-meansアルゴリズム
  • 距離を使用してクラスタを割り当ておよび更新する
  • 適切なクラスタ数の選択

6. 分類のための性能測定

  • 分類予測データの処理
  • 混同行列の詳しい確認
  • 混同行列を使用して性能を測定する
  • 正確さを超えたパフォーマンスの他の指標
  • カッパ統計量
  • 感受性と特異度
  • 適合率と再現率
  • F値
  • パフォーマンストレードオフの可視化
  • ROC曲線
  • 将来のパフォーマンスの推定
  • ホールドアウト法
  • 交差検証
  • ブートストラップサンプリング

7. ストックモデルのチューニングによる性能向上

  • caretを使用した自動パラメータチューニング
  • 単純なチューニング済みモデルの作成
  • チューニングプロセスのカスタマイズ
  • メタラーニングによるモデル性能の向上
  • アンサンブリングの理解
  • バッギング
  • ブースティング
  • ランダムフォレスト
  • ランダムフォレストの訓練
  • ランダムフォレスト性能の評価

補助トピック

8. 最寄傍法による分類の理解

  • kNNアルゴリズム
  • 距離の計算
  • 適切なkの選択
  • kNNで使用するためのデータ準備
  • なぜkNNアルゴリズムは怠惰(lazy)なのか?

9. 分類規則の理解

  • 分離と統治
  • One Ruleアルゴリズム
  • RIPPERアルゴリズム
  • 決定木からの規則

10. 回帰の理解

  • 単一線形回帰
  • 最小二乗法
  • 相関
  • 多重線形回帰

11. 回帰木とモデルツリーの理解

  • ツリーへの回帰の追加

12. 関連規則の理解

  • 関連規則学習のためのAprioriアルゴリズム
  • 規則の興味度の測定 – サポートと信頼度
  • Apriori原理に基づく規則セットの構築

付録

  • Spark/PySpark/MLlibとマルチアームバンディット

要求

Pythonの知識

 21 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (7)

今後のコース

関連カテゴリー