お問い合わせ

コース概要

強化学習の入門

  • 強化学習とその応用の概要
  • 教師あり学習、教師なし学習、強化学習の違い
  • 主要概念:エージェント、環境、報酬、ポリシー

マルコフ決定過程(MDP)

  • 状態、行動、報酬、および状態遷移の理解
  • 価値関数とベルマン方程式
  • MDPを解くための動的計画法

コアな強化学習アルゴリズム

  • 表形式法:Q-LearningとSARSA
  • ポリシーベース法:REINFORCEアルゴリズム
  • アクター・クリティク方式フレームワークとその応用

深層強化学習

  • 深層Qネットワーク(DQN)の紹介
  • 経験再生成(Experience Replay)とターゲットネットワーク
  • ポリシー勾配と高度な深層強化学習手法

強化学習フレームワークとツール

  • OpenAI Gymおよびその他の強化学習環境の紹介
  • 強化学習モデル開発のためのPyTorchまたはTensorFlowの使用
  • 強化学習エージェントの訓練、テスト、およびベンチマーキング

強化学習の課題

  • 訓練における探索と活用のバランス
  • スパースな報酬とクレジットアサインメント問題への対処
  • 強化学習におけるスケーラビリティと計算上の課題

ハンズオン活動

  • ゼロからQ-LearningとSARSAアルゴリズムを実装
  • OpenAI Gymでの簡易ゲームをプレイするDQNベースのエージェントを訓練
  • カスタム環境でのパフォーマンス向上のための強化学習モデルのファインチューニング

まとめと次のステップ

要求

  • 機械学習の原則およびアルゴリズムに対する強力な理解
  • Pythonプログラミングの習熟
  • ニューラルネットワークおよび深層学習フレームワークの理解

対象読者

  • 機械学習エンジニア
  • AIスペシャリスト
 14 時間

参加者の人数


参加者1人あたりの価格

今後のコース

関連カテゴリー