お問い合わせ

コース概要

強化学習とエージェント型AI入門

  • 不確実性下での意思決定および逐次計画の概要
  • RLにおける主要要素:エージェント、環境、状態、報酬関数について
  • 適応型およびエージェント型AIシステムにおける強化学習の役割

マルコフ決定過程(MDP)

  • MDPの正式な定義および特徴
  • 価値関数、ベルマン方程式、動的計画法の解説
  • 方策の評価・改善・反復処理の手順

モデルフリー強化学習

  • モンテカルロ法および時刻差分学習(TD学習)
  • Q学習やSARSAアルゴリズム
  • Pythonを用いたテーブルベース型RL手法の実装演習

深層強化学習

  • ニューラルネットワークとRLの組み合わせによる関数近似手法
  • 深層Qネットワーク(DQN)および経験リプレイ機構
  • アクターニューラルネットと評価器の活用による方策勾配法
  • Stable-Baselines3を用いてDQNおよびPPOによるエージェント訓練演習

探索戦略と報酬設計手法

  • εグリーディ法やUCB法、エントロピーベース手法による探索・利用のバランス取り方
  • 適切な報酬関数の設計および望ましくない振る舞い発生の防止策
  • 報酬調整法やカリキュラム学習手法について

強化学習および意思決定における高度なトピック

  • 複数エージェントが協調的に行動する多主体強化学習
  • 階層型強化学習およびオプションフレームワークの概要
  • 安全な運用実現のためのオフラインRLおよび模倣学習手法

シミュレーション環境と評価方法

  • OpenAI Gymやカスタム環境の利用手順
  • 連続的・離散的な行動空間に関する基本的な知識
  • エージェント性能や安定性、サンプル効率を測定する指標の概要

エージェント型AIシステムにおけるRL導入法

  • 推論能力と強化学習を組み合わせたハイブリッド型エージェントアーキテクチャの構築
  • ツール利用型エージェントシステムにおける強化学習の統合方法
  • 規模拡大や実際の導入時における運用上の注意点について

最終プロジェクト演習

  • シミュレーション環境で強化学習エージェントを設計・実装する課題
  • 訓練過程のパフォーマンス分析およびハイパーパラメータ調整手法
  • エージェント型環境下での適応的挙動や意思決定能力を実証する演習

まとめおよび今後の学習指針について

要求

  • Pythonプログラミングに関する十分な知識
  • 機械学習および深層学習の基本概念をしっかり理解していること
  • 線形代数、確率論、基本的な最適化手法に馴染みがあること

対象者

  • 強化学習エンジニアおよび実用的なAI研究従事者
  • ロボット工学や自動化分野で開発業務に携わる方々
  • 適応的かつエージェント型AIシステムの構築に取り組む技術チーム
 28 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (3)

今後のコース

関連カテゴリー