お問い合わせ

コース概要

強化学習とエージェントAIの紹介

  • 不確実性下での意思決定と逐次計画
  • RLの主要な構成要素:エージェント、環境、状態、報酬
  • 適応型およびエージェントAIシステムにおけるRLの役割

マルコフ決定過程(MDP)

  • MDPの形式的な定義と性質
  • 価値関数、ベルマン方程式、動的計画法
  • 方策評価、改善、反復

モデルフリー強化学習

  • モンテカルロ法と時間差(TD)学習
  • Q学習とSARSA
  • 実践:Pythonを用いた表形式RL手法の実装

深層強化学習

  • 関数近似のためにニューラルネットワークとRLを組み合わせる
  • Deep Q-Networks(DQN)と経験再生
  • アクター・クリティックアーキテクチャと方策勾配
  • 実践:Stable-Baselines3を用いたDQNとPPOによるエージェント訓練

探索戦略と報酬の形成(Reward Shaping)

  • 探索と搾取(利得の最大化)のバランス(ε-greedy、UCB、エントロピー手法)
  • 報酬関数の設計と望ましくない行動の回避
  • 報酬の形成とカリキュラム学習

RLと意思決定の高度なトピック

  • マルチエージェント強化学習と協調戦略
  • 階層型強化学習とオプションフレームワーク
  • より安全な導入のためのオフラインRLと模倣学習

シミュレーション環境と評価

  • OpenAI Gymとカスタム環境の使用
  • 連続的な行動空間と離散的な行動空間
  • エージェントの性能、安定性、サンプリング効率の指標

エージェントAIシステムへのRL統合

  • ハイブリッドエージェントアーキテクチャにおける推論とRLの組み合わせ
  • ツール使用エージェントとの強化学習の統合
  • スケーリングと導入のための運用上の考慮事項

キャップストーンプロジェクト

  • シミュレーションタスクのための強化学習エージェントの設計と実装
  • 訓練性能の分析とハイパーパラメータの最適化
  • エージェントのコンテキストにおける適応行動と意思決定のデモンストレーション

まとめと次のステップ

要求

  • Pythonプログラミングへの高い習熟度
  • 機械学習および深層学習の概念への確かな理解
  • 線形代数、確率論、基本的な最適化手法への親しみ

対象者

  • 強化学習エンジニアおよび応用AI研究者
  • ロボティクスおよび自動化開発者
  • 適応型およびエージェントAIシステムに取り組むエンジニアリングチーム
 28 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (3)

今後のコース

関連カテゴリー