お問い合わせ

コース概要

詳細な研修アウトライン

  1. NLPの入門
    • NLPの理解
    • NLPフレームワーク
    • NLPの商業応用
    • Webからのデータスクレイピング
    • テキストデータ取得のための様々なAPIとの連携
    • コンテンツと関連メタデータを含むテキストコーパスの処理と保存
    • Python使用の利点とNLTKクランチコース
  2. コーパスとデータセットの実践的理解
    • なぜコーパスが必要なのか?
    • コーパス分析
    • データ属性の種類
    • コーパスの異なるファイル形式
    • NLPアプリケーション向けのデータセットの準備
  3. 文構造の理解
    • NLPの構成要素
    • 自然言語理解
    • 形態素分析 - 語根、単語、トークン、品詞タグ
    • 統語分析
    • 意味分析
    • 曖昧さの処理
  4. テキストデータの前処理
    • コーパス - 生テキスト
      • 文のトークナイズ
      • 生テキストの語根化(Stemming)
      • 生テキストのレマティゼーション
      • ストップワードの削除
    • コーパス - 生文
      • 単語のトークナイズ
      • 単語のレマティゼーション
    • 単語-文書/文書-単語行列の取り扱い
    • N-gramおよび文へのテキストのトークナイズ
    • 実践的かつカスタマイズされた前処理
  5. テキストデータの分析
    • NLPの基本機能
      • パーサーとパース
      • 品詞タグ付けとタグアタッカー
      • 名前実体認識
      • N-gram
      • Bag of Words(単語袋)
    • NLPの統計的機能
      • NLPにおける線形代数の概念
      • NLPにおける確率論
      • TF-IDF
      • ベクトル化
      • エンコーダーとデコーダー
      • 正規化
      • 確率モデル
    • 高度な特徴量エンジニアリングとNLP
      • word2vecの基礎
      • word2vecモデルの構成要素
      • word2vecモデルのロジック
      • word2vec概念の拡張
      • word2vecモデルの応用
    • ケーススタディ: Bag of Wordsの応用: 簡略化および真のLuhnアルゴリズムによる自動テキスト要約
  6. ドキュメントクラスタリング、分類およびトピックモデリング
    • ドキュメントクラスタリングとパターンマイニング(階層型クラスタリング、k平均法、クラスタリングなど)
    • TFIDF、Jaccard距離、コサイン類似度を用いたドキュメントの比較と分類
    • ナイーブベイズと最大エントロピーを用いたドキュメント分類
  7. 重要なテキスト要素の識別
    • 次元削減: 主成分分析(PCA)、特異値分解(SVD)、非負行列分解(NMF)
    • 潜在意味分析(LSA)によるトピックモデリングと情報検索
  8. 実体抽出、感情分析および高度なトピックモデリング
    • ポジティブ vs ネガティブ: 感情の度合い
    • 課題反応理論(IRT)
    • 品詞タグ付けとその応用: テキスト内で言及された人物、場所、組織の特定
    • 高度なトピックモデリング: 潜在ディリクレ分配(LDA)
  9. ケーススタディ
    • 非構造化ユーザーレビューのマイニング
    • 製品レビューデータの感情分類と可視化
    • 使用パターンのマイニングのための検索ログ分析
    • テキスト分類
    • トピックモデリング

要求

NLPの原理に関する知識と理解、およびビジネスにおけるAI応用の認識

 21 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (1)

今後のコース

関連カテゴリー