お問い合わせ
 期間 14 時間

コース概要

Gemini 3のマルチモーダリティ入門

  • テキスト、画像、オーディオ、ビデオにわたる機能
  • モデル選択とエンドポイントの概要
  • マルチモーダル推論の主要な概念

テキストと構造化入力との処理

  • テキスト生成のためのプロンプト戦略
  • メタデータ、コンテキストウィンドウ、埋め込み
  • マルチモーダルタスクのテキストベースのオーケストレーション

画像理解と視覚ワークフロー

  • Gemini 3による画像分析と解釈
  • 視覚検索とタグ付けツールの作成
  • 画像からテキストへ、テキストから画像へのインタラクションの構築

オーディオ入力の処理

  • 音声認識と書き起こし(トランスクリプション)のワークフロー
  • オーディオイベントの検出と解釈
  • オーディオとテキスト、視覚入力との統合

ビデオインテリジェンスとシーン分析

  • フレームごとに、および連続的なビデオ推論
  • 要約とハイライト抽出ツールの構築
  • ビデオベースの自動化とコンテンツワークフロー

マルチモーダルアプリケーションアーキテクチャの設計

  • 単一のパイプラインで複数の入力タイプの組み合わせ
  • レイテンシ、コスト、計算上の考慮事項
  • スケーラブルなマルチモーダルシステムのベストプラクティス

マルチモーダルアプリケーションのプロトタイピング

  • マルチモーダルプロトタイプのハンズオン作成
  • プロンプトエンジニアリングによる迅速なイテレーション
  • ユーザー体験フローのテストと洗練

マルチモーダルソリューションのデプロイ

  • デプロイ戦略と環境設定
  • 実世界のパフォーマンス監視
  • セキュリティとコンプライアンスの考慮事項

まとめと次のステップ

要求

  • モダンなAI概念の理解
  • PythonまたはJavaScriptの経験
  • REST APIの知識

対象読者

  • デザイナー
  • コンテンツクリエイター
  • テクニカルプロダクトチーム

参加者の人数


参加者1人あたりの価格

お客様の声 (1)

今後のコース

関連カテゴリー