お問い合わせを送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
予約を送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
期間 14 時間
コース概要
Gemini 3のマルチモーダリティ入門
- テキスト、画像、オーディオ、ビデオにわたる機能
- モデル選択とエンドポイントの概要
- マルチモーダル推論の主要な概念
テキストと構造化入力との処理
- テキスト生成のためのプロンプト戦略
- メタデータ、コンテキストウィンドウ、埋め込み
- マルチモーダルタスクのテキストベースのオーケストレーション
画像理解と視覚ワークフロー
- Gemini 3による画像分析と解釈
- 視覚検索とタグ付けツールの作成
- 画像からテキストへ、テキストから画像へのインタラクションの構築
オーディオ入力の処理
- 音声認識と書き起こし(トランスクリプション)のワークフロー
- オーディオイベントの検出と解釈
- オーディオとテキスト、視覚入力との統合
ビデオインテリジェンスとシーン分析
- フレームごとに、および連続的なビデオ推論
- 要約とハイライト抽出ツールの構築
- ビデオベースの自動化とコンテンツワークフロー
マルチモーダルアプリケーションアーキテクチャの設計
- 単一のパイプラインで複数の入力タイプの組み合わせ
- レイテンシ、コスト、計算上の考慮事項
- スケーラブルなマルチモーダルシステムのベストプラクティス
マルチモーダルアプリケーションのプロトタイピング
- マルチモーダルプロトタイプのハンズオン作成
- プロンプトエンジニアリングによる迅速なイテレーション
- ユーザー体験フローのテストと洗練
マルチモーダルソリューションのデプロイ
- デプロイ戦略と環境設定
- 実世界のパフォーマンス監視
- セキュリティとコンプライアンスの考慮事項
まとめと次のステップ
要求
- モダンなAI概念の理解
- PythonまたはJavaScriptの経験
- REST APIの知識
対象読者
- デザイナー
- コンテンツクリエイター
- テクニカルプロダクトチーム
お客様の声 (1)
プレゼンテーションにおける流れ、雰囲気、およびトピック
Lukasz Kowalczyk - Allegro Sp. z o.o.
コース - Google Gemini AI for Data Analysis
機械翻訳