お問い合わせ

コース概要

腾讯混元本番環境展開の基礎知識

  • 腾讯混元モデルの主な利用シーンについて理解する。
  • 大規模・MoEモデルを運用する際に求められる特性と課題。
  • 本番環境での遅延・スループット・コスト面の典型的なボトルネック。
  • 推論処理に対するサービス品質目標を明確化すること。

デプロイアーキテクチャと推論フローの設計

  • 本番環境での推論システム構成要素の概要。
  • コンテナ利用、オンプレミス展開、クラウド導入の中から最適な方式選定。
  • モデル読み込みやリクエストのルーティング、GPU割り当ての基本的仕組み。
  • 信頼性と運用容易さを両立させるシステム設計法。

実践的な遅延最適化手法

  • 状況に応じてTensorRTなどの高速推論エンジンの活用方法。
  • KVキャッシュの仕組みおよび現場でのチューニング手順。
  • 起動時やウォームアップ段階、応答生成時における遅延削減策。
  • 最初のトークン到着までの時間及びトークン生成速度の測定法。

スループット向上・バッチ処理とGPU利用率の最適化

  • 継続型バッチングやリクエストの集約による効率化。
  • 並列処理量の調整とキューの管理方法。
  • ユーザ体験を損なわずにGPU資源利用の最適化策。
  • 長文テキスト処理や複数種類のリクエスト混在時の対応法。

量子化とコスト管理の実践知識

  • 本番運用においてなぜ量子化が重要となるのか。
  • FP16やINT8など異なる精度モードによるメリット・デメリット。
  • 品質維持と遅延・コスト管理のためのバランス判断法。
  • 簡易なコスト最適化チェックリストの作成方法。

運用監視体制および本番導入準備確認点

  • 推論サービスに適したオートスケーリング条件の定義法。
  • 遅延やスループット、キャッシュ使用状況及びGPU健全性のモニタリング方法。
  • ログ管理・アラート機能と障害対応処置の基本方針。
  • 既存本番導入例を参考にした改善計画の作成法。

要求

  • 大規模言語モデルのデプロイや推論フローに関する基本的な理解があること。
  • コンテナ技術、クラウドやオンプレミス環境、APIベースのサービスの使用経験があること。
  • Pythonやシステムエンジニアリング関連業務に関する実践的な知識があること。

対象者

  • 大規模言語モデルを本番環境に展開したい機械学習エンジニア。
  • GPUベースの推論サービス運用責任者のプラットフォームエンジニア。
  • 拡張性を考慮したAIサービス基盤を構築したいソリューションアーキテクト。
 14 時間

参加者の人数


参加者1人あたりの価格

今後のコース

関連カテゴリー