お問い合わせ

コース概要

AI的主権とLLMのローカルデプロイメント

  • クラウドLLMのリスク:データ保持、入力に対する学習、外国の司法管轄区。
  • Ollamaのアーキテクチャ:モデルサーバー、レジストリ、およびOpenAI互換API。
  • vLLM、llama.cpp、Text Generation Inferenceとの比較。
  • モデルライセンス:Llama、Mistral、Qwen、Gemmaの利用条件。

インストールとハードウェア設定

  • CUDAおよびROCmサポート付きのLinuxへのOllamaインストール。
  • CPUのみのフォールバックおよびAVX/AVX2の最適化。
  • Dockerデプロイメントと永続ボリュームのマッピング。
  • マルチGPU設定とVRAM割り当て戦略。

モデル管理

  • Ollamaレジストリからのモデルプル:ollama pull llama3。
  • HuggingFaceおよびTheBlokeからのGGUFモデルのインポート。
  • 量子化レベル:Q4_K_M、Q5_K_M、Q8_0のトレードオフ。
  • モデルの切り替えと並列モデル読み込みの制限。

カスタムModelfile

  • Modelfile構文の記述:FROM、PARAMETER、SYSTEM、TEMPLATE。
  • Temperature、top_p、repeat_penaltyの調整。
  • 役割固有の動作のためのシステムプロンプトエンジニアリング。
  • カスタムモデルの作成とローカルレジストリへの公開。

API統合

  • OpenAI互換の /v1/chat/completions エンドポイント。
  • ストリーミング応答およびJSONモード。
  • LangChain、LlamaIndex、およびカスタムアプリとの統合。
  • リバースプロキシによる認証とレートリミティング。

パフォーマンス最適化

  • コンテキストウィンドウのサイズ設定とKVキャッシュ管理。
  • バッチ推論と並列リクエスト処理。
  • CPUスレッド割り当てとNUMA(Non-Uniform Memory Access)の認識。
  • GPUの使用状況とメモリの圧迫状態の監視。

セキュリティとコンプライアンス

  • モデル提供エンドポイントのネットワーク分離。
  • 入力フィルタリングと出力モデレーションパイプライン。
  • プロンプトおよびcompletionの監査ログ。
  • モデルの由来確認とハッシュ検証。

要求

  • 中級レベルのLinuxおよびコンテナ管理知識。
  • 機械学習およびTransformerモデルの高水準な理解。
  • REST APIおよびJSONに関する基本的な知識。

対象者

  • クラウドLLM APIを自社ホスト環境へ移行したいAIエンジニアおよび開発者。
  • データの機密性が高く、クラウドモデルの使用が制限されている組織。
  • エアギャップされたネットワーク環境で言語モデルが必要な政府機関や防衛関連チーム。
 14 時間

参加者の人数


参加者1人あたりの価格

今後のコース

関連カテゴリー