お問い合わせを送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
予約を送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
コース概要
AI的主権とLLMのローカルデプロイメント
- クラウドLLMのリスク:データ保持、入力に対する学習、外国の司法管轄区。
- Ollamaのアーキテクチャ:モデルサーバー、レジストリ、およびOpenAI互換API。
- vLLM、llama.cpp、Text Generation Inferenceとの比較。
- モデルライセンス:Llama、Mistral、Qwen、Gemmaの利用条件。
インストールとハードウェア設定
- CUDAおよびROCmサポート付きのLinuxへのOllamaインストール。
- CPUのみのフォールバックおよびAVX/AVX2の最適化。
- Dockerデプロイメントと永続ボリュームのマッピング。
- マルチGPU設定とVRAM割り当て戦略。
モデル管理
- Ollamaレジストリからのモデルプル:ollama pull llama3。
- HuggingFaceおよびTheBlokeからのGGUFモデルのインポート。
- 量子化レベル:Q4_K_M、Q5_K_M、Q8_0のトレードオフ。
- モデルの切り替えと並列モデル読み込みの制限。
カスタムModelfile
- Modelfile構文の記述:FROM、PARAMETER、SYSTEM、TEMPLATE。
- Temperature、top_p、repeat_penaltyの調整。
- 役割固有の動作のためのシステムプロンプトエンジニアリング。
- カスタムモデルの作成とローカルレジストリへの公開。
API統合
- OpenAI互換の /v1/chat/completions エンドポイント。
- ストリーミング応答およびJSONモード。
- LangChain、LlamaIndex、およびカスタムアプリとの統合。
- リバースプロキシによる認証とレートリミティング。
パフォーマンス最適化
- コンテキストウィンドウのサイズ設定とKVキャッシュ管理。
- バッチ推論と並列リクエスト処理。
- CPUスレッド割り当てとNUMA(Non-Uniform Memory Access)の認識。
- GPUの使用状況とメモリの圧迫状態の監視。
セキュリティとコンプライアンス
- モデル提供エンドポイントのネットワーク分離。
- 入力フィルタリングと出力モデレーションパイプライン。
- プロンプトおよびcompletionの監査ログ。
- モデルの由来確認とハッシュ検証。
要求
- 中級レベルのLinuxおよびコンテナ管理知識。
- 機械学習およびTransformerモデルの高水準な理解。
- REST APIおよびJSONに関する基本的な知識。
対象者
- クラウドLLM APIを自社ホスト環境へ移行したいAIエンジニアおよび開発者。
- データの機密性が高く、クラウドモデルの使用が制限されている組織。
- エアギャップされたネットワーク環境で言語モデルが必要な政府機関や防衛関連チーム。
14 時間