お問い合わせ

コース概要

AI主権の確保とローカル環境における大規模言語モデルの展開

  • クラウドLLMに伴うリスク:データ保持、入力情報を用いた学習、外国法規制の影響。
  • Ollamaの仕組み:モデルサーバー、レジストリ、OpenAI互換APIの概要。
  • vLLMやllama.cpp、Text Generation Inferenceとの比較分析。
  • Llama/Mistral/Qwen/Gemma各種ライセンス規約の解説。

インストール手順とハードウェア環境設定

  • CUDAやROCm対応LinuxシステムへのOllama導入方法。
  • GPU非搭載環境におけるAVX/AVX2最適化手法。
  • Dockerを利用したデプロイ手順および永続的ボリューム設定法。
  • 複数GPU構成下でのVRAM割り当て戦略の策定。

モデル管理手法

  • Ollamaレジストリからのモデル取得手順:例として「ollama pull llama3」コマンド。
  • HuggingFaceやTheBloke経由でのGGUF形式モデルの取り込み手法。
  • 各種量子化レベル(Q4_K_M、Q5_K_M、Q8_0)の特徴比較と選定基準。
  • 複数モデルの切り替え操作や同時ロード可能上限値に関する説明。

独自Modelfileの作成手順

  • FROM/PARAMETER/SYSTEM/TEMPLATEコマンドを用いた構文定義方法。
  • 温度設定やtop_p値、反復ペナルティパラメータの調整手法。
  • 目的別役割に合わせたシステムプロンプトの設計法。
  • 自作モデルのローカルレジストリへの登録・公開手順。

API統合テクニック

  • OpenAI互換エンドポイント「/v1/chat/completions」の利用方法。
  • ストリーム配信応答処理およびJSON形式出力の制御法。
  • LangChain/LlamaIndexとの連携手法や独自アプリケーションへの実装例。
  • リバースプロキシを活用した認証機構設計および接続速度制限策。

パフォーマンス最適化の実践方法

  • 文脈ウィンドウサイズとKVキャッシュ管理戦略。
  • バッチ推論処理や同時接続リクエストへの対応法。
  • CPUスレッド配置およびNUMA構造を考慮した最適化手法。
  • GPU使用率やメモリ負荷状況の監視手順。

セキュリティ維持とコンプライアンス対応

  • 外部ネットワークから隔離されたモデル提供エンドポイント構築法。
  • 入力データのフィルタリングおよび出力結果のチェックシステム構成法。
  • プロンプト内容や生成結果に関する監査ログ収集仕組み。
  • モデルの信頼性検証のためのハッシュ値確認作業。

要求

  • Linux環境およびコンテナ管理に関する中級レベルの知識。
  • 機械学習やトランスフォーマーモデルについての全体的な理解。
  • REST APIおよびJSON形式への基本的な習熟度。

対象者

  • クラウドベースのLLM APIを代替することを目指すAIエンジニアや開発者。
  • データセキュリティ上の理由からクラウドモデル利用が困難な企業組織。
  • ネットワーク非接続環境で動作可能な言語モデルを必要とする政府・防衛関連部署。
 14 時間

参加者の人数


参加者1人あたりの価格

今後のコース

関連カテゴリー