お問い合わせ

コース概要

Day 01

犯罪情報分析におけるビッグデータ・ビジネスインテリジェンスの概要

  • 法執行機関からのケーススタディ - 予測的ポリシング
  • 法執行機関におけるビッグデータ導入率と、ビッグデータ予測分析を中心に将来の運用をどのように調整しているか
  • 銃声センサー、監視ビデオ、ソーシャルメディアなどの新興技術ソリューション
  • ビッグデータ技術を用いた情報過多の軽減
  • ビッグデータとレガシーデータのインターフェース
  • 予測分析における基盤技術の基本的な理解
  • データ統合およびダッシュボードビジュアライゼーション
  • 不正管理
  • ビジネスルールと不正検出
  • 脅威の検出とプロファイリング
  • ビッグデータ実装のコストメリット分析

ビッグデータ入門

  • ビッグデータの主要な特徴 - Volume(容量)、Variety(多様性)、Velocity(速さ)、Veracity(正確性)。
  • MPP(マッシブパラレルプロセッシング)アーキテクチャ
  • データウェアハウス - 静的スキーマ、ゆっくりと進化するデータセット
  • MPPデータベース:Greenplum, Exadata, Teradata, Netezza, Vertica 等
  • Hadoopベースのソリューション - データセットの構造に条件なし。
  • 典型的なパターン:HDFS, MapReduce (crunch), HDFSからの取得
  • ストリーム処理のための Apache Spark
  • バッチ - 分析/非対話向き
  • Volume:CEPストリーミングデータ
  • 典型的な選択肢 – CEP製品(例:Infostreams, Apama, MarkLogic 等)
  • 本番環境での対応が未成熟 – Storm/S4
  • NoSQLデータベース –(カラム型とキーバリュー型):データウェアハウス/データベースの分析補完として最適

NoSQLソリューション

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (階層型) - GT.m, Cache
  • KV Store (順序型) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • タプルストア - Gigaspaces, Coord, Apache River
  • オブジェクトデータベース - ZopeDB, DB40, Shoal
  • ドキュメントストア - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • ワイドカラムストア - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

データの多様性:ビッグデータにおけるデータクリーニングの問題への導入

  • RDBMS – 静的構造/スキーマ、アジャイルで探索的な環境を促進しない。
  • NoSQL – 半構造化、データを保存する前に正確なスキーマがない場合でもデータを保存するために十分な構造
  • データクリーニングの問題

Hadoop

  • いつ Hadoop を選択すべきか?
  • 構造化データ - エンタープライズデータウェアハウス/データベースは大量のデータを保存できる(コストがかかるが)が、構造を強制する(積極的な探索には不向き)
  • 半構造化データ – 従来のソリューション(DW/DB)では処理が困難
  • データウェアハウジング = 大きな労力が必要であり、実装後も静的
  • データの多様性 & 容量、コモディティハードウェアで処理 – HADOOP
  • Hadoopクラスタの作成にはコモディティハードウェアが必要

Map Reduce /HDFS への導入

  • MapReduce – 複数のサーバー間で計算を分散
  • HDFS – 計算プロセスのためにデータをローカルで利用可能にする(冗長性付き)
  • データ – 非構造化/スキーマレス(RDBMS とは異なり)
  • データの意義を見出すことは開発者の責任
  • MapReduce のプログラミング = Java の使用(メリット/デメリット)、HDFS への手動データ読み込み

Day 02

ビッグデータエコシステム -- ビッグデータETL(抽出、変換、読み込み)の構築 -- どのビッグデータツールをいつ使うべきか?

  • Hadoop と他の NoSQL ソリューションの比較
  • データの対話的、ランダムアクセスに対して
  • Hadoop 上の Hbase (カラム指向データベース)
  • データのランダムアクセスが可能だが制限あり (最大 1 PB)
  • アドホック分析には不向き、ログ記録、カウント、時系列には向いている
  • Sqoop - データベースから Hive または HDFS へのインポート (JDBC/ODBC アクセス)
  • Flume – ストリームデータ(例:ログデータ)を HDFS に取り込み

ビッグデータ管理システム

  • 移動部分、計算ノードの起動/失敗 :ZooKeeper - 設定/協調/命名サービス用
  • 複雑なパイプライン/ワークフロー: Oozie – ワークフロー、依存関係、チェーン管理
  • デプロイ、設定、クラスター管理、アップグレードなど (システム管理) :Ambari
  • クラウド内 : Whirr

予測分析 -- 基礎技術と機械学習ベースのビジネスインテリジェンス

  • 機械学習への導入
  • 分類技術の学習
  • ベイズ予測 -- 学習ファイルの準備
  • サポートベクターマシン
  • KNN p-Tree 代数 & 縦型マイニング
  • ニューラルネットワーク
  • ビッグデータ大規模変数問題 -- ランダムフォレスト (RF)
  • ビッグデータ自動化問題 – マルチモデルアンサンブル RF
  • Soft10-M を通じた自動化
  • テキスト分析ツール-Treeminer
  • アジャイル学習
  • エージェントベース学習
  • 分散学習
  • 予測分析のためのオープンソースツールへの導入 : R, Python, Rapidminer, Mahut

予測分析エコシステムとその犯罪情報分析への応用

  • 技術と捜査プロセス
  • インサイト分析
  • ビジュアライゼーション分析
  • 構造化予測分析
  • 非構造化予測分析
  • 脅威/不正/ベンダープロファイリング
  • レコメンデーションエンジン
  • パターン検出
  • ルール/シナリオ発見 – 失敗、不正、最適化
  • 根本原因の発見
  • 感情分析
  • CRM分析
  • ネットワーク分析
  • トランスクリプト、証人供述、インターネット上の議論などからのインサイト取得のためのテキスト分析
  • 技術支援レビュー
  • 不正分析
  • リアルタイム分析

Day 03

Hadoop 上でのリアルタイムおよびスケーラブルな分析

  • 一般的な分析アルゴリズムが Hadoop/HDFS で失敗する理由
  • Apache Hama- バルクシステリック分散コンピューティング用
  • Apache SPARK- クラスターコンピューティングとリアルタイム分析用
  • CMU Graphics Lab2- グラフベースの非同期分散コンピューティングアプローチ
  • KNN p -- Treeminer による代数ベースのアプローチで運用ハードウェアコストを削減

eDiscovery と法科学のツール

  • ビッグデータ vs. レガシーデータにおける eDiscovery – コストと性能の比較
  • 予測コーディングと技術支援レビュー (TAR)
  • TAR がより迅速な発見をどう可能にするかを理解するための vMiner のライブデモ
  • HDFS によるより高速なインデックス作成 – データの速度 (Velocity)
  • NLP (自然言語処理) – オープンソース製品と技術
  • 外国語での eDiscovery -- 外国語処理のための技術

サイバーセキュリティにおけるビッグデータ BI – 360度の視点、迅速なデータ収集と脅威識別

  • セキュリティ分析の基本を理解する -- 攻撃サーフェス、セキュリティ設定ミス、ホスト防御
  • ネットワークインフラストラクチャ / 大容量データパイプ / リアルタイム分析用のレスポンスタイプ ETL
  • 指示型 vs 予測型 – 固定ルールベース vs メタデータからの脅威ルールの自動発見

犯罪情報分析のための多様なデータの収集

  • IoT (モノのインターネット) をセンサーとしてデータキャプチャに使用
  • 国内監視のための衛星画像の利用
  • 犯罪者識別のための監視および画像データの利用
  • 他のデータ収集技術 -- ドローン、ボディカメラ、GPS タギングシステム、赤外線画像技術
  • 自動データ取得と情報提供者、尋問、調査から得たデータの組み合わせ
  • 犯罪活動の予測

Day 04

不正分析におけるビッグデータからの不正防止 BI

  • 不正分析の基本的な分類 -- ルールベース vs 予測分析
  • 不正パターン検出のための教師あり vs 教師なし機械学習
  • 法人間不正、医療請求不正、保険不正、脱税、マネーロンダリング

ソーシャルメディア分析 -- インテリジェンスの収集と分析

  • 犯罪者がソーシャルメディアを組織化、募集、計画にどのように使用しているか
  • ソーシャルメディアデータを抽出するためのビッグデータ ETL API
  • テキスト、画像、メタデータ、ビデオ
  • ソーシャルメディアフィードからの感情分析
  • ソーシャルメディアフィードの文脈依存および非文脈依存フィルタリング
  • 多様なソーシャルメディアを統合するためのソーシャルメディアダッシュボード
  • ソーシャルメディアプロフィールの自動プロファイリング
  • Treeminer ツールを通じて各分析のライブデモを実施

画像処理およびビデオフィードにおけるビッグデータ分析

  • ビッグデータにおける画像ストレージ技術 -- ペタバイトを超えるデータのストレージソリューション
  • LTFS (Linear Tape File System) と LTO (Linear Tape Open)
  • GPFS-LTFS (General Parallel File System - Linear Tape File System) -- ビッグ画像データの階層型ストレージソリューション
  • 画像分析の基礎
  • オブジェクト認識
  • 画像セグメンテーション
  • モーショントラッキング
  • 3-D 画像再構成

バイオメトリクス、DNA および次世代識別プログラム

  • 指紋および顔認識を超えるもの
  • 音声認識、キーストローク (ユーザーのタイピングパターンの分析)、CODIS (Combined DNA Index System)
  • DNA マッチングを超えるもの:法科学 DNA ファイノタイプ化を用いて DNA サンプルから顔を構築

多様なデータの迅速なアクセスと表示のためのビッグデータダッシュボード :

  • 既存アプリケーションプラットフォームとビッグデータダッシュボードの統合
  • ビッグデータ管理
  • ビッグデータダッシュボードのケーススタディ:Tableau と Pentaho
  • ビッグデータアプリを活用して政府内の位置情報サービスを推進
  • トラッキングシステムと管理

Day 05

組織内でビッグデータ BI 実装を正当化するには:

  • ビッグデータ実装のための ROI (投資対効果) の定義
  • データ収集と準備におけるアナリストの時間を節約するケーススタディ – 生産性の向上
  • データベースライセンスコストの低下による収益向上
  • 位置情報サービスからの収益向上
  • 不正防止によるコスト削減
  • ビッグデータ実装による推定費用 vs. 収益向上/コスト削減を計算するための統合スプレッドシートアプローチ。

レガシーデータシステムをビッグデータシステムに置き換えるためのステップバイステップの手順

  • ビッグデータ移行ロードマップ
  • ビッグデータシステムを設計する前に必要な重要な情報とは?
  • データの Volume, Velocity, Variety, Veracity を計算するさまざまな方法とは?
  • データ成長をどのように推定するか
  • ケーススタディ

ビッグデータベンダーとその製品のレビュー。

  • Accenture
  • APTEAN (元 CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (元 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (EMC の一部)

Q/A セッション

要求

  • 法執行プロセスおよびデータシステムの知識
  • SQL/Oracleまたはリレーショナルデータベースの基本的な理解
  • 統計の基本的な理解(スプレッドシートレベル)

対象者

  • 技術的背景を持つ法執行専門官
 35 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (3)

今後のコース

関連カテゴリー