コース概要
Day 01
犯罪情報分析におけるビッグデータ・ビジネスインテリジェンスの概要
- 法執行機関からのケーススタディ - 予測的ポリシング
- 法執行機関におけるビッグデータ導入率と、ビッグデータ予測分析を中心に将来の運用をどのように調整しているか
- 銃声センサー、監視ビデオ、ソーシャルメディアなどの新興技術ソリューション
- ビッグデータ技術を用いた情報過多の軽減
- ビッグデータとレガシーデータのインターフェース
- 予測分析における基盤技術の基本的な理解
- データ統合およびダッシュボードビジュアライゼーション
- 不正管理
- ビジネスルールと不正検出
- 脅威の検出とプロファイリング
- ビッグデータ実装のコストメリット分析
ビッグデータ入門
- ビッグデータの主要な特徴 - Volume(容量)、Variety(多様性)、Velocity(速さ)、Veracity(正確性)。
- MPP(マッシブパラレルプロセッシング)アーキテクチャ
- データウェアハウス - 静的スキーマ、ゆっくりと進化するデータセット
- MPPデータベース:Greenplum, Exadata, Teradata, Netezza, Vertica 等
- Hadoopベースのソリューション - データセットの構造に条件なし。
- 典型的なパターン:HDFS, MapReduce (crunch), HDFSからの取得
- ストリーム処理のための Apache Spark
- バッチ - 分析/非対話向き
- Volume:CEPストリーミングデータ
- 典型的な選択肢 – CEP製品(例:Infostreams, Apama, MarkLogic 等)
- 本番環境での対応が未成熟 – Storm/S4
- NoSQLデータベース –(カラム型とキーバリュー型):データウェアハウス/データベースの分析補完として最適
NoSQLソリューション
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (階層型) - GT.m, Cache
- KV Store (順序型) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- タプルストア - Gigaspaces, Coord, Apache River
- オブジェクトデータベース - ZopeDB, DB40, Shoal
- ドキュメントストア - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- ワイドカラムストア - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
データの多様性:ビッグデータにおけるデータクリーニングの問題への導入
- RDBMS – 静的構造/スキーマ、アジャイルで探索的な環境を促進しない。
- NoSQL – 半構造化、データを保存する前に正確なスキーマがない場合でもデータを保存するために十分な構造
- データクリーニングの問題
Hadoop
- いつ Hadoop を選択すべきか?
- 構造化データ - エンタープライズデータウェアハウス/データベースは大量のデータを保存できる(コストがかかるが)が、構造を強制する(積極的な探索には不向き)
- 半構造化データ – 従来のソリューション(DW/DB)では処理が困難
- データウェアハウジング = 大きな労力が必要であり、実装後も静的
- データの多様性 & 容量、コモディティハードウェアで処理 – HADOOP
- Hadoopクラスタの作成にはコモディティハードウェアが必要
Map Reduce /HDFS への導入
- MapReduce – 複数のサーバー間で計算を分散
- HDFS – 計算プロセスのためにデータをローカルで利用可能にする(冗長性付き)
- データ – 非構造化/スキーマレス(RDBMS とは異なり)
- データの意義を見出すことは開発者の責任
- MapReduce のプログラミング = Java の使用(メリット/デメリット)、HDFS への手動データ読み込み
Day 02
ビッグデータエコシステム -- ビッグデータETL(抽出、変換、読み込み)の構築 -- どのビッグデータツールをいつ使うべきか?
- Hadoop と他の NoSQL ソリューションの比較
- データの対話的、ランダムアクセスに対して
- Hadoop 上の Hbase (カラム指向データベース)
- データのランダムアクセスが可能だが制限あり (最大 1 PB)
- アドホック分析には不向き、ログ記録、カウント、時系列には向いている
- Sqoop - データベースから Hive または HDFS へのインポート (JDBC/ODBC アクセス)
- Flume – ストリームデータ(例:ログデータ)を HDFS に取り込み
ビッグデータ管理システム
- 移動部分、計算ノードの起動/失敗 :ZooKeeper - 設定/協調/命名サービス用
- 複雑なパイプライン/ワークフロー: Oozie – ワークフロー、依存関係、チェーン管理
- デプロイ、設定、クラスター管理、アップグレードなど (システム管理) :Ambari
- クラウド内 : Whirr
予測分析 -- 基礎技術と機械学習ベースのビジネスインテリジェンス
- 機械学習への導入
- 分類技術の学習
- ベイズ予測 -- 学習ファイルの準備
- サポートベクターマシン
- KNN p-Tree 代数 & 縦型マイニング
- ニューラルネットワーク
- ビッグデータ大規模変数問題 -- ランダムフォレスト (RF)
- ビッグデータ自動化問題 – マルチモデルアンサンブル RF
- Soft10-M を通じた自動化
- テキスト分析ツール-Treeminer
- アジャイル学習
- エージェントベース学習
- 分散学習
- 予測分析のためのオープンソースツールへの導入 : R, Python, Rapidminer, Mahut
予測分析エコシステムとその犯罪情報分析への応用
- 技術と捜査プロセス
- インサイト分析
- ビジュアライゼーション分析
- 構造化予測分析
- 非構造化予測分析
- 脅威/不正/ベンダープロファイリング
- レコメンデーションエンジン
- パターン検出
- ルール/シナリオ発見 – 失敗、不正、最適化
- 根本原因の発見
- 感情分析
- CRM分析
- ネットワーク分析
- トランスクリプト、証人供述、インターネット上の議論などからのインサイト取得のためのテキスト分析
- 技術支援レビュー
- 不正分析
- リアルタイム分析
Day 03
Hadoop 上でのリアルタイムおよびスケーラブルな分析
- 一般的な分析アルゴリズムが Hadoop/HDFS で失敗する理由
- Apache Hama- バルクシステリック分散コンピューティング用
- Apache SPARK- クラスターコンピューティングとリアルタイム分析用
- CMU Graphics Lab2- グラフベースの非同期分散コンピューティングアプローチ
- KNN p -- Treeminer による代数ベースのアプローチで運用ハードウェアコストを削減
eDiscovery と法科学のツール
- ビッグデータ vs. レガシーデータにおける eDiscovery – コストと性能の比較
- 予測コーディングと技術支援レビュー (TAR)
- TAR がより迅速な発見をどう可能にするかを理解するための vMiner のライブデモ
- HDFS によるより高速なインデックス作成 – データの速度 (Velocity)
- NLP (自然言語処理) – オープンソース製品と技術
- 外国語での eDiscovery -- 外国語処理のための技術
サイバーセキュリティにおけるビッグデータ BI – 360度の視点、迅速なデータ収集と脅威識別
- セキュリティ分析の基本を理解する -- 攻撃サーフェス、セキュリティ設定ミス、ホスト防御
- ネットワークインフラストラクチャ / 大容量データパイプ / リアルタイム分析用のレスポンスタイプ ETL
- 指示型 vs 予測型 – 固定ルールベース vs メタデータからの脅威ルールの自動発見
犯罪情報分析のための多様なデータの収集
- IoT (モノのインターネット) をセンサーとしてデータキャプチャに使用
- 国内監視のための衛星画像の利用
- 犯罪者識別のための監視および画像データの利用
- 他のデータ収集技術 -- ドローン、ボディカメラ、GPS タギングシステム、赤外線画像技術
- 自動データ取得と情報提供者、尋問、調査から得たデータの組み合わせ
- 犯罪活動の予測
Day 04
不正分析におけるビッグデータからの不正防止 BI
- 不正分析の基本的な分類 -- ルールベース vs 予測分析
- 不正パターン検出のための教師あり vs 教師なし機械学習
- 法人間不正、医療請求不正、保険不正、脱税、マネーロンダリング
ソーシャルメディア分析 -- インテリジェンスの収集と分析
- 犯罪者がソーシャルメディアを組織化、募集、計画にどのように使用しているか
- ソーシャルメディアデータを抽出するためのビッグデータ ETL API
- テキスト、画像、メタデータ、ビデオ
- ソーシャルメディアフィードからの感情分析
- ソーシャルメディアフィードの文脈依存および非文脈依存フィルタリング
- 多様なソーシャルメディアを統合するためのソーシャルメディアダッシュボード
- ソーシャルメディアプロフィールの自動プロファイリング
- Treeminer ツールを通じて各分析のライブデモを実施
画像処理およびビデオフィードにおけるビッグデータ分析
- ビッグデータにおける画像ストレージ技術 -- ペタバイトを超えるデータのストレージソリューション
- LTFS (Linear Tape File System) と LTO (Linear Tape Open)
- GPFS-LTFS (General Parallel File System - Linear Tape File System) -- ビッグ画像データの階層型ストレージソリューション
- 画像分析の基礎
- オブジェクト認識
- 画像セグメンテーション
- モーショントラッキング
- 3-D 画像再構成
バイオメトリクス、DNA および次世代識別プログラム
- 指紋および顔認識を超えるもの
- 音声認識、キーストローク (ユーザーのタイピングパターンの分析)、CODIS (Combined DNA Index System)
- DNA マッチングを超えるもの:法科学 DNA ファイノタイプ化を用いて DNA サンプルから顔を構築
多様なデータの迅速なアクセスと表示のためのビッグデータダッシュボード :
- 既存アプリケーションプラットフォームとビッグデータダッシュボードの統合
- ビッグデータ管理
- ビッグデータダッシュボードのケーススタディ:Tableau と Pentaho
- ビッグデータアプリを活用して政府内の位置情報サービスを推進
- トラッキングシステムと管理
Day 05
組織内でビッグデータ BI 実装を正当化するには:
- ビッグデータ実装のための ROI (投資対効果) の定義
- データ収集と準備におけるアナリストの時間を節約するケーススタディ – 生産性の向上
- データベースライセンスコストの低下による収益向上
- 位置情報サービスからの収益向上
- 不正防止によるコスト削減
- ビッグデータ実装による推定費用 vs. 収益向上/コスト削減を計算するための統合スプレッドシートアプローチ。
レガシーデータシステムをビッグデータシステムに置き換えるためのステップバイステップの手順
- ビッグデータ移行ロードマップ
- ビッグデータシステムを設計する前に必要な重要な情報とは?
- データの Volume, Velocity, Variety, Veracity を計算するさまざまな方法とは?
- データ成長をどのように推定するか
- ケーススタディ
ビッグデータベンダーとその製品のレビュー。
- Accenture
- APTEAN (元 CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (元 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (EMC の一部)
Q/A セッション
要求
- 法執行プロセスおよびデータシステムの知識
- SQL/Oracleまたはリレーショナルデータベースの基本的な理解
- 統計の基本的な理解(スプレッドシートレベル)
対象者
- 技術的背景を持つ法執行専門官
お客様の声 (3)
基礎を学び、準備されたドキュメントと演習問題が大好きでした
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
コース - Introduction to Predictive AI
機械翻訳
ディープシーは私のニーズに非常に敏感で、複雑さを追加するタイミングと、より構造化されたアプローチを取るタイミングを見極めることができました。 ディープシーは本当に私のペースに合わせて働き、新しい機能やツールの使い方をまず見せてから自分で再現させてくれたことで、訓練が確実に身につきました。この訓練の結果とディープシーの専門知識には非常に満足しています!
Deepthi - Invest Northern Ireland
コース - IBM Cognos Analytics
機械翻訳
彼は十分に準備ができていて、とても親しみやすい人です
Oliver - Post CH AG
コース - Splunk Fundamentals
機械翻訳