お問い合わせ

コース概要

各セッションは2時間です

Day-1: Session -1: 政府におけるビッグデータ・ビジネスインテリジェンスのビジネス概要

  • NIH、エネルギー省(DoE)からの事例研究
  • 政府機関におけるビッグデータ適応率と、それらがビッグデータ予測分析を中心に今後の運営をどう統合しているか
  • 国防総省(DoD)、NSA、IRS、農業省(USDA)などにおける広範な応用分野
  • ビッグデータとレガシーデータのインターフェース化
  • 予測分析の有効化技術の基本的な理解
  • データ統合とダッシュボード可視化
  • 不正管理
  • ビジネスルール/不正検出生成
  • 脅威の検出とプロファイリング
  • ビッグデータ導入のコストベネフィット分析

Day-1: Session-2 : ビッグデータ入門-1

  • ビッグデータの主要な特性:ボリューム、バリエティ、ベロシティ、ベリシティ。ボリューム向けのMPPアーキテクチャ。
  • データウェアハウス – 静的スキーマ、ゆっくり進化していくデータセット
  • Greenplum、Exadata、Teradata、Netezza、VerticaなどのMPPデータベース
  • Hadoopベースのソリューション – データセットの構造に制限なし。
  • 典型的なパターン : HDFS、MapReduce (crunch)、HDFSからの取得
  • バッチ – 分析/非対話型に適する
  • ボリューム : CEPストリーミングデータ
  • 典型的な選択 – CEPプロダクト(例: Infostreams、Apama、MarkLogicなど)
  • 本番環境での準備がまだ不十分 – Storm/S4
  • NoSQLデータベース – (列型とキーバリュー型): データウェアハウス/データベースの分析補完として最も適している

Day-1 : Session -3 : ビッグデータ入門-2

NoSQLソリューション

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (階層型) - GT.m, Cache
  • KV Store (順序付け) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • オブジェクトデータベース - ZopeDB, DB40, Shoal
  • ドキュメントストレージ - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • ワイドカラムストレージ - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

データのバリエティ: ビッグデータにおけるデータクレンジング問題の紹介

  • RDBMS – 静的構造/スキーマ、アジャイルで探索的な環境を促進しない。
  • NoSQL – セミ構造化、データを保存する前に正確なスキーマなしで保存できる十分な構造を持つ
  • データクレンジングの問題

Day-1 : Session-4 : ビッグデータ入門-3 : Hadoop

  • いつHadoopを選択すべきか?
  • 構造化データ - エンタープライズデータウェアハウス/データベースは大量のデータを保存できる(コストがかかるが)が、構造を強制する(能動的な探索には不向き)
  • セミ構造化データ – 従来のソリューション(DW/DB)では困難
  • データウェアハウジング = 巨大な努力を要し、導入後も静的
  • データのバリエティとボリュームのために、コモディティハードウェアで処理 – HADOOP
  • Hadoopクラスタを作成するにはコモディティH/Wが必要

MapReduce / HDFSの紹介

  • MapReduce – 複数のサーバーにわたって計算を分散
  • HDFS – 計算プロセスのためにデータをローカルで利用可能にする(冗長性あり)
  • データ – 非構造化/スキーマレスの場合あり(RDBMSと異なり)
  • データを意味のあるものにするのは開発者の責任
  • MapReduceのプログラミング = Javaでの作業(利点/欠点)、データをHDFSに手動で読み込む

Day-2: Session-1: ビッグデータエコシステム-ビッグデータETLの構築: ビッグデータツールの宇宙-いつどれを使うか?

  • Hadoop vs. 他のNoSQLソリューション
  • 対話的、ランダムアクセスのために
  • Hadoop上のHbase(列指向型データベース)
  • ランダムアクセスが可能だが制限がある(最大1PB)
  • アドホック分析には不向き、ログ、カウント、時系列には適している
  • Sqoop - データベースからHiveまたはHDFSへインポート(JDBC/ODBCアクセス)
  • Flume – ストリームデータ(例:ログデータ)をHDFSに読み込む

Day-2: Session-2: ビッグデータ管理システム

  • 可動部分、計算ノードの開始/失敗 :ZooKeeper - 設定/調整/ネーミングサービス用
  • 複雑なパイプライン/ワークフロー: Oozie – ワークフロー、依存関係、デイズチェーンの管理
  • デプロイ、設定、クラスタ管理、アップグレードなど(システム管理者) :Ambari
  • クラウド内 : Whirr

Day-2: Session-3: ビジネスインテリジェンスにおける予測分析 -1: 基本的な技術と機械学習ベースのBI :

  • 機械学習の紹介
  • 分類技術の学習
  • ベイズ予測-訓練ファイルの準備
  • サポートベクトルマシン
  • KNN p-Tree代数 & 縦方向マイニング
  • ニューラルネットワーク
  • ビッグデータ大規模変数問題 -Random forest (RF)
  • ビッグデータ自動化問題 – Multi-model ensemble RF
  • Soft10-Mを通じた自動化
  • テキスト分析ツール-Treeminer
  • アジャイル学習
  • エージェントベース学習
  • 分散学習
  • 予測分析のオープンソースツールの紹介 : R, Rapidminer, Mahut

Day-2: Session-4 予測分析エコシステム-2: 政府における一般的な予測分析問題

  • インサイト分析
  • 可視化分析
  • 構造化予測分析
  • 非構造化予測分析
  • 脅威/詐欺者/ベンダープロファイリング
  • レコメンデーションエンジン
  • パターン検出
  • ルール/シナリオの発見 – 失敗、詐欺、最適化
  • 根本原因の発見
  • 感情分析
  • CRM分析
  • ネットワーク分析
  • テキスト分析
  • 技術支援レビュー
  • 詐欺分析
  • リアルタイム分析

Day-3 : Sesion-1 : Hadoop上のリアルタイムかつスケーラブルな分析

  • 一般的な分析アルゴリズムがHadoop/HDFSで失敗する理由
  • Apache Hama- 大規模同期分散計算向け
  • Apache SPARK- リアルタイム分析のためのクラスタコンピューティング向け
  • CMU Graphics Lab2- グラフベースの非同期分散コンピューティングアプローチ
  • TreeminerによるKNN p-Algebraベースのアプローチ、運用のためのハードウェアコスト削減

Day-3: Session-2: eDiscoveryと法務のためのツール

  • eDiscovery over Big Data vs. レガシーデータ – コストとパフォーマンスの比較
  • 予測コーディングと技術支援レビュー(TAR)
  • TARプロダクト(vMiner)のライブデモ、より速い発見のためにTARがどのように機能するかを理解する
  • HDFSを通じたより速いインデクシング – データのベロシティ
  • NLPまたは自然言語処理 – 様々な技術とオープンソースプロダクト
  • 外国語におけるeDiscovery- 外国語処理技術

Day-3 : Session 3: サイバーセキュリティのためのビッグデータBI – 迅速なデータ収集から脅威の識別までの全体像の360度ビューを理解する

  • セキュリティ分析の基礎の理解-攻撃面、セキュリティ設定ミス、ホスト防御
  • リアルタイム分析のためのネットワークインフラ/ 大規模データパイプ/ 応答ETL
  • 処方 vs 予測 – 固定ルールベース vs メタデータからの脅威ルールの自動発見

Day-3: Session 4: USDAにおけるビッグデータ : 農業への応用

  • 農業のためのIoT(Internet of Things)の紹介-センサーベースのビッグデータと制御
  • 衛星イメージングとその農業への応用の紹介
  • 土壌の肥力、栽培の推奨と予測のためのセンサーと画像データの統合
  • 農業保険とビッグデータ
  • 作物損失の予測

Day-4 : Session-1: 政府のビッグデータからの不正防止BI-不正分析:

  • 不正分析の基本的な分類- ルールベース vs 予測分析
  • 不正パターン検出のための教師あり vs 教師なし機械学習
  • ベンダーの詐欺/プロジェクトへの過大請求
  • MedicareとMedicaidの詐欺- クレーム処理のための詐欺検出技術
  • 出張費払い戻しの詐欺
  • IRS(国税局)還付金の詐欺
  • データが利用可能な場合は、事例研究とライブデモが行われます。

Day-4 : Session-2: ソーシャルメディア分析- インテリジェンスの収集と分析

  • ソーシャルメディアデータを抽出するためのビッグデータETL API
  • テキスト、画像、メタデータ、動画
  • ソーシャルメディアフィードからの感情分析
  • ソーシャルメディアフィードのコンテキストベースと非コンテキストベースのフィルタリング
  • 多様なソーシャルメディアを統合するためのソーシャルメディアダッシュボード
  • ソーシャルメディアプロフィールの自動プロファイリング
  • 各分析のライブデモがTreeminerツールを通じて行われます。

Day-4 : Session-3: 画像処理と動画フィードにおけるビッグデータ分析

  • ビッグデータにおける画像保存技術- ペタバイトを超えるデータのためのストレージソリューション
  • LTFSとLTO
  • GPFS-LTFS (ビッグ画像データのための階層型ストレージソリューション)
  • 画像分析の基礎
  • オブジェクト認識
  • 画像セグメンテーション
  • モーショントラッキング
  • 3-D画像再構築

Day-4: Session-4: NIHにおけるビッグデータアプリケーション:

  • バイオインフォマティクスの新興分野
  • メタゲノミクスとビッグデータマイニングの問題
  • 薬物基因组学、メタボロミクス、プロテオミクスのためのビッグデータ予測分析
  • 下流ゲノミクスプロセスにおけるビッグデータ
  • 公衆衛生におけるビッグデータ予測分析の応用

多様なデータへの迅速なアクセスと表示のためのビッグデータダッシュボード :

  • 既存アプリケーションプラットフォームとビッグデータダッシュボードの統合
  • ビッグデータ管理
  • ビッグデータダッシュボードの事例研究: TableauとPentaho
  • ビッグデータアプリケーションを使用して政府における位置情報サービスを推進する。
  • トラッキングシステムと管理

Day-5 : Session-1: 組織内でビッグデータBIの実装を正当化する方法:

  • ビッグデータ実装のROIの定義
  • データの収集と準備のためのアナリスト時間の節約に関する事例研究 – 生産性向上
  • ライセンス済みデータベースコストの節約による収益増加の事例研究
  • 位置情報サービスからの収益増加
  • 不正防止からの節約
  • ビッグデータ実装による費用対比/収益増加/節約を計算するための統合スプレッドシートアプローチ。

Day-5 : Session-2: レガシーデータシステムをビッグデータシステムに置き換えるための手順:

  • 実用的なビッグデータ移行ロードマップの理解
  • ビッグデータ実装をアーキテクチャする前に必要な重要な情報
  • データのボリューム、ベロシティ、バリエティ、ベリシティを計算する異なる方法
  • データ成長の見積もり方
  • 事例研究

Day-5: Session 4: ビッグデータベンダーとその製品のレビュー。Q/Aセッション:

  • Accenture
  • APTEAN (Formerly CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Formerly 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Part of EMC)

要求

  • 特定の領域における政府のビジネス運営とデータシステムに関する基礎知識
  • SQL/Oracleまたはリレーショナルデータベースの基本的な理解
  • 統計学の基本的な理解(スプレッドシートレベル)
 35 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (1)

今後のコース

関連カテゴリー