お問い合わせを送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
予約を送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
コース概要
各セッションは2時間です
Day-1: Session -1: 政府におけるビッグデータ・ビジネスインテリジェンスのビジネス概要
- NIH、エネルギー省(DoE)からの事例研究
- 政府機関におけるビッグデータ適応率と、それらがビッグデータ予測分析を中心に今後の運営をどう統合しているか
- 国防総省(DoD)、NSA、IRS、農業省(USDA)などにおける広範な応用分野
- ビッグデータとレガシーデータのインターフェース化
- 予測分析の有効化技術の基本的な理解
- データ統合とダッシュボード可視化
- 不正管理
- ビジネスルール/不正検出生成
- 脅威の検出とプロファイリング
- ビッグデータ導入のコストベネフィット分析
Day-1: Session-2 : ビッグデータ入門-1
- ビッグデータの主要な特性:ボリューム、バリエティ、ベロシティ、ベリシティ。ボリューム向けのMPPアーキテクチャ。
- データウェアハウス – 静的スキーマ、ゆっくり進化していくデータセット
- Greenplum、Exadata、Teradata、Netezza、VerticaなどのMPPデータベース
- Hadoopベースのソリューション – データセットの構造に制限なし。
- 典型的なパターン : HDFS、MapReduce (crunch)、HDFSからの取得
- バッチ – 分析/非対話型に適する
- ボリューム : CEPストリーミングデータ
- 典型的な選択 – CEPプロダクト(例: Infostreams、Apama、MarkLogicなど)
- 本番環境での準備がまだ不十分 – Storm/S4
- NoSQLデータベース – (列型とキーバリュー型): データウェアハウス/データベースの分析補完として最も適している
Day-1 : Session -3 : ビッグデータ入門-2
NoSQLソリューション
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (階層型) - GT.m, Cache
- KV Store (順序付け) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- オブジェクトデータベース - ZopeDB, DB40, Shoal
- ドキュメントストレージ - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- ワイドカラムストレージ - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
データのバリエティ: ビッグデータにおけるデータクレンジング問題の紹介
- RDBMS – 静的構造/スキーマ、アジャイルで探索的な環境を促進しない。
- NoSQL – セミ構造化、データを保存する前に正確なスキーマなしで保存できる十分な構造を持つ
- データクレンジングの問題
Day-1 : Session-4 : ビッグデータ入門-3 : Hadoop
- いつHadoopを選択すべきか?
- 構造化データ - エンタープライズデータウェアハウス/データベースは大量のデータを保存できる(コストがかかるが)が、構造を強制する(能動的な探索には不向き)
- セミ構造化データ – 従来のソリューション(DW/DB)では困難
- データウェアハウジング = 巨大な努力を要し、導入後も静的
- データのバリエティとボリュームのために、コモディティハードウェアで処理 – HADOOP
- Hadoopクラスタを作成するにはコモディティH/Wが必要
MapReduce / HDFSの紹介
- MapReduce – 複数のサーバーにわたって計算を分散
- HDFS – 計算プロセスのためにデータをローカルで利用可能にする(冗長性あり)
- データ – 非構造化/スキーマレスの場合あり(RDBMSと異なり)
- データを意味のあるものにするのは開発者の責任
- MapReduceのプログラミング = Javaでの作業(利点/欠点)、データをHDFSに手動で読み込む
Day-2: Session-1: ビッグデータエコシステム-ビッグデータETLの構築: ビッグデータツールの宇宙-いつどれを使うか?
- Hadoop vs. 他のNoSQLソリューション
- 対話的、ランダムアクセスのために
- Hadoop上のHbase(列指向型データベース)
- ランダムアクセスが可能だが制限がある(最大1PB)
- アドホック分析には不向き、ログ、カウント、時系列には適している
- Sqoop - データベースからHiveまたはHDFSへインポート(JDBC/ODBCアクセス)
- Flume – ストリームデータ(例:ログデータ)をHDFSに読み込む
Day-2: Session-2: ビッグデータ管理システム
- 可動部分、計算ノードの開始/失敗 :ZooKeeper - 設定/調整/ネーミングサービス用
- 複雑なパイプライン/ワークフロー: Oozie – ワークフロー、依存関係、デイズチェーンの管理
- デプロイ、設定、クラスタ管理、アップグレードなど(システム管理者) :Ambari
- クラウド内 : Whirr
Day-2: Session-3: ビジネスインテリジェンスにおける予測分析 -1: 基本的な技術と機械学習ベースのBI :
- 機械学習の紹介
- 分類技術の学習
- ベイズ予測-訓練ファイルの準備
- サポートベクトルマシン
- KNN p-Tree代数 & 縦方向マイニング
- ニューラルネットワーク
- ビッグデータ大規模変数問題 -Random forest (RF)
- ビッグデータ自動化問題 – Multi-model ensemble RF
- Soft10-Mを通じた自動化
- テキスト分析ツール-Treeminer
- アジャイル学習
- エージェントベース学習
- 分散学習
- 予測分析のオープンソースツールの紹介 : R, Rapidminer, Mahut
Day-2: Session-4 予測分析エコシステム-2: 政府における一般的な予測分析問題
- インサイト分析
- 可視化分析
- 構造化予測分析
- 非構造化予測分析
- 脅威/詐欺者/ベンダープロファイリング
- レコメンデーションエンジン
- パターン検出
- ルール/シナリオの発見 – 失敗、詐欺、最適化
- 根本原因の発見
- 感情分析
- CRM分析
- ネットワーク分析
- テキスト分析
- 技術支援レビュー
- 詐欺分析
- リアルタイム分析
Day-3 : Sesion-1 : Hadoop上のリアルタイムかつスケーラブルな分析
- 一般的な分析アルゴリズムがHadoop/HDFSで失敗する理由
- Apache Hama- 大規模同期分散計算向け
- Apache SPARK- リアルタイム分析のためのクラスタコンピューティング向け
- CMU Graphics Lab2- グラフベースの非同期分散コンピューティングアプローチ
- TreeminerによるKNN p-Algebraベースのアプローチ、運用のためのハードウェアコスト削減
Day-3: Session-2: eDiscoveryと法務のためのツール
- eDiscovery over Big Data vs. レガシーデータ – コストとパフォーマンスの比較
- 予測コーディングと技術支援レビュー(TAR)
- TARプロダクト(vMiner)のライブデモ、より速い発見のためにTARがどのように機能するかを理解する
- HDFSを通じたより速いインデクシング – データのベロシティ
- NLPまたは自然言語処理 – 様々な技術とオープンソースプロダクト
- 外国語におけるeDiscovery- 外国語処理技術
Day-3 : Session 3: サイバーセキュリティのためのビッグデータBI – 迅速なデータ収集から脅威の識別までの全体像の360度ビューを理解する
- セキュリティ分析の基礎の理解-攻撃面、セキュリティ設定ミス、ホスト防御
- リアルタイム分析のためのネットワークインフラ/ 大規模データパイプ/ 応答ETL
- 処方 vs 予測 – 固定ルールベース vs メタデータからの脅威ルールの自動発見
Day-3: Session 4: USDAにおけるビッグデータ : 農業への応用
- 農業のためのIoT(Internet of Things)の紹介-センサーベースのビッグデータと制御
- 衛星イメージングとその農業への応用の紹介
- 土壌の肥力、栽培の推奨と予測のためのセンサーと画像データの統合
- 農業保険とビッグデータ
- 作物損失の予測
Day-4 : Session-1: 政府のビッグデータからの不正防止BI-不正分析:
- 不正分析の基本的な分類- ルールベース vs 予測分析
- 不正パターン検出のための教師あり vs 教師なし機械学習
- ベンダーの詐欺/プロジェクトへの過大請求
- MedicareとMedicaidの詐欺- クレーム処理のための詐欺検出技術
- 出張費払い戻しの詐欺
- IRS(国税局)還付金の詐欺
- データが利用可能な場合は、事例研究とライブデモが行われます。
Day-4 : Session-2: ソーシャルメディア分析- インテリジェンスの収集と分析
- ソーシャルメディアデータを抽出するためのビッグデータETL API
- テキスト、画像、メタデータ、動画
- ソーシャルメディアフィードからの感情分析
- ソーシャルメディアフィードのコンテキストベースと非コンテキストベースのフィルタリング
- 多様なソーシャルメディアを統合するためのソーシャルメディアダッシュボード
- ソーシャルメディアプロフィールの自動プロファイリング
- 各分析のライブデモがTreeminerツールを通じて行われます。
Day-4 : Session-3: 画像処理と動画フィードにおけるビッグデータ分析
- ビッグデータにおける画像保存技術- ペタバイトを超えるデータのためのストレージソリューション
- LTFSとLTO
- GPFS-LTFS (ビッグ画像データのための階層型ストレージソリューション)
- 画像分析の基礎
- オブジェクト認識
- 画像セグメンテーション
- モーショントラッキング
- 3-D画像再構築
Day-4: Session-4: NIHにおけるビッグデータアプリケーション:
- バイオインフォマティクスの新興分野
- メタゲノミクスとビッグデータマイニングの問題
- 薬物基因组学、メタボロミクス、プロテオミクスのためのビッグデータ予測分析
- 下流ゲノミクスプロセスにおけるビッグデータ
- 公衆衛生におけるビッグデータ予測分析の応用
多様なデータへの迅速なアクセスと表示のためのビッグデータダッシュボード :
- 既存アプリケーションプラットフォームとビッグデータダッシュボードの統合
- ビッグデータ管理
- ビッグデータダッシュボードの事例研究: TableauとPentaho
- ビッグデータアプリケーションを使用して政府における位置情報サービスを推進する。
- トラッキングシステムと管理
Day-5 : Session-1: 組織内でビッグデータBIの実装を正当化する方法:
- ビッグデータ実装のROIの定義
- データの収集と準備のためのアナリスト時間の節約に関する事例研究 – 生産性向上
- ライセンス済みデータベースコストの節約による収益増加の事例研究
- 位置情報サービスからの収益増加
- 不正防止からの節約
- ビッグデータ実装による費用対比/収益増加/節約を計算するための統合スプレッドシートアプローチ。
Day-5 : Session-2: レガシーデータシステムをビッグデータシステムに置き換えるための手順:
- 実用的なビッグデータ移行ロードマップの理解
- ビッグデータ実装をアーキテクチャする前に必要な重要な情報
- データのボリューム、ベロシティ、バリエティ、ベリシティを計算する異なる方法
- データ成長の見積もり方
- 事例研究
Day-5: Session 4: ビッグデータベンダーとその製品のレビュー。Q/Aセッション:
- Accenture
- APTEAN (Formerly CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Formerly 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Part of EMC)
要求
- 特定の領域における政府のビジネス運営とデータシステムに関する基礎知識
- SQL/Oracleまたはリレーショナルデータベースの基本的な理解
- 統計学の基本的な理解(スプレッドシートレベル)
35 時間
お客様の声 (1)
トレーナーが組織の要件にコースを合わせる能力、単にコースを提供するだけでなく、その内容を組織のニーズに適合させるスキル。
Masilonyane - Revenue Services Lesotho
コース - Big Data Business Intelligence for Govt. Agencies
機械翻訳