聯繫我們

課程簡介

每場會議為2小時

第1天: 第1場會議: 為什麼政府需要大資料商業智慧的業務概覽

  • 來自 NIH (國立衛生研究院)、DoE (能源部) 的案例研究
  • 政府機關的大資料適應率及其如何圍繞大資料預測分析調整未來運營
  • 在 DoD (國防部)、NSA (國家安全局)、IRS (國稅局)、USDA (農業部) 等機構的大規模應用領域
  • 大資料與傳統數據的接口整合
  • 預測分析使能技術的基礎理解
  • 數據整合與儀表板視覺化
  • 欺詐管理
  • 業務規則/欺詐檢測生成
  • 威脅檢測與畫像
  • 大資料實施的成本效益分析

第1天: 第2場會議: 大資料介紹-1

  • 大資料的主要特徵:體積、多樣性、速度和真实性。用於體積的 MPP (並行處理) 架構。
  • 數據倉庫 – 靜態模式,緩慢演變的數據集
  • MPP 數據庫,如 Greenplum, Exadata, Teradata, Netezza, Vertica 等。
  • 基於 Hadoop 的解決方案 – 對數據集結構沒有限制。
  • 典型模式:HDFS, MapReduce (crunch), 從 HDFS 檢索
  • 批量處理 - 適合分析/非交互作用
  • 體積:CEP (複合事件處理) 流式數據
  • 典型選擇 – CEP 產品 (例如 Infostreams, Apama, MarkLogic 等)
  • 生產就緒度較低 – Storm/S4
  • NoSQL 數據庫 – (欄位式和鍵值):最適合作為數據倉庫/數據庫的分析輔助

第1天: 第3場會議: 大資料介紹-2

NoSQL 解決方案

  • KV 儲存 - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV 儲存 - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV 儲存 (層次結構) - GT.m, Cache
  • KV 儲存 (有序) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV 緩存 - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • 元組儲存 - Gigaspaces, Coord, Apache River
  • 對象數據庫 - ZopeDB, DB40, Shoal
  • 文檔儲存 - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-數據庫, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • 寬列儲存 - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

數據的多樣性:大資料數據清洗問題介紹

  • RDBMS – 靜態結構/模式,不利於靈活、探索性的環境。
  • NoSQL – 半結構化,足夠的結構可在儲存數據前無需精確模式
  • 數據清洗問題

第1天: 第4場會議: 大資料介紹-3: Hadoop

  • 何時選擇 Hadoop?
  • 結構化 - 企業數據倉庫/數據庫可以儲存海量數據(代價較高),但強加了結構(不利於主動探索)
  • 半結構化數據 – 使用傳統解決方案 (DW/DB) 很難處理
  • 數據倉儲 = 巨大的努力,且實施後仍為靜態
  • 對於數據的多樣性和體積,在通用硬件上處理 – HADOOP
  • 需要通用 H/W (硬件) 來建立 Hadoop 集群

Map Reduce /HDFS 介紹

  • MapReduce – 在多臺伺服器上分佈式計算
  • HDFS – 為計算過程提供本地數據存取 (帶有冗餘)
  • 數據 – 可以是非結構化/無模式 (與 RDBMS 不同)
  • 開發者負責理解數據
  • 編程 MapReduce = 使用 Java (利弊),手動將數據加載到 HDFS

第2天: 第1場會議: 大資料生態系統-建立大資料 ETL: 大資料工具領域-何時使用哪一個?

  • Hadoop 與其他 NoSQL 解決方案的比較
  • 用於交互式、隨機數據存取
  • Hbase (欄位取向數據庫) 在 Hadoop 之上
  • 隨機數據存取但有限制 (最大 1 PB)
  • 不適合即席分析,適合記錄、計數、時間序列
  • Sqoop - 從數據庫導入 Hive 或 HDFS (JDBC/ODBC 存取)
  • Flume – 將流式數據 (例如日誌數據) 導入 HDFS

第2天: 第2場會議: 大資料管理系統

  • 移動部件,計算節點啟動/失敗 :ZooKeeper - 用於配置/協調/命名服務
  • 複雜的流水線/工作流程: Oozie – 管理工作流程、依賴關係、鏈式處理
  • 部署、配置、集群管理、升級等 (系統管理): Ambari
  • 在雲端 : Whirr

第2天: 第3場會議: 商業智慧中的預測分析 -1: 基本技術 & 基於機器學習的 BI :

  • 機器學習介紹
  • 學習分類技術
  • 貝葉斯預測-準備訓練文件
  • 支持向量機
  • KNN p-Tree Algebra & 垂直挖掘
  • 神經網絡
  • 大資料大變量問題 -隨機森林 (RF)
  • 大資料自動化問題 – 多模型集成 RF
  • 透過 Soft10-M 實現自動化
  • 文本分析工具-Treeminer
  • 敏捷學習
  • 基於代理的學習
  • 分佈式學習
  • 預測分析開源工具介紹 : R, Rapidminer, Mahut

第2天: 第4場會議: 預測分析生態系統-2: 政府中的常見預測分析問題

  • 洞察分析
  • 視覺化分析
  • 結構化預測分析
  • 非結構化預測分析
  • 威脅/欺詐者/供應商畫像
  • 推薦引擎
  • 模式檢測
  • 規則/場景發現 –失敗、欺詐、優化
  • 根本原因發現
  • 情感分析
  • CRM 分析
  • 網路分析
  • 文本分析
  • 技術輔助審查
  • 欺詐分析
  • 即時分析

第3天: 第1場會議: 基於 Hadoop 的即時和可擴展分析

  • 為什麼常見的分析算法在 Hadoop/HDFS 中失敗
  • Apache Hama- 用於批量同步分佈式計算
  • Apache SPARK- 用於即時分析的集群計算
  • CMU 圖形實驗室2- 基於圖的分佈式計算異步方法
  • 來自 Treeminer 的基於 KNN p-Algebra 的方法,以降低運營硬件成本

第3天: 第2場會議: eDiscovery 和鑑識工具

  • eDiscovery 基於大資料與傳統數據 – 成本和性能比較
  • 預測編碼和技術輔助審查 (TAR)
  • TAR 產品 (vMiner) 的現場演示,以了解 TAR 如何加速發現
  • 通過 HDFS 進行更快的索引 –數據的速度
  • NLP 或自然語言處理 –各種技術和開源產品
  • 外語中的 eDiscovery-外語處理技術

第3天: 第3場會議: 用於網路安全的大資料 BI – 理解從快速數據收集到威脅識別的完整 360 度視角

  • 理解安全分析基礎-攻擊面、安全配置錯誤、主機防護
  • 網路基礎設施/ 大型數據管道 / 即時分析的響應 ETL
  • 處方性 vs 預測性 – 固定規則基於 vs 從元數據自動發現威脅規則

第3天: 第4場會議: USDA 中的大資料:在農業中的應用

  • 用於農業的 IoT (物聯網) 介紹-基於感測器的大資料和控制
  • 衛星成像及其在農業中的應用介紹
  • 整合感測器和圖像數據以進行土壤肥力、種植推薦和預測
  • 農業保險和大資料
  • 作物損失預測

第4天: 第1場會議: 政府大資料中的欺詐預防 BI-欺詐分析:

  • 欺詐分析的基本分類-基於規則 vs 預測分析
  • 用於欺詐模式檢測的監督 vs 非監督機器學習
  • 供應商欺詐/項目過高收費
  • Medicare 和 Medicaid 欺詐-用於申請處理的欺詐檢測技術
  • 差旅報銷欺詐
  • IRS 退款欺詐
  • 如果數據可用,將提供案例研究和現場演示。

第4天: 第2場會議: 社交媒體分析-情報收集和

  • 用於提取社交媒體數據的大資料 ETL API
  • 文本、圖像、元數據和視頻
  • 來自社交媒體源的情感分析
  • 社交媒體源的上下文和非上下文過濾
  • 整合多種社交媒體的社交媒體儀表板
  • 社交媒體檔案的自動化畫像
  • 將通過 Treeminer 工具提供每個分析的現場演示。

第4天: 第3場會議: 大資料分析在圖像處理和視頻源中的應用

  • 大資料中的圖像儲存技術-超過 PB 數據的存儲解決方案
  • LTFS 和 LTO
  • GPFS-LTFS (用於大圖像數據的分層存儲解決方案)
  • 圖像分析基礎
  • 對象識別
  • 圖像分割
  • 運動追蹤
  • 3D 圖像重建

第4天: 第4場會議: NIH 中的大資料應用:

  • 生物信息學新興領域
  • 元基因组和大資料挖掘問題
  • 藥物基因组學、代謝組學和蛋白質組學的大資料預測分析
  • 下游基因组學過程中的大資料
  • 大資料預測分析在公共健康中的應用

用於快速存取和顯示多樣化數據的大資料儀表板 :

  • 將現有應用平台與大資料儀表板整合
  • 大資料管理
  • 大資料儀表板案例研究: Tableau 和 Pentaho
  • 使用大資料應用在政府中推進基於位置服務
  • 追蹤系統和管理

第5天: 第1場會議: 如何在組織內證明大資料 BI 實施的合理性:

  • 定義大資料實施的投資報酬率 (ROI)
  • 節省數據收集和準備時間的案例研究 –生產力提升
  • 透過節省授權數據庫成本獲得收益的案例研究
  • 從基於位置服務中獲得的收益
  • 來自欺詐預防的節省
  • 一種綜合電子表格方法,用於計算大資料實施的近似支出 vs. 收益/節省。

第5天: 第2場會議: 將傳統數據系統替換為大資料系統的逐步程序:

  • 理解實際的大資料遷移路線圖
  • 在架構設計大資料實施前需要的重要資訊
  • 計算數據體積、速度、多樣性和真實性的不同方法
  • 如何估算數據增長
  • 案例研究

第5天: 第4場會議: 大資料供應商及其產品回顧。問答環節:

  • Accenture
  • APTEAN (前稱 CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (前稱 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (EMC 的一部分)

最低要求

  • 對政府領域內業務運營和數據系統的基礎知識
  • 對 SQL/Oracle 或關係型數據庫的基礎理解
  • 對統計學(電子表格層級)的基礎理解
 35 小時

人數


每位參與者的報價

客戶評論 (1)

即將到來的課程

課程分類