聯繫我們

課程簡介

每次課程為2小時

第一天:課程1:政府大數據商業智慧之業務概覽

  • 來自國立衛生研究院(NIH)、能源部(DoE)的案例研究
  • 政府機構的大數據採用率及如何圍繞大數據預測分析調整未來營運
  • 國防部、國家安全局(NSA)、國稅局(IRS)、農業部(USDA)等廣泛應用領域
  • 大數據與舊有資料的介面
  • 預測分析中使能技術的基本理解
  • 資料整合與儀表板視覺化
  • 詐欺管理
  • 商業規則/詐欺偵測生成
  • 威脅偵測與繪製概要
  • 大數據實施的成本效益分析

第一天:課程2:大數據介紹-1

  • 大數據的主要特徵:體積(volume)、多樣性(variety)、速度(velocity)和可靠性(veracity)。針對體積的 MPP 架構。
  • 資料倉儲——靜態模式,緩慢演進的資料集
  • MPP 資料庫如 Greenplum、Exadata、Teradata、Netezza、Vertica 等。
  • 基於 Hadoop 的解決方案——對資料集的結構無限制。
  • 典型模式:HDFS,MapReduce(crunch),從 HDFS 檢索
  • 批處理——適合分析/非互動式
  • 體積:CEP 串流數據
  • 典型選擇——CEP 產品(例如 Infostreams、Apama、MarkLogic 等)
  • 較少生產就緒——Storm/S4
  • NoSQL 資料庫——(列式與鍵值對):最適合作為資料倉儲/資料庫的分析輔助

第一天:課程3:大數據介紹-2

NoSQL 解決方案

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierarchical) - GT.m, Cache
  • KV Store (Ordered) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Object Database - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

資料多樣性:大數據中資料清洗問題的介紹

  • RDBMS——靜態結構/模式,不促進敏捷、探索性環境。
  • NoSQL——半結構化,具有足夠的結構以便在儲存前不需確切模式即可儲存資料
  • 資料清洗問題

第一天:課程4:大數據介紹-3:Hadoop

  • 何時選擇 Hadoop?
  • 結構化——企業資料倉儲/資料庫可以儲存海量資料(有成本),但強加結構(不利於活躍探索)
  • 半結構化數據——傳統解決方案(DW/DB)難以處理
  • 資料倉儲=巨大的努力,即使在實施後也是靜態的
  • 針對資料的多樣性與體積,在商用硬體上 crunch 處理——HADOOP
  • 需要商用硬體來建立 Hadoop 叢集

Map Reduce / HDFS 介紹

  • MapReduce——將計算分發到多個伺服器
  • HDFS——為計算過程在本地提供資料(帶有冗餘)
  • 資料——可以是非結構化/無模式的(與 RDBMS 不同)
  • 開發者有責任使資料有意義
  • 編程 MapReduce = 使用 Java(優缺點),手動將資料載入 HDFS

第二天:課程1:大數據生態系——建立大數據 ETL:大數據工具宇宙,該用哪一個以及何時用?

  • Hadoop 與其他 NoSQL 解決方案比較
  • 針對互動式、隨機存取資料
  • 位於 Hadoop 之上的 Hbase(列式資料庫)
  • 隨機存取資料但有限制(最大1 PB)
  • 不適合即席分析,適合日誌、計數、時間序列
  • Sqoop - 從資料庫匯入到 Hive 或 HDFS(JDBC/ODBC 存取)
  • Flume——將串流數據(例如日誌數據)導入 HDFS

第二天:課程2:大數據管理系統

  • 移動部件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
  • 複雜管線/工作流程:Oozie——管理工作流程、依賴關係、連鎖反應
  • 部署、配置、叢集管理、升級等(系統管理員):Ambari
  • 在雲端:Whirr

第二天:課程3:商業智慧中的預測分析-1:基本技術與基於機器學習的 BI:

  • 機器學習介紹
  • 學習分類技術
  • 貝葉斯預測——準備訓練文件
  • 支援向量機(Support Vector Machine)
  • KNN p-Tree 代數及垂直挖掘
  • 神經網絡
  • 大數據大量變量問題 - 隨機森林(RF)
  • 大數據自動化問題——多模型集成 RF
  • 通過 Soft10-M 實現自動化
  • 文本分析工具-Treeminer
  • 敏捷學習
  • 基於代理的學習
  • 分佈式學習
  • 預測分析開源工具介紹:R, Rapidminer, Mahut

第二天:課程4 預測分析生態系-2:政府中常見的預測分析问题

  • 見解分析(Insight analytic)
  • 視覺化分析
  • 結構化預測分析
  • 非結構化預測分析
  • 威脅/詐欺師/供應商概要繪製
  • 推薦引擎
  • 模式檢測
  • 規則/場景發現——失敗、詐欺、優化
  • 根本原因發現
  • 情感分析
  • CRM 分析
  • 網絡分析
  • 文本分析
  • 技術輔助審查
  • 詐欺分析
  • 實時分析

第三天:課程1:基於 Hadoop 的實時與可擴展分析

  • 為何常見的分析算法在 Hadoop/HDFS 中失效
  • Apache Hama - 用於批量同步分佈式計算
  • Apache SPARK - 用於實時分析的叢集計算
  • CMU Graphics Lab2 - 基於圖的非同步分佈式計算方法
  • Treeminer 基於 KNN p-Algebra 的方法以降低操作硬體成本

第三天:課程2:eDiscovery 和法醫科學工具

  • 大數據 vs. 舊有資料上的 eDiscovery——成本和性能的比較
  • 預測編碼和技術輔助審查(TAR)
  • Tar 產品(vMiner)的現場演示以了解 TAR 如何實現快速發現
  • 通過 HDFS 加速索引——數據速度
  • NLP 或自然語言處理——各種技術和開源產品
  • 外語 eDiscovery - 外語處理技術

第三天:課程3:政府的大數據商業智慧用於網路安全——理解從快速數據收集到威脅識別的全方位360度視角

  • 理解安全分析的基本原理——攻擊面、安全配置錯誤、主機防禦
  • 網絡基礎設施/大型數據管線/實時分析的響應 ETL
  • 處方性 vs 預測性——固定規則基於 vs. 從元數據自動發現威脅規則

第三天:課程4:USDA 中的大數據:農業應用

  • 用於農業的物聯網(Internet of Things)介紹——基於感測器的大數據和控制
  • 衛星影像及其在農業中應用的介紹
  • 整合感測器和圖像數據以評估土壤肥力、耕作建議和預測
  • 農業保險和大數據
  • 作物損失預測

第四天:課程1:政府中來自大數據的詐欺預防商業智慧——詐欺分析:

  • 詐欺分析的基本分類——基於規則 vs. 預測分析
  • 用於詐欺模式檢測的監督式與非監督式機器學習
  • 供應商詐欺/項目過度收費
  • 醫療補助(Medicare)和醫療 Aid(Medicaid)詐欺——保單處理的詐欺偵測技術
  • 差旅報銷詐欺
  • 國稅局(IRS)退款詐欺
  • 如有資料可用,將提供案例研究和現場演示。

第四天:課程2:社交媒體分析——情報收集與分析

  • 用於提取社交媒體數據的大數據 ETL API
  • 文本、圖像、元數據和視頻
  • 來自社交媒體提要的情感分析
  • 社交媒體提要的上下文和非上下文過濾
  • 社交媒體儀表板以整合多樣的社交媒體
  • 社交媒體檔案的自動概要繪製
  • 通過 Treeminer 工具將對每個分析的現場演示提供給您。

第四天:課程3:圖像處理和視頻饋送中的大數據分析

  • 大數據中的圖像存儲技術——超過 PB 級別的數據存儲解決方案
  • LTFS 和 LTO
  • GPFS-LTFS(針對大圖像數據的分層存儲解決方案)
  • 圖像分析的基礎
  • 物體識別
  • 圖像分割
  • 運動追蹤
  • 3-D 圖像重建

第四天:課程4:NIH 中的大數據應用:

  • 生物資訊學的新興領域
  • 宏基因組學和大數據挖掘問題
  • 用於藥物基因組學、代謝組學和蛋白質組學的大數據預測分析
  • 下游基因組流程中的大數據
  • 公共衛生中大數據預測分析的應用

大數據儀表板以快速存取多樣的資料並顯示:

  • 現有應用程式平台與大數據儀表板的整合
  • 大數據管理
  • 大數據儀表板案例研究:Tableau 和 Pentaho
  • 使用大數據應用程式在政府中推動基於位置的服务
  • 追蹤系統和管理

第五天:課程1:如何在組織內證明大數據商業智慧實施的合理性:

  • 定義大數據實施的投资回报率(ROI)
  • 節省分析人員收集及準備資料時間的案例研究——生產力增益的增加
  • 通過節省授權資料庫成本實現收入增益的案例研究
  • 通過基於位置的服务实现的收入增益
  • 通过防止欺诈获得的节省
  • 一种整合的电子表格方法,用于计算大数据实施的近似支出与收入增益/节省。

第五天:課程2:將舊有資料系統取代為大數據系統的逐步程序:

  • 了解實用大數據遷移路線圖
  • 在架構大數據實施之前需要哪些重要資訊
  • 計算資料的體積、速度、多樣性和可靠性的不同方法有哪些
  • 如何估算資料增長
  • 案例研究

第五天:課程4:大數據供應商回顧及其產品審查。問答環節:

  • Accenture
  • APTEAN(前身為 CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB(前身為 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware(EMC 的一部分)

最低要求

  • 對其領域內政府部門商業運作及資料系統的基本知識
  • 對 SQL/Oracle 或關聯式資料庫的基本了解
  • 對統計學(電子表格層級)的基本理解
 35 小時

人數


每位參與者的報價

客戶評論 (1)

即將到來的課程

課程分類