感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
每次課程為2小時
第一天:課程1:政府大數據商業智慧之業務概覽
- 來自國立衛生研究院(NIH)、能源部(DoE)的案例研究
- 政府機構的大數據採用率及如何圍繞大數據預測分析調整未來營運
- 國防部、國家安全局(NSA)、國稅局(IRS)、農業部(USDA)等廣泛應用領域
- 大數據與舊有資料的介面
- 預測分析中使能技術的基本理解
- 資料整合與儀表板視覺化
- 詐欺管理
- 商業規則/詐欺偵測生成
- 威脅偵測與繪製概要
- 大數據實施的成本效益分析
第一天:課程2:大數據介紹-1
- 大數據的主要特徵:體積(volume)、多樣性(variety)、速度(velocity)和可靠性(veracity)。針對體積的 MPP 架構。
- 資料倉儲——靜態模式,緩慢演進的資料集
- MPP 資料庫如 Greenplum、Exadata、Teradata、Netezza、Vertica 等。
- 基於 Hadoop 的解決方案——對資料集的結構無限制。
- 典型模式:HDFS,MapReduce(crunch),從 HDFS 檢索
- 批處理——適合分析/非互動式
- 體積:CEP 串流數據
- 典型選擇——CEP 產品(例如 Infostreams、Apama、MarkLogic 等)
- 較少生產就緒——Storm/S4
- NoSQL 資料庫——(列式與鍵值對):最適合作為資料倉儲/資料庫的分析輔助
第一天:課程3:大數據介紹-2
NoSQL 解決方案
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hierarchical) - GT.m, Cache
- KV Store (Ordered) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Object Database - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
資料多樣性:大數據中資料清洗問題的介紹
- RDBMS——靜態結構/模式,不促進敏捷、探索性環境。
- NoSQL——半結構化,具有足夠的結構以便在儲存前不需確切模式即可儲存資料
- 資料清洗問題
第一天:課程4:大數據介紹-3:Hadoop
- 何時選擇 Hadoop?
- 結構化——企業資料倉儲/資料庫可以儲存海量資料(有成本),但強加結構(不利於活躍探索)
- 半結構化數據——傳統解決方案(DW/DB)難以處理
- 資料倉儲=巨大的努力,即使在實施後也是靜態的
- 針對資料的多樣性與體積,在商用硬體上 crunch 處理——HADOOP
- 需要商用硬體來建立 Hadoop 叢集
Map Reduce / HDFS 介紹
- MapReduce——將計算分發到多個伺服器
- HDFS——為計算過程在本地提供資料(帶有冗餘)
- 資料——可以是非結構化/無模式的(與 RDBMS 不同)
- 開發者有責任使資料有意義
- 編程 MapReduce = 使用 Java(優缺點),手動將資料載入 HDFS
第二天:課程1:大數據生態系——建立大數據 ETL:大數據工具宇宙,該用哪一個以及何時用?
- Hadoop 與其他 NoSQL 解決方案比較
- 針對互動式、隨機存取資料
- 位於 Hadoop 之上的 Hbase(列式資料庫)
- 隨機存取資料但有限制(最大1 PB)
- 不適合即席分析,適合日誌、計數、時間序列
- Sqoop - 從資料庫匯入到 Hive 或 HDFS(JDBC/ODBC 存取)
- Flume——將串流數據(例如日誌數據)導入 HDFS
第二天:課程2:大數據管理系統
- 移動部件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
- 複雜管線/工作流程:Oozie——管理工作流程、依賴關係、連鎖反應
- 部署、配置、叢集管理、升級等(系統管理員):Ambari
- 在雲端:Whirr
第二天:課程3:商業智慧中的預測分析-1:基本技術與基於機器學習的 BI:
- 機器學習介紹
- 學習分類技術
- 貝葉斯預測——準備訓練文件
- 支援向量機(Support Vector Machine)
- KNN p-Tree 代數及垂直挖掘
- 神經網絡
- 大數據大量變量問題 - 隨機森林(RF)
- 大數據自動化問題——多模型集成 RF
- 通過 Soft10-M 實現自動化
- 文本分析工具-Treeminer
- 敏捷學習
- 基於代理的學習
- 分佈式學習
- 預測分析開源工具介紹:R, Rapidminer, Mahut
第二天:課程4 預測分析生態系-2:政府中常見的預測分析问题
- 見解分析(Insight analytic)
- 視覺化分析
- 結構化預測分析
- 非結構化預測分析
- 威脅/詐欺師/供應商概要繪製
- 推薦引擎
- 模式檢測
- 規則/場景發現——失敗、詐欺、優化
- 根本原因發現
- 情感分析
- CRM 分析
- 網絡分析
- 文本分析
- 技術輔助審查
- 詐欺分析
- 實時分析
第三天:課程1:基於 Hadoop 的實時與可擴展分析
- 為何常見的分析算法在 Hadoop/HDFS 中失效
- Apache Hama - 用於批量同步分佈式計算
- Apache SPARK - 用於實時分析的叢集計算
- CMU Graphics Lab2 - 基於圖的非同步分佈式計算方法
- Treeminer 基於 KNN p-Algebra 的方法以降低操作硬體成本
第三天:課程2:eDiscovery 和法醫科學工具
- 大數據 vs. 舊有資料上的 eDiscovery——成本和性能的比較
- 預測編碼和技術輔助審查(TAR)
- Tar 產品(vMiner)的現場演示以了解 TAR 如何實現快速發現
- 通過 HDFS 加速索引——數據速度
- NLP 或自然語言處理——各種技術和開源產品
- 外語 eDiscovery - 外語處理技術
第三天:課程3:政府的大數據商業智慧用於網路安全——理解從快速數據收集到威脅識別的全方位360度視角
- 理解安全分析的基本原理——攻擊面、安全配置錯誤、主機防禦
- 網絡基礎設施/大型數據管線/實時分析的響應 ETL
- 處方性 vs 預測性——固定規則基於 vs. 從元數據自動發現威脅規則
第三天:課程4:USDA 中的大數據:農業應用
- 用於農業的物聯網(Internet of Things)介紹——基於感測器的大數據和控制
- 衛星影像及其在農業中應用的介紹
- 整合感測器和圖像數據以評估土壤肥力、耕作建議和預測
- 農業保險和大數據
- 作物損失預測
第四天:課程1:政府中來自大數據的詐欺預防商業智慧——詐欺分析:
- 詐欺分析的基本分類——基於規則 vs. 預測分析
- 用於詐欺模式檢測的監督式與非監督式機器學習
- 供應商詐欺/項目過度收費
- 醫療補助(Medicare)和醫療 Aid(Medicaid)詐欺——保單處理的詐欺偵測技術
- 差旅報銷詐欺
- 國稅局(IRS)退款詐欺
- 如有資料可用,將提供案例研究和現場演示。
第四天:課程2:社交媒體分析——情報收集與分析
- 用於提取社交媒體數據的大數據 ETL API
- 文本、圖像、元數據和視頻
- 來自社交媒體提要的情感分析
- 社交媒體提要的上下文和非上下文過濾
- 社交媒體儀表板以整合多樣的社交媒體
- 社交媒體檔案的自動概要繪製
- 通過 Treeminer 工具將對每個分析的現場演示提供給您。
第四天:課程3:圖像處理和視頻饋送中的大數據分析
- 大數據中的圖像存儲技術——超過 PB 級別的數據存儲解決方案
- LTFS 和 LTO
- GPFS-LTFS(針對大圖像數據的分層存儲解決方案)
- 圖像分析的基礎
- 物體識別
- 圖像分割
- 運動追蹤
- 3-D 圖像重建
第四天:課程4:NIH 中的大數據應用:
- 生物資訊學的新興領域
- 宏基因組學和大數據挖掘問題
- 用於藥物基因組學、代謝組學和蛋白質組學的大數據預測分析
- 下游基因組流程中的大數據
- 公共衛生中大數據預測分析的應用
大數據儀表板以快速存取多樣的資料並顯示:
- 現有應用程式平台與大數據儀表板的整合
- 大數據管理
- 大數據儀表板案例研究:Tableau 和 Pentaho
- 使用大數據應用程式在政府中推動基於位置的服务
- 追蹤系統和管理
第五天:課程1:如何在組織內證明大數據商業智慧實施的合理性:
- 定義大數據實施的投资回报率(ROI)
- 節省分析人員收集及準備資料時間的案例研究——生產力增益的增加
- 通過節省授權資料庫成本實現收入增益的案例研究
- 通過基於位置的服务实现的收入增益
- 通过防止欺诈获得的节省
- 一种整合的电子表格方法,用于计算大数据实施的近似支出与收入增益/节省。
第五天:課程2:將舊有資料系統取代為大數據系統的逐步程序:
- 了解實用大數據遷移路線圖
- 在架構大數據實施之前需要哪些重要資訊
- 計算資料的體積、速度、多樣性和可靠性的不同方法有哪些
- 如何估算資料增長
- 案例研究
第五天:課程4:大數據供應商回顧及其產品審查。問答環節:
- Accenture
- APTEAN(前身為 CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB(前身為 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware(EMC 的一部分)
最低要求
- 對其領域內政府部門商業運作及資料系統的基本知識
- 對 SQL/Oracle 或關聯式資料庫的基本了解
- 對統計學(電子表格層級)的基本理解
35 小時
客戶評論 (1)
培訓師能夠根據組織的需求調整課程內容,而不僅僅是爲了完成課程而提供培訓。
Masilonyane - Revenue Services Lesotho
課程 - Big Data Business Intelligence for Govt. Agencies
機器翻譯