聯繫我們

課程簡介

第一天

用於刑事情報分析的(big data)商業智能概覽

  • 來自執法的案例研究 - 預測性警务
  • 執法機構中(big data)的採用率,以及他們如何圍繞(big data)預測分析調整未來運營
  • 新興技術解決方案,如槍聲傳感器、監視視頻和社交媒體
  • 使用大數據技術緩解信息過載
  • 將大數據與傳統數據接口對接
  • 預測分析中 enabling technologies 的基本理解
  • 數據整合儀表板可視化
  • 防欺诈管理
  • 業務規則和欺詐檢測
  • 威脅檢測和檔案建立
  • (big data)實施的成本效益分析

大數據介紹

  • 大數據的主要特徵 - 容量、多樣性、速度和真實性。
  • MPP (Massively Parallel Processing) 架構
  • 數據倉庫 – 靜態模式,緩慢演變的數據集
  • MPP資料庫:Greenplum, Exadata, Teradata, Netezza, Vertica等
  • 基於Hadoop的解決方案 - 對數據集結構無限制。
  • 典型模式:HDFS, MapReduce (crunch), 從HDFS檢索
  • 用於流處理的Apache Spark
  • 批處理 – 適合分析/非交互式
  • 容量:CEP流數據
  • 典型選擇 – CEP產品(例如Infostreams, Apama, MarkLogic等)
  • 生產準備度較低 – Storm/S4
  • NoSQL資料庫 - (列式和鍵值型):最適合作為數據倉庫/資料庫的分析輔助工具

NoSQL解決方案

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (層級式) - GT.m, Cache
  • KV Store (有序型) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • 物件資料庫 - ZopeDB, DB40, Shoal
  • 文件儲存庫 - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • 寬列儲存庫 - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

數據多樣性:大數據中數據清理問題的介紹

  • RDBMS – 靜態結構/模式,不促進敏捷、探索性環境。
  • NoSQL – 半結構化,足以在存儲數據前無需精確模式即可存儲數據
  • 數據清理問題

Hadoop

  • 何時選擇Hadoop?
  • 結構化數據 - 企業數據倉庫/資料庫可以存儲海量數據(但有成本),但強加結構(不利於主動探索)
  • 半結構化數據 – 使用傳統解決方案(DW/DB)難以處理
  • 倉儲數據 = 巨大的努力,且在實施後也是靜態的
  • 對於數據的多樣性和容量,在商用硬件上進行 crunch – HADOOP
  • 需要商用硬件來創建Hadoop集群

Map Reduce /HDFS介紹

  • MapReduce – 在多服務器上分發計算
  • HDFS – 為計算過程在本地提供數據(具有冗餘)
  • 數據 – 可以是非結構化/無模式的(與RDBMS不同)
  • 開發者需負責讓數據有意義
  • 編寫MapReduce = 使用Java工作(優缺點),手動將數據加載到HDFS中

第二天

大數據生態系統 -- 構建大數據ETL(抽取、轉換、裝載)-- 何時使用哪些大數據工具?

  • Hadoop vs. 其他NoSQL解決方案
  • 用於交互式的、隨機訪問數據
  • Hbase(列向資料庫)位於Hadoop之上
  • 隨機訪問數據,但有限制(最大1 PB)
  • 不利於即席分析,有利於日誌記錄、計數、時間序列
  • Sqoop - 從資料庫導入到Hive或HDFS(JDBC/ODBC訪問)
  • Flume – 將流數據(例如日誌數據)流式傳輸到HDFS

大數據管理系統

  • 移動組件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
  • 複雜管道/工作流:Oozie – 管理工作流、依賴關係、鏈式操作
  • 部署、配置、集群管理、升級等(系統管理員):Ambari
  • 在雲中:Whirr

預測分析 -- 基本技術和基於機器學習的商業智能

  • 機器學習介紹
  • 學習分類技術
  • 貝葉斯預測 – 準備訓練文件
  • 支持向量機
  • KNN p-Tree代數及垂直挖掘
  • 神經網絡
  • 大數據大變量問題 – 隨機森林(RF)
  • 大數據自動化問題 – 多模型集成RF
  • 通過Soft10-M實現自動化
  • 文本分析工具-Treeminer
  • 敏捷學習
  • 基於代理的學習
  • 分布式學習
  • 預測分析的開源工具介紹:R, Python, Rapidminer, Mahut

預測分析生態系統及其在刑事情報分析中的應用

  • 技術與調查過程
  • 洞察分析
  • 可視化分析
  • 結構化預測分析
  • 非結構化預測分析
  • 威脅/欺詐者/供應商檔案建立
  • 推薦引擎
  • 模式檢測
  • 規則/場景發現 – 故障、欺詐、優化
  • 根本原因發現
  • 情感分析
  • CRM分析
  • 網絡分析
  • 用於從翻譯稿、證人陳述、互聯網 chatter 等獲取洞察的文本分析
  • 技術輔助審查
  • 防欺诈分析
  • 實時分析

第三天

Hadoop上的實時和可擴展分析

  • 為什麼常見的分析算法在Hadoop/HDFS中失敗
  • Apache Hama - 用於批量同步分布式計算
  • Apache SPARK - 用於集群計算和實時分析
  • CMU Graphics Lab2 - 基於圖的分布式計算非同步方法
  • KNN p – 來自Treeminer的基於代數的方法,以降低操作硬件成本

eDiscovery和法證工具

  • eDiscovery在大數據與傳統數據 vs. 成本和性能的比較
  • 預測編碼和技術輔助審查(TAR)
  • vMiner實時演示,了解TAR如何實現更快的發現
  • 通過HDFS加速索引 – 數據的速度
  • NLP(自然語言處理)– 開源產品和技術
  • 外語中的eDiscovery -- 外語處理的技術

用於網絡安全的大數據BI – 獲得360度視角,快速數據收集和威脅識別

  • 理解安全分析的基本概念 – 攻擊面、安全配置錯誤、主機防禦
  • 網絡基礎設施 / 大型數據管道 / 實時分析的響應ETL
  • 規定性與預測性 – 固定規則基礎 vs. 從元數據自動發現威脅規則

收集雜亂的數據用於刑事情報分析

  • 使用物聯網(IoT)作為傳感器來捕獲數據
  • 使用衛星圖像進行國內監視
  • 使用監視和圖像數據進行犯罪嫌疑人識別
  • 其他數據收集技術 – 無人機、身體相機、GPS標籤系統和熱成像技術
  • 將自動數據檢索與從情報人員、審訊和研究獲得的數據相結合
  • 預測犯罪活動

第四天

防欺诈分析中的大數據BI防欺诈

  • 防欺诈分析的基礎分類 – 基於規則 vs. 預測性分析
  • 監督式與非監督式機器學習用於欺詐模式檢測
  • 企業間欺詐、醫療索賠欺詐、保險欺詐、逃稅和洗錢

社交媒體分析 – 情報收集和解析

  • 犯罪分子如何使用社交媒體組織、招募和計劃
  • 用於提取社交媒體數據的大數據ETL API
  • 文本、圖像、元數據和視頻
  • 來自社交媒體饋送的情感分析
  • 社交媒體饋送的上下文和非上下文過濾
  • 用於整合多樣化社交媒體的社交媒體儀表板
  • 社交媒體檔案的自動建立
  • 將通過Treeminer工具提供每個分析的實時演示

圖像處理和視頻饋送中的大數據分析

  • 大數據中的圖像存儲技術 – 超過PB級數據的存儲解決方案
  • LTFS(線性磁帶文件系統)和LTO(線性磁帶開放標準)
  • GPFS-LTFS(通用並行文件系統 - 線性磁帶文件系統)– 大圖像數據的分層存儲解決方案
  • 圖像分析的基本原理
  • 對象識別
  • 圖像分割
  • 運動跟蹤
  • 3-D圖像重建

生物特徵、DNA和下一代識別程序

  • 超越指紋和面部識別
  • 語音識別、擊鍵(分析用戶打字模式)和CODIS(綜合DNA索引系統)
  • 超越DNA匹配:使用法醫DNA表型鑑定從DNA樣本構建面孔

用於快速獲取多樣數據和顯示的大數據儀表板:

  • 現有應用平台與大數據儀表板的整合
  • 大數據管理
  • 大數據儀表板案例研究:Tableau和Pentaho
  • 使用大數據應用在政府中推送基於位置的服务
  • 追蹤系統和管理

第五天

如何在組織內合理化大數據BI實施:

  • 定義實施大數據的ROI(投資回報率)
  • 節省分析師在數據收集和準備時間的案例研究 – 提高生產力
  • 通過降低資料庫授權成本獲得的收入增益
  • 通過基於位置的服务獲得的收入增益
  • 防欺诈節省的成本
  • 用於計算大數據實施的近似費用與收入增益/節省的整合式電子表單方法。

用大數據系統替換傳統數據系統的逐步程序

  • 大數據遷移路線圖
  • 在構建大數據系統前需要哪些關鍵信息?
  • 計算數據的容量、速度、多樣性和真實性的不同方法有哪些
  • 如何估計數據增長
  • 案例研究

審查大數據供應商及其產品。

  • Accenture
  • APTEAN(前CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB(前10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware(EMC的一部分)

問答環節

最低要求

  • 了解執法流程和數據系統
  • 基本掌握SQL/Oracle或關係型資料庫
  • 基本掌握統計知識(電子表單級別)

受眾

  • 具有技術背景的執法專家
 35 小時

人數


每位參與者的報價

客戶評論 (3)

即將到來的課程

課程分類