感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
第一天
用於刑事情報分析的(big data)商業智能概覽
- 來自執法的案例研究 - 預測性警务
- 執法機構中(big data)的採用率,以及他們如何圍繞(big data)預測分析調整未來運營
- 新興技術解決方案,如槍聲傳感器、監視視頻和社交媒體
- 使用大數據技術緩解信息過載
- 將大數據與傳統數據接口對接
- 預測分析中 enabling technologies 的基本理解
- 數據整合儀表板可視化
- 防欺诈管理
- 業務規則和欺詐檢測
- 威脅檢測和檔案建立
- (big data)實施的成本效益分析
大數據介紹
- 大數據的主要特徵 - 容量、多樣性、速度和真實性。
- MPP (Massively Parallel Processing) 架構
- 數據倉庫 – 靜態模式,緩慢演變的數據集
- MPP資料庫:Greenplum, Exadata, Teradata, Netezza, Vertica等
- 基於Hadoop的解決方案 - 對數據集結構無限制。
- 典型模式:HDFS, MapReduce (crunch), 從HDFS檢索
- 用於流處理的Apache Spark
- 批處理 – 適合分析/非交互式
- 容量:CEP流數據
- 典型選擇 – CEP產品(例如Infostreams, Apama, MarkLogic等)
- 生產準備度較低 – Storm/S4
- NoSQL資料庫 - (列式和鍵值型):最適合作為數據倉庫/資料庫的分析輔助工具
NoSQL解決方案
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (層級式) - GT.m, Cache
- KV Store (有序型) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- 物件資料庫 - ZopeDB, DB40, Shoal
- 文件儲存庫 - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- 寬列儲存庫 - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
數據多樣性:大數據中數據清理問題的介紹
- RDBMS – 靜態結構/模式,不促進敏捷、探索性環境。
- NoSQL – 半結構化,足以在存儲數據前無需精確模式即可存儲數據
- 數據清理問題
Hadoop
- 何時選擇Hadoop?
- 結構化數據 - 企業數據倉庫/資料庫可以存儲海量數據(但有成本),但強加結構(不利於主動探索)
- 半結構化數據 – 使用傳統解決方案(DW/DB)難以處理
- 倉儲數據 = 巨大的努力,且在實施後也是靜態的
- 對於數據的多樣性和容量,在商用硬件上進行 crunch – HADOOP
- 需要商用硬件來創建Hadoop集群
Map Reduce /HDFS介紹
- MapReduce – 在多服務器上分發計算
- HDFS – 為計算過程在本地提供數據(具有冗餘)
- 數據 – 可以是非結構化/無模式的(與RDBMS不同)
- 開發者需負責讓數據有意義
- 編寫MapReduce = 使用Java工作(優缺點),手動將數據加載到HDFS中
第二天
大數據生態系統 -- 構建大數據ETL(抽取、轉換、裝載)-- 何時使用哪些大數據工具?
- Hadoop vs. 其他NoSQL解決方案
- 用於交互式的、隨機訪問數據
- Hbase(列向資料庫)位於Hadoop之上
- 隨機訪問數據,但有限制(最大1 PB)
- 不利於即席分析,有利於日誌記錄、計數、時間序列
- Sqoop - 從資料庫導入到Hive或HDFS(JDBC/ODBC訪問)
- Flume – 將流數據(例如日誌數據)流式傳輸到HDFS
大數據管理系統
- 移動組件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
- 複雜管道/工作流:Oozie – 管理工作流、依賴關係、鏈式操作
- 部署、配置、集群管理、升級等(系統管理員):Ambari
- 在雲中:Whirr
預測分析 -- 基本技術和基於機器學習的商業智能
- 機器學習介紹
- 學習分類技術
- 貝葉斯預測 – 準備訓練文件
- 支持向量機
- KNN p-Tree代數及垂直挖掘
- 神經網絡
- 大數據大變量問題 – 隨機森林(RF)
- 大數據自動化問題 – 多模型集成RF
- 通過Soft10-M實現自動化
- 文本分析工具-Treeminer
- 敏捷學習
- 基於代理的學習
- 分布式學習
- 預測分析的開源工具介紹:R, Python, Rapidminer, Mahut
預測分析生態系統及其在刑事情報分析中的應用
- 技術與調查過程
- 洞察分析
- 可視化分析
- 結構化預測分析
- 非結構化預測分析
- 威脅/欺詐者/供應商檔案建立
- 推薦引擎
- 模式檢測
- 規則/場景發現 – 故障、欺詐、優化
- 根本原因發現
- 情感分析
- CRM分析
- 網絡分析
- 用於從翻譯稿、證人陳述、互聯網 chatter 等獲取洞察的文本分析
- 技術輔助審查
- 防欺诈分析
- 實時分析
第三天
Hadoop上的實時和可擴展分析
- 為什麼常見的分析算法在Hadoop/HDFS中失敗
- Apache Hama - 用於批量同步分布式計算
- Apache SPARK - 用於集群計算和實時分析
- CMU Graphics Lab2 - 基於圖的分布式計算非同步方法
- KNN p – 來自Treeminer的基於代數的方法,以降低操作硬件成本
eDiscovery和法證工具
- eDiscovery在大數據與傳統數據 vs. 成本和性能的比較
- 預測編碼和技術輔助審查(TAR)
- vMiner實時演示,了解TAR如何實現更快的發現
- 通過HDFS加速索引 – 數據的速度
- NLP(自然語言處理)– 開源產品和技術
- 外語中的eDiscovery -- 外語處理的技術
用於網絡安全的大數據BI – 獲得360度視角,快速數據收集和威脅識別
- 理解安全分析的基本概念 – 攻擊面、安全配置錯誤、主機防禦
- 網絡基礎設施 / 大型數據管道 / 實時分析的響應ETL
- 規定性與預測性 – 固定規則基礎 vs. 從元數據自動發現威脅規則
收集雜亂的數據用於刑事情報分析
- 使用物聯網(IoT)作為傳感器來捕獲數據
- 使用衛星圖像進行國內監視
- 使用監視和圖像數據進行犯罪嫌疑人識別
- 其他數據收集技術 – 無人機、身體相機、GPS標籤系統和熱成像技術
- 將自動數據檢索與從情報人員、審訊和研究獲得的數據相結合
- 預測犯罪活動
第四天
防欺诈分析中的大數據BI防欺诈
- 防欺诈分析的基礎分類 – 基於規則 vs. 預測性分析
- 監督式與非監督式機器學習用於欺詐模式檢測
- 企業間欺詐、醫療索賠欺詐、保險欺詐、逃稅和洗錢
社交媒體分析 – 情報收集和解析
- 犯罪分子如何使用社交媒體組織、招募和計劃
- 用於提取社交媒體數據的大數據ETL API
- 文本、圖像、元數據和視頻
- 來自社交媒體饋送的情感分析
- 社交媒體饋送的上下文和非上下文過濾
- 用於整合多樣化社交媒體的社交媒體儀表板
- 社交媒體檔案的自動建立
- 將通過Treeminer工具提供每個分析的實時演示
圖像處理和視頻饋送中的大數據分析
- 大數據中的圖像存儲技術 – 超過PB級數據的存儲解決方案
- LTFS(線性磁帶文件系統)和LTO(線性磁帶開放標準)
- GPFS-LTFS(通用並行文件系統 - 線性磁帶文件系統)– 大圖像數據的分層存儲解決方案
- 圖像分析的基本原理
- 對象識別
- 圖像分割
- 運動跟蹤
- 3-D圖像重建
生物特徵、DNA和下一代識別程序
- 超越指紋和面部識別
- 語音識別、擊鍵(分析用戶打字模式)和CODIS(綜合DNA索引系統)
- 超越DNA匹配:使用法醫DNA表型鑑定從DNA樣本構建面孔
用於快速獲取多樣數據和顯示的大數據儀表板:
- 現有應用平台與大數據儀表板的整合
- 大數據管理
- 大數據儀表板案例研究:Tableau和Pentaho
- 使用大數據應用在政府中推送基於位置的服务
- 追蹤系統和管理
第五天
如何在組織內合理化大數據BI實施:
- 定義實施大數據的ROI(投資回報率)
- 節省分析師在數據收集和準備時間的案例研究 – 提高生產力
- 通過降低資料庫授權成本獲得的收入增益
- 通過基於位置的服务獲得的收入增益
- 防欺诈節省的成本
- 用於計算大數據實施的近似費用與收入增益/節省的整合式電子表單方法。
用大數據系統替換傳統數據系統的逐步程序
- 大數據遷移路線圖
- 在構建大數據系統前需要哪些關鍵信息?
- 計算數據的容量、速度、多樣性和真實性的不同方法有哪些
- 如何估計數據增長
- 案例研究
審查大數據供應商及其產品。
- Accenture
- APTEAN(前CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB(前10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware(EMC的一部分)
問答環節
最低要求
- 了解執法流程和數據系統
- 基本掌握SQL/Oracle或關係型資料庫
- 基本掌握統計知識(電子表單級別)
受眾
- 具有技術背景的執法專家
35 小時
客戶評論 (3)
基礎知識很好,喜歡準備的文件和練習
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
課程 - Introduction to Predictive AI
機器翻譯
Deepthi非常關注我的需求,她能夠判斷何時增加複雜度,何時採取更結構化的方法。Deepthi真正按照我的節奏進行培訓,確保我能夠自己使用新的功能/工具。她先演示,然後讓我自己重新操作,這極大地幫助了我鞏固所學內容。我對這次培訓的結果以及Deepthi的專業水平感到非常滿意!
Deepthi - Invest Northern Ireland
課程 - IBM Cognos Analytics
機器翻譯
他準備充分,並且非常富有同情心
Oliver - Post CH AG
課程 - Splunk Fundamentals
機器翻譯