Bądźmy w kontakcie

Plan Szkolenia

Każda sesja trwa 2 godziny

Dzień 1: Sesja 1: Przegląd biznesowy — dlaczego Big Data Business Intelligence w administracji rządowej

  • Studia przypadków z NIH, DoE
  • Tempo adaptacji Big Data w agencjach rządowych oraz jak dostosowują one swoją przyszłą działalność do predykcyjnej analityki Big Data
  • Szerokie obszary zastosowań w DoD, NSA, IRS, USDA itp.
  • Łączenie Big Data z danymi odziedziczonymi
  • Podstawowe zrozumienie technologii wspomagających w analityce predykcyjnej
  • Integracja danych i wizualizacja na pulpitach nawigacyjnych
  • Zarządzanie nadużyciami
  • Generowanie reguł biznesowych/wykrywania nadużyć
  • Wykrywanie zagrożeń i profilowanie
  • Analiza kosztów i korzyści wdrożenia Big Data

Dzień 1: Sesja 2: Wprowadzenie do Big Data — część 1

  • Główne cechy Big Data — wolumen, różnorodność, prędkość i wiarygodność. Architektura MPP dla wolumenu.
  • Hurtownie danych — statyczny schemat, powoli ewoluujący zestaw danych
  • Bazy danych MPP, takie jak Greenplum, Exadata, Teradata, Netezza, Vertica itp.
  • Rozwiązania oparte na Hadoop — brak warunków co do struktury zestawu danych.
  • Typowy wzorzec: HDFS, MapReduce (przetwarzanie), pobieranie z HDFS
  • Przetwarzanie wsadowe — odpowiednie do zadań analitycznych/nieinteraktywnych
  • Wolumen: strumieniowanie danych CEP
  • Typowe wybory — produkty CEP (np. Infostreams, Apama, MarkLogic itp.)
  • Mniej gotowe produkcyjnie — Storm/S4
  • Bazy danych NoSQL — (kolumnowe i klucz-wartość): najlepiej sprawdzają się jako analityczne uzupełnienie hurtowni danych/bazy danych

Dzień 1: Sesja 3: Wprowadzenie do Big Data — część 2

Rozwiązania NoSQL

  • Magazyn KV — Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Magazyn KV — Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Magazyn KV (hierarchiczny) — GT.m, Cache
  • Magazyn KV (uporządkowany) — TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Pamięć podręczna KV — Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Magazyn krotek — Gigaspaces, Coord, Apache River
  • Baza obiektowa — ZopeDB, DB40, Shoal
  • Magazyn dokumentów — CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, bazy XML, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Szerokokolumnowy magazyn — BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Różnorodność danych: wprowadzenie do problemów czyszczenia danych w Big Data

  • RDBMS — statyczna struktura/schemat, nie sprzyja zwinności i środowisku eksploracyjnemu.
  • NoSQL — dane częściowo ustrukturyzowane, wystarczająca struktura do przechowywania danych bez dokładnego schematu przed zapisaniem danych
  • Problemy z czyszczeniem danych

Dzień 1: Sesja 4: Wprowadzenie do Big Data — część 3: Hadoop

  • Kiedy wybrać Hadoop?
  • DANE USTRUKTURYZOWANE — korporacyjne hurtownie danych/bazy danych mogą przechowywać ogromne ilości danych (za odpowiednią cenę), ale narzucają strukturę (nie są dobre do aktywnej eksploracji)
  • Dane CZĘŚCIOWO USTRUKTURYZOWANE — trudne do obsługi tradycyjnymi rozwiązaniami (hurtownia/baza danych)
  • Hurtownia danych = OGROMNY wysiłek i statyczność nawet po wdrożeniu
  • Dla różnorodności i wolumenu danych, przetwarzanych na sprzęcie standardowym — HADOOP
  • Sprzęt standardowy potrzebny do utworzenia klastra Hadoop

Wprowadzenie do MapReduce/HDFS

  • MapReduce — rozproszone przetwarzanie na wielu serwerach
  • HDFS — udostępnianie danych lokalnie dla procesu obliczeniowego (z redundancją)
  • Dane — mogą być nieustrukturyzowane/bez schematu (w przeciwieństwie do RDBMS)
  • Odpowiedzialność programisty za nadanie sensu danym
  • Programowanie MapReduce = praca z Javą (plusy/minusy), ręczne ładowanie danych do HDFS

Dzień 2: Sesja 1: Ekosystem Big Data — budowanie ETL dla Big Data: świat narzędzi Big Data — których używać i kiedy?

  • Hadoop a inne rozwiązania NoSQL
  • Do interaktywnego, swobodnego dostępu do danych
  • HBase (kolumnowa baza danych) na bazie Hadoop
  • Swobodny dostęp do danych, ale z ograniczeniami (maks. 1 PB)
  • Niezbyt dobre do analityki ad-hoc, dobre do logowania, zliczania, szeregów czasowych
  • Sqoop — import z baz danych do Hive lub HDFS (dostęp JDBC/ODBC)
  • Flume — przesyłanie danych strumieniowych (np. dane logów) do HDFS

Dzień 2: Sesja 2: System zarządzania Big Data

  • Ruchome części, uruchamianie/awarie węzłów obliczeniowych: ZooKeeper — do usług konfiguracji/koordynacji/nazewnictwa
  • Złożone potoki/przepływy pracy: Oozie — zarządzanie przepływem pracy, zależnościami, łańcuchem daisy chain
  • Wdrażanie, konfiguracja, zarządzanie klastrem, aktualizacje itp. (administracja systemem): Ambari
  • W chmurze: Whirr

Dzień 2: Sesja 3: Analityka predykcyjna w Business Intelligence — część 1: Podstawowe techniki i BI oparte na uczeniu maszynowym:

  • Wprowadzenie do uczenia maszynowego
  • Poznawanie technik klasyfikacji
  • Predykcja bayesowska — przygotowanie pliku treningowego
  • Maszyna wektorów nośnych
  • Algebra KNN p-Tree i eksploracja pionowa
  • Sieć neuronowa
  • Problem dużej liczby zmiennych w Big Data — las losowy (RF)
  • Problem automatyzacji Big Data — wielomodelowy zespół RF
  • Automatyzacja przez Soft10-M
  • Narzędzie analityki tekstu — Treeminer
  • Zwinne uczenie się
  • Uczenie oparte na agentach
  • Uczenie rozproszone
  • Wprowadzenie do narzędzi open source do analityki predykcyjnej: R, Rapidminer, Mahut

Dzień 2: Sesja 4: Ekosystem analityki predykcyjnej — część 2: Typowe problemy analityki predykcyjnej w administracji rządowej

  • Analityka wglądu
  • Analityka wizualizacyjna
  • Ustrukturyzowana analityka predykcyjna
  • Nieustrukturyzowana analityka predykcyjna
  • Profilowanie zagrożeń/systemów antyfraudowych/dostawców
  • Silnik rekomendacji
  • Wykrywanie wzorców
  • Odkrywanie reguł/scenariuszy — awarie, nadużycia, optymalizacja
  • Odkrywanie przyczyn źródłowych
  • Analiza sentymentu
  • Analityka CRM
  • Analityka sieciowa
  • Analityka tekstu
  • Przegląd wspomagany technologią
  • Analityka nadużyć
  • Analityka w czasie rzeczywistym

Dzień 3: Sesja 1: Analityka w czasie rzeczywistym i skalowalna w oparciu o Hadoop

  • Dlaczego typowe algorytmy analityczne zawodzą w Hadoop/HDFS
  • Apache Hama — do masowego synchronicznego przetwarzania rozproszonego
  • Apache SPARK — do przetwarzania klastrowego na potrzeby analityki w czasie rzeczywistym
  • CMU Graphics Lab2 — grafowe asynchroniczne podejście do przetwarzania rozproszonego
  • Podejście oparte na algebrze KNN p z Treeminer w celu obniżenia kosztów sprzętowych operacji

Dzień 3: Sesja 2: Narzędzia do eDiscovery i informatyki śledczej

  • eDiscovery w Big Data a dane odziedziczone — porównanie kosztów i wydajności
  • Kodowanie predykcyjne i przegląd wspomagany technologią (TAR)
  • Prezentacja na żywo produktu TAR (vMiner), aby zrozumieć, jak TAR działa w szybszym odkrywaniu danych
  • Szybsze indeksowanie przez HDFS — prędkość danych
  • NLP, czyli przetwarzanie języka naturalnego — różne techniki i produkty open source
  • eDiscovery w językach obcych — technologia przetwarzania języków obcych

Dzień 3: Sesja 3: Big Data BI dla cyberbezpieczeństwa — zrozumienie pełnego, 360-stopniowego obrazu od szybkiego zbierania danych do identyfikacji zagrożeń

  • Zrozumienie podstaw analityki bezpieczeństwa — powierzchnia ataku, błędna konfiguracja zabezpieczeń, obrona hosta
  • Infrastruktura sieciowa/duże potoki danych/ETL odpowiedzi na potrzeby analityki w czasie rzeczywistym
  • Podejście nakazowe a predykcyjne — reguły stałe a automatyczne odkrywanie reguł zagrożeń z metadanych

Dzień 3: Sesja 4: Big Data w USDA: zastosowanie w rolnictwie

  • Wprowadzenie do IoT (Internetu rzeczy) w rolnictwie — Big Data oparte na czujnikach i sterowanie
  • Wprowadzenie do obrazowania satelitarnego i jego zastosowania w rolnictwie
  • Integracja danych z czujników i obrazów pod kątem żyzności gleby, rekomendacji upraw i prognozowania
  • Ubezpieczenia rolnicze a Big Data
  • Prognozowanie strat w uprawach

Dzień 4: Sesja 1: BI zapobiegania nadużyciom z Big Data w administracji rządowej — analityka nadużyć:

  • Podstawowa klasyfikacja analityki nadużyć — podejście oparte na regułach a analityka predykcyjna
  • Uczenie maszynowe nadzorowane a nienadzorowane w wykrywaniu wzorców nadużyć
  • Nadużycia ze strony dostawców/zawyżanie kosztów projektów
  • Nadużycia w Medicare i Medicaid — techniki wykrywania nadużyć w przetwarzaniu roszczeń
  • Nadużycia w zwrotach kosztów podróży
  • Nadużycia w zwrotach podatku IRS
  • Studia przypadków i prezentacje na żywo zostaną przedstawione tam, gdzie dostępne są dane.

Dzień 4: Sesja 2: Analityka mediów społecznościowych — gromadzenie i analiza informacji wywiadowczych

  • API ETL Big Data do pozyskiwania danych z mediów społecznościowych
  • Tekst, obrazy, metadane i wideo
  • Analiza sentymentu ze strumieni mediów społecznościowych
  • Kontekstowe i niekontekstowe filtrowanie strumieni mediów społecznościowych
  • Pulpit nawigacyjny mediów społecznościowych do integracji różnorodnych platform społecznościowych
  • Automatyczne profilowanie profili w mediach społecznościowych
  • Prezentacja na żywo każdej analizy zostanie przeprowadzona za pomocą narzędzia Treeminer.

Dzień 4: Sesja 3: Analityka Big Data w przetwarzaniu obrazów i strumieniach wideo

  • Techniki przechowywania obrazów w Big Data — rozwiązanie pamięci masowej dla danych przekraczających petabajty
  • LTFS i LTO
  • GPFS-LTFS (warstwowe rozwiązanie pamięci masowej dla dużych danych obrazowych)
  • Podstawy analityki obrazu
  • Rozpoznawanie obiektów
  • Segmentacja obrazu
  • Śledzenie ruchu
  • Rekonstrukcja obrazu 3D

Dzień 4: Sesja 4: Zastosowania Big Data w NIH:

  • Nowe obszary bioinformatyki
  • Metagenomika i problemy eksploracji Big Data
  • Analityka predykcyjna Big Data w farmakogenomice, metabolomice i proteomice
  • Big Data w dalszych procesach genomicznych
  • Zastosowanie predykcyjnej analityki Big Data w zdrowiu publicznym

Pulpit nawigacyjny Big Data do szybkiego dostępu do różnorodnych danych i ich wyświetlania:

  • Integracja istniejącej platformy aplikacyjnej z pulpitem Big Data
  • Zarządzanie Big Data
  • Studium przypadku pulpitu Big Data: Tableau i Pentaho
  • Wykorzystanie aplikacji Big Data do udostępniania usług lokalizacyjnych w administracji rządowej
  • System śledzenia i zarządzanie

Dzień 5: Sesja 1: Jak uzasadnić wdrożenie Big Data BI w organizacji:

  • Definiowanie ROI dla wdrożenia Big Data
  • Studia przypadków oszczędności czasu analityków na zbieranie i przygotowanie danych — wzrost produktywności
  • Studia przypadków zysków z oszczędności na kosztach licencjonowanych baz danych
  • Zyski z usług lokalizacyjnych
  • Oszczędności z zapobiegania nadużyciom
  • Zintegrowane podejście arkuszowe do obliczania przybliżonych wydatków w porównaniu z zyskami/oszczędnościami z wdrożenia Big Data.

Dzień 5: Sesja 2: Procedura krok po kroku zastąpienia odziedziczonego systemu danych systemem Big Data:

  • Zrozumienie praktycznej mapy drogowej migracji do Big Data
  • Jakie ważne informacje są potrzebne przed zaprojektowaniem wdrożenia Big Data
  • Jakie są różne sposoby obliczania wolumenu, prędkości, różnorodności i wiarygodności danych
  • Jak szacować wzrost danych
  • Studia przypadków

Dzień 5: Sesja 4: Przegląd dostawców Big Data i ich produktów. Sesja pytań i odpowiedzi:

  • Accenture
  • APTEAN (dawniej CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (dawniej 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (część EMC)

Wymagania

  • Podstawowa wiedza na temat funkcjonowania biznesu i systemów danych w administracji rządowej w swojej dziedzinie
  • Podstawowa znajomość SQL/Oracle lub relacyjnych baz danych
  • Podstawowa znajomość statystyki (na poziomie arkusza kalkulacyjnego)
 35 godzin

Liczba uczestników


Cena za uczestnika (netto)

Opinie uczestników (1)

Propozycje terminów

Powiązane Kategorie