Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Plan Szkolenia
Każda sesja trwa 2 godziny
Dzień 1: Sesja 1: Przegląd biznesowy — dlaczego Big Data Business Intelligence w administracji rządowej
- Studia przypadków z NIH, DoE
- Tempo adaptacji Big Data w agencjach rządowych oraz jak dostosowują one swoją przyszłą działalność do predykcyjnej analityki Big Data
- Szerokie obszary zastosowań w DoD, NSA, IRS, USDA itp.
- Łączenie Big Data z danymi odziedziczonymi
- Podstawowe zrozumienie technologii wspomagających w analityce predykcyjnej
- Integracja danych i wizualizacja na pulpitach nawigacyjnych
- Zarządzanie nadużyciami
- Generowanie reguł biznesowych/wykrywania nadużyć
- Wykrywanie zagrożeń i profilowanie
- Analiza kosztów i korzyści wdrożenia Big Data
Dzień 1: Sesja 2: Wprowadzenie do Big Data — część 1
- Główne cechy Big Data — wolumen, różnorodność, prędkość i wiarygodność. Architektura MPP dla wolumenu.
- Hurtownie danych — statyczny schemat, powoli ewoluujący zestaw danych
- Bazy danych MPP, takie jak Greenplum, Exadata, Teradata, Netezza, Vertica itp.
- Rozwiązania oparte na Hadoop — brak warunków co do struktury zestawu danych.
- Typowy wzorzec: HDFS, MapReduce (przetwarzanie), pobieranie z HDFS
- Przetwarzanie wsadowe — odpowiednie do zadań analitycznych/nieinteraktywnych
- Wolumen: strumieniowanie danych CEP
- Typowe wybory — produkty CEP (np. Infostreams, Apama, MarkLogic itp.)
- Mniej gotowe produkcyjnie — Storm/S4
- Bazy danych NoSQL — (kolumnowe i klucz-wartość): najlepiej sprawdzają się jako analityczne uzupełnienie hurtowni danych/bazy danych
Dzień 1: Sesja 3: Wprowadzenie do Big Data — część 2
Rozwiązania NoSQL
- Magazyn KV — Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Magazyn KV — Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Magazyn KV (hierarchiczny) — GT.m, Cache
- Magazyn KV (uporządkowany) — TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Pamięć podręczna KV — Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Magazyn krotek — Gigaspaces, Coord, Apache River
- Baza obiektowa — ZopeDB, DB40, Shoal
- Magazyn dokumentów — CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, bazy XML, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Szerokokolumnowy magazyn — BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Różnorodność danych: wprowadzenie do problemów czyszczenia danych w Big Data
- RDBMS — statyczna struktura/schemat, nie sprzyja zwinności i środowisku eksploracyjnemu.
- NoSQL — dane częściowo ustrukturyzowane, wystarczająca struktura do przechowywania danych bez dokładnego schematu przed zapisaniem danych
- Problemy z czyszczeniem danych
Dzień 1: Sesja 4: Wprowadzenie do Big Data — część 3: Hadoop
- Kiedy wybrać Hadoop?
- DANE USTRUKTURYZOWANE — korporacyjne hurtownie danych/bazy danych mogą przechowywać ogromne ilości danych (za odpowiednią cenę), ale narzucają strukturę (nie są dobre do aktywnej eksploracji)
- Dane CZĘŚCIOWO USTRUKTURYZOWANE — trudne do obsługi tradycyjnymi rozwiązaniami (hurtownia/baza danych)
- Hurtownia danych = OGROMNY wysiłek i statyczność nawet po wdrożeniu
- Dla różnorodności i wolumenu danych, przetwarzanych na sprzęcie standardowym — HADOOP
- Sprzęt standardowy potrzebny do utworzenia klastra Hadoop
Wprowadzenie do MapReduce/HDFS
- MapReduce — rozproszone przetwarzanie na wielu serwerach
- HDFS — udostępnianie danych lokalnie dla procesu obliczeniowego (z redundancją)
- Dane — mogą być nieustrukturyzowane/bez schematu (w przeciwieństwie do RDBMS)
- Odpowiedzialność programisty za nadanie sensu danym
- Programowanie MapReduce = praca z Javą (plusy/minusy), ręczne ładowanie danych do HDFS
Dzień 2: Sesja 1: Ekosystem Big Data — budowanie ETL dla Big Data: świat narzędzi Big Data — których używać i kiedy?
- Hadoop a inne rozwiązania NoSQL
- Do interaktywnego, swobodnego dostępu do danych
- HBase (kolumnowa baza danych) na bazie Hadoop
- Swobodny dostęp do danych, ale z ograniczeniami (maks. 1 PB)
- Niezbyt dobre do analityki ad-hoc, dobre do logowania, zliczania, szeregów czasowych
- Sqoop — import z baz danych do Hive lub HDFS (dostęp JDBC/ODBC)
- Flume — przesyłanie danych strumieniowych (np. dane logów) do HDFS
Dzień 2: Sesja 2: System zarządzania Big Data
- Ruchome części, uruchamianie/awarie węzłów obliczeniowych: ZooKeeper — do usług konfiguracji/koordynacji/nazewnictwa
- Złożone potoki/przepływy pracy: Oozie — zarządzanie przepływem pracy, zależnościami, łańcuchem daisy chain
- Wdrażanie, konfiguracja, zarządzanie klastrem, aktualizacje itp. (administracja systemem): Ambari
- W chmurze: Whirr
Dzień 2: Sesja 3: Analityka predykcyjna w Business Intelligence — część 1: Podstawowe techniki i BI oparte na uczeniu maszynowym:
- Wprowadzenie do uczenia maszynowego
- Poznawanie technik klasyfikacji
- Predykcja bayesowska — przygotowanie pliku treningowego
- Maszyna wektorów nośnych
- Algebra KNN p-Tree i eksploracja pionowa
- Sieć neuronowa
- Problem dużej liczby zmiennych w Big Data — las losowy (RF)
- Problem automatyzacji Big Data — wielomodelowy zespół RF
- Automatyzacja przez Soft10-M
- Narzędzie analityki tekstu — Treeminer
- Zwinne uczenie się
- Uczenie oparte na agentach
- Uczenie rozproszone
- Wprowadzenie do narzędzi open source do analityki predykcyjnej: R, Rapidminer, Mahut
Dzień 2: Sesja 4: Ekosystem analityki predykcyjnej — część 2: Typowe problemy analityki predykcyjnej w administracji rządowej
- Analityka wglądu
- Analityka wizualizacyjna
- Ustrukturyzowana analityka predykcyjna
- Nieustrukturyzowana analityka predykcyjna
- Profilowanie zagrożeń/systemów antyfraudowych/dostawców
- Silnik rekomendacji
- Wykrywanie wzorców
- Odkrywanie reguł/scenariuszy — awarie, nadużycia, optymalizacja
- Odkrywanie przyczyn źródłowych
- Analiza sentymentu
- Analityka CRM
- Analityka sieciowa
- Analityka tekstu
- Przegląd wspomagany technologią
- Analityka nadużyć
- Analityka w czasie rzeczywistym
Dzień 3: Sesja 1: Analityka w czasie rzeczywistym i skalowalna w oparciu o Hadoop
- Dlaczego typowe algorytmy analityczne zawodzą w Hadoop/HDFS
- Apache Hama — do masowego synchronicznego przetwarzania rozproszonego
- Apache SPARK — do przetwarzania klastrowego na potrzeby analityki w czasie rzeczywistym
- CMU Graphics Lab2 — grafowe asynchroniczne podejście do przetwarzania rozproszonego
- Podejście oparte na algebrze KNN p z Treeminer w celu obniżenia kosztów sprzętowych operacji
Dzień 3: Sesja 2: Narzędzia do eDiscovery i informatyki śledczej
- eDiscovery w Big Data a dane odziedziczone — porównanie kosztów i wydajności
- Kodowanie predykcyjne i przegląd wspomagany technologią (TAR)
- Prezentacja na żywo produktu TAR (vMiner), aby zrozumieć, jak TAR działa w szybszym odkrywaniu danych
- Szybsze indeksowanie przez HDFS — prędkość danych
- NLP, czyli przetwarzanie języka naturalnego — różne techniki i produkty open source
- eDiscovery w językach obcych — technologia przetwarzania języków obcych
Dzień 3: Sesja 3: Big Data BI dla cyberbezpieczeństwa — zrozumienie pełnego, 360-stopniowego obrazu od szybkiego zbierania danych do identyfikacji zagrożeń
- Zrozumienie podstaw analityki bezpieczeństwa — powierzchnia ataku, błędna konfiguracja zabezpieczeń, obrona hosta
- Infrastruktura sieciowa/duże potoki danych/ETL odpowiedzi na potrzeby analityki w czasie rzeczywistym
- Podejście nakazowe a predykcyjne — reguły stałe a automatyczne odkrywanie reguł zagrożeń z metadanych
Dzień 3: Sesja 4: Big Data w USDA: zastosowanie w rolnictwie
- Wprowadzenie do IoT (Internetu rzeczy) w rolnictwie — Big Data oparte na czujnikach i sterowanie
- Wprowadzenie do obrazowania satelitarnego i jego zastosowania w rolnictwie
- Integracja danych z czujników i obrazów pod kątem żyzności gleby, rekomendacji upraw i prognozowania
- Ubezpieczenia rolnicze a Big Data
- Prognozowanie strat w uprawach
Dzień 4: Sesja 1: BI zapobiegania nadużyciom z Big Data w administracji rządowej — analityka nadużyć:
- Podstawowa klasyfikacja analityki nadużyć — podejście oparte na regułach a analityka predykcyjna
- Uczenie maszynowe nadzorowane a nienadzorowane w wykrywaniu wzorców nadużyć
- Nadużycia ze strony dostawców/zawyżanie kosztów projektów
- Nadużycia w Medicare i Medicaid — techniki wykrywania nadużyć w przetwarzaniu roszczeń
- Nadużycia w zwrotach kosztów podróży
- Nadużycia w zwrotach podatku IRS
- Studia przypadków i prezentacje na żywo zostaną przedstawione tam, gdzie dostępne są dane.
Dzień 4: Sesja 2: Analityka mediów społecznościowych — gromadzenie i analiza informacji wywiadowczych
- API ETL Big Data do pozyskiwania danych z mediów społecznościowych
- Tekst, obrazy, metadane i wideo
- Analiza sentymentu ze strumieni mediów społecznościowych
- Kontekstowe i niekontekstowe filtrowanie strumieni mediów społecznościowych
- Pulpit nawigacyjny mediów społecznościowych do integracji różnorodnych platform społecznościowych
- Automatyczne profilowanie profili w mediach społecznościowych
- Prezentacja na żywo każdej analizy zostanie przeprowadzona za pomocą narzędzia Treeminer.
Dzień 4: Sesja 3: Analityka Big Data w przetwarzaniu obrazów i strumieniach wideo
- Techniki przechowywania obrazów w Big Data — rozwiązanie pamięci masowej dla danych przekraczających petabajty
- LTFS i LTO
- GPFS-LTFS (warstwowe rozwiązanie pamięci masowej dla dużych danych obrazowych)
- Podstawy analityki obrazu
- Rozpoznawanie obiektów
- Segmentacja obrazu
- Śledzenie ruchu
- Rekonstrukcja obrazu 3D
Dzień 4: Sesja 4: Zastosowania Big Data w NIH:
- Nowe obszary bioinformatyki
- Metagenomika i problemy eksploracji Big Data
- Analityka predykcyjna Big Data w farmakogenomice, metabolomice i proteomice
- Big Data w dalszych procesach genomicznych
- Zastosowanie predykcyjnej analityki Big Data w zdrowiu publicznym
Pulpit nawigacyjny Big Data do szybkiego dostępu do różnorodnych danych i ich wyświetlania:
- Integracja istniejącej platformy aplikacyjnej z pulpitem Big Data
- Zarządzanie Big Data
- Studium przypadku pulpitu Big Data: Tableau i Pentaho
- Wykorzystanie aplikacji Big Data do udostępniania usług lokalizacyjnych w administracji rządowej
- System śledzenia i zarządzanie
Dzień 5: Sesja 1: Jak uzasadnić wdrożenie Big Data BI w organizacji:
- Definiowanie ROI dla wdrożenia Big Data
- Studia przypadków oszczędności czasu analityków na zbieranie i przygotowanie danych — wzrost produktywności
- Studia przypadków zysków z oszczędności na kosztach licencjonowanych baz danych
- Zyski z usług lokalizacyjnych
- Oszczędności z zapobiegania nadużyciom
- Zintegrowane podejście arkuszowe do obliczania przybliżonych wydatków w porównaniu z zyskami/oszczędnościami z wdrożenia Big Data.
Dzień 5: Sesja 2: Procedura krok po kroku zastąpienia odziedziczonego systemu danych systemem Big Data:
- Zrozumienie praktycznej mapy drogowej migracji do Big Data
- Jakie ważne informacje są potrzebne przed zaprojektowaniem wdrożenia Big Data
- Jakie są różne sposoby obliczania wolumenu, prędkości, różnorodności i wiarygodności danych
- Jak szacować wzrost danych
- Studia przypadków
Dzień 5: Sesja 4: Przegląd dostawców Big Data i ich produktów. Sesja pytań i odpowiedzi:
- Accenture
- APTEAN (dawniej CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (dawniej 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (część EMC)
Wymagania
- Podstawowa wiedza na temat funkcjonowania biznesu i systemów danych w administracji rządowej w swojej dziedzinie
- Podstawowa znajomość SQL/Oracle lub relacyjnych baz danych
- Podstawowa znajomość statystyki (na poziomie arkusza kalkulacyjnego)
35 godzin
Opinie uczestników (1)
Zdolność trenera do dostosowania kursu do wymagań organizacji, a nie tylko do zapewnienia jego przeprowadzenia dla samego siebie.
Masilonyane - Revenue Services Lesotho
Szkolenie - Big Data Business Intelligence for Govt. Agencies
Przetłumaczone przez sztuczną inteligencję