Kom i kontakt
 Varaktighet 35 timmar

Kursplan

Varje session är 2 timmar

Dag 1: Session 1: Affärsoversikt över varför stor dataaffärsanalys i den offentliga sektorn

  • Kasustudier från NIH, DoE
  • Adoptionstempo av stor data hos statliga organ och hur de anpassar sin framtida verksamhet kring prediktiv stor dataanalys
  • Bred skalningsytor inom DoD, NSA, IRS, USDA m.fl.
  • Gränssnitt mellan stor data och legacydata
  • Grundläggande förståelse för underliggande teknologier inom prediktiv analys
  • Dataintegration och dashboardsvisualisering
  • Bedragerihantering
  • Generering av affärsregler/bedrageriupptäcktsregler
  • Kontaktdetektering och profilering
  • Kostnad-fördelsanalys för implementering av stor data

Dag 1: Session 2: Introduktion till stor data 1

  • Huvudkaraktäristiker hos stor data: volym, mångfald, hastighet och sanningsenlighet. MPP-arkitektur för volym.
  • Datalagrar – statisk schemaläggning, långsamt utvecklande dataset
  • MPP-databaser som Greenplum, Exadata, Teradata, Netezza, Vertica m.fl.
  • Hadoop-baserade lösningar – inga villkor på struktur av dataset.
  • Typiskt mönster: HDFS, MapReduce (crunch), hämtning från HDFS
  • Batch-passande för analytiska/interaktiva uppgifter
  • Volym: CEP strömmande data
  • Typiska val – CEP-produkter (t.ex. Infostreams, Apama, MarkLogic m.fl.)
  • Inte helt produktions redo – Storm/S4
  • NoSQL-databaser – (kolumnär och nyckel-värde): Bästa som analytiskt tillägg till datalager/databas

Dag 1 : Session 3 : Introduktion till stor data 2

NoSQL-lösningar

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierarkisk) - GT.m, Cache
  • KV Store (Ordenad) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Objektdatabas - ZopeDB, DB40, Shoal
  • Dokumentlagring - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databaser, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Bred Kolumnar Lagring - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Slags data: Introduktion till datarentningsproblem i stor data

  • RDBMS – statisk struktur/schema, främjar inte en agil, utforskande miljö.
  • NoSQL – semi-strukturerad, tillräcklig struktur för att lagra data utan exakt schema innan lagring
  • Problem med datarentning

Dag 1 : Session-4 : Stor data introduktion 3 : Hadoop

  • När ska Hadoop väljas?
  • STRUKTURERAD - Enterprise-datalagrar/databaser kan lagra massiv data (med kostnad) men ålägger struktur (inte bra för aktiv utforskning)
  • SEMI-STRUKTURERAD data – svårt att hantera med traditionella lösningar (DW/DB)
  • Lager av data = ENORM insats och statisk även efter implementering
  • För mångfald & volym av data, bearbetad på varuhuvudsdatorer – HADOOP
  • Varuhuvuds H/W krävs för att skapa en Hadoop-cluster

Introduktion till Map Reduce /HDFS

  • MapReduce – distribuera beräkningar över flera servrar
  • HDFS – göra data tillgängligt lokalt för beräkningsprocessen (med redundans)
  • Data – kan vara ostrukturerad/schema-lös (till skillnad från RDBMS)
  • Utvecklarens ansvar att ge mening åt data
  • Programmering av MapReduce = arbete med Java (för-/emot), manuell inläsning av data till HDFS

Dag 2: Session-1: Stor data ekosystem-Bygga stor data ETL: universum av stor dataverktyg - vilka att använda och när?

  • Hadoop vs. Andra NoSQL-lösningar
  • För interaktiv, slumpvis åtkomst till data
  • Hbase (kolumnorienterad databas) ovanpå Hadoop
  • Slumpvis åtkomst till data men med begränsningar (max 1 PB)
  • Inte bra för ad-hoc analys, bra för loggning, räkning, tidsserier
  • Sqoop - Import från databaser till Hive eller HDFS (JDBC/ODBC åtkomst)
  • Flume – Strömdata (t.ex. loggdata) till HDFS

Dag-2: Session-2: Stor data hanteringssystem

  • Rörliga delar, beräkningsnoder start/fel :ZooKeeper - För konfiguration/koordinering/namngivningstjänster
  • Komplexa pipeline/workflow: Oozie – hantera workflow, beroenden, daisy chain
  • Deployment, konfiguration, clustermanagement, uppgradering m.fl. (sysadmin) :Ambari
  • I molnet : Whirr

Dag-2: Session-3: Prediktiv analys inom affärsanalys -1: Grundläggande tekniker & maskininlärning baserad BI :

  • Introduktion till maskininlärning
  • Lärande av klassificeringstekniker
  • Bayesisk prediktion- förberedelse av träningsfil
  • Stödvektormaskin
  • KNN p-Tree Algebra & vertikal gruvning
  • Neuralt nätverk
  • Stor data stor variabel problem -Slumptog (RF)
  • Stor data automatikproblem – Multi-modell ensemble RF
  • Automatisering genom Soft10-M
  • Textanalytikverktyg-Treeminer
  • Agilt lärande
  • Agent-baserat lärande
  • Distribuerat lärande
  • Introduktion till Open source verktyg för prediktiv analys : R, Rapidminer, Mahut

Dag-2: Session-4 Prediktiv analys eco-system-2: Vanliga prediktiva analysproblem i Govt.

  • Insiktsanalys
  • Visualiseringsanalys
  • Strukturerad prediktiv analys
  • Ostrukturerad prediktiv analys
  • Kontaktbetrageri/tillhandahållare profilering
  • Rekommendationsmotor
  • Mönsterdetektering
  • Regel/scenariouptäckt –fel, bedrägeri, optimering
  • Rotorsak upptäckt
  • Stämningsanalys
  • CRM-analys
  • Nätverksanalys
  • Textanalys
  • Teknikassisterad granskning
  • Bedragerianalys
  • Realtidsanalys

Dag 3 : Sesion-1 : Realtid och skalbar analys över Hadoop

  • Varför vanliga analgalgoritmar misslyckas i Hadoop/HDFS
  • Apache Hama- för Bulk Synchronous distribuerade beräkningar
  • Apache SPARK- för clusterberäkningar för realtidsanalys
  • CMU Graphics Lab2- Grafik-baserat asynkront tillvägagångssätt för distribuerade beräkningar
  • KNN p-Algebra-baserat tillvägagångssätt från Treeminer för reducerad hårdvarukostnad

Dag-3: Session-2: Verktyg för eDiscovery och forensik

  • eDiscovery över stor data vs. Legacydata – en jämförelse av kostnad och prestanda
  • Prediktiv kodning och teknikassisterad granskning (TAR)
  • Live demo av en TAR-produkt (vMiner) för att förstå hur TAR fungerar för snabbare upptäckt
  • Snabbare indexering genom HDFS –hastighet av data
  • NLP eller Natural Language processing –olika tekniker och open source-produkter
  • eDiscovery i främmande språk-teknik för bearbetning av främmande språk

Dag 3 : Session 3: Stor data BI för Cybersäkerhet – Förståelse för hela 360-gradersvyer av snabb datainsamling till kontaktiden

  • Förståelse för grunderna av säkerhetsanalys-angreppsytan, felkonfiguration, värdskydd
  • Nätverksinfrastruktur/ Stora datapipor / Respons ETL för realtidsanalys
  • Preskriptiv vs prediktiv – Fast regelbaserad vs auto-identifiering av kontaktregler från Meta data

Dag-3: Session 4: Stor data i USDA : Tillämpning inom jordbrukssektorn

  • Introduktion till IoT (Internet of Things) för jordbruk-sensorbaserad stor data och kontroll
  • Introduktion till satellitbilder och dess tillämpning inom jordbruket
  • Integrering av sensor och bilddata för jordfruktbarhet, odlingsrekommendationer och prognoser
  • Jordbruksförsäkring och stor data
  • Skördetapp prognos

Dag 4 : Session-1: Bedrägeriprevention BI från stor data i Govt-Bedragerianalys:

  • Grundläggande klassificering av bedrägerianalys- regelbaserad vs prediktiv analys
  • Övervakat vs oövervakat maskininlärning för bedrägerimönsterdetektering
  • Tillhandahållare bedrägeri/överprissättning för projekt
  • Medicare och Medicaid bedrägeri- bedrägeriupptäcktsmetoder för ansökningshantering
  • Resa ersättningsbedrägerier
  • IRS refundbedrägerier
  • Kasustudier och live demo kommer att ges där data är tillgänglig.

Dag 4 : Session-2: Sociala media analys- Underrättelseinsamling och analys

  • Stor data ETL API för att extrahera sociala mediedata
  • Text, bild, metadata och video
  • Stämningsanalys från sociala medieflöde
  • Kontextuellt och icket-kontextuellt filtrering av sociala medieflöde
  • Sociala media Dashboard för att integrera mångfaldig sociala medier
  • Automatisk profilering av sociala media-profiler
  • Live demo av varje analys kommer att ges genom Treeminer-verktyget.

Dag 4 : Session-3: Stor data analys inom bildbehandling och video feeds

  • Bildlagringstekniker inom stor data- Lagringslösning för data som överstiger petabytes
  • LTFS och LTO
  • GPFS-LTFS ( Laminerad lagringslösning för stor bilddata)
  • Grundläggande bildanalys
  • Objektkänning
  • Bildsegmentering
  • Rörelsespårning
  • 3-D bildrekonstruktion

Dag 4: Session-4: Stor data tillämpningar i NIH:

  • Nyckelområden inom Bio-informatik
  • Meta-genomik och stor data gruvningsproblem
  • Stor data prediktiv analys för Farmakogenomik, Metabolomik och Proteomik
  • Stor data i downstream Genomik process
  • Tillämpning av stor data prediktiv analys inom Folkhälsan

Stor data Dashboard för snabb tillgång till mångfaldig data och visning :

  • Integration av befintliga applikationsplattformar med Stor data Dashboard
  • Stor data hantering
  • Kasustudie av Stor data Dashboard: Tableau och Pentaho
  • Använd Stor data-app för att pusha positionsbaserade tjänster i Govt.
  • Spårningssystem och hantering

Dag 5 : Session-1: Hur man motiverar stor data BI implementering inom en organisation:

  • Definiera ROI för stor data implementering
  • Kasustudier för sparande av analytikertid för insamling och förberedelse av Data –ökning i produktivitetsvinster
  • Kasustudier av intäktsvinster från sparande på licensierad databaskostnad
  • Intäktsvinster från positionsbaserade tjänster
  • Sparande från bedrägeriprevention
  • En integrerad kalkylbladsansats för att beräkna ungefärlig kostnad vs. Intäktsvinster/sparande från Stor data implementering.

Dag 5 : Session-2: Steg för steg procedur att ersätta legacydatabas till Stor data System:

  • Förståelse för praktisk Stor data Migrationsväg
  • Vilken viktig information som behövs innan arkitektur av en Stor data implementering
  • Vilka olika sätt för att beräkna volym, hastighet, mångfald och sanningsenlighet av data
  • Hur man uppskattar dataväxt
  • Kasustudier

Dag 5: Session 4: Översikt av Stor Data-leverantörer och deras produkter. Q/A session:

  • Accenture
  • APTEAN (Formerly CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Formerly 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Part of EMC)

Krav

  • Grundläggande kunskap om affärsdrift och datasystem inom din egen sektor i den offentliga sektorn
  • Grundläggande förståelse för SQL/Oracle eller relationella databaser
  • Grundläggande förståelse för statistik (på kalkylbladsnivå)

Antal deltagare


Pris per deltagare

Vittnesmål (1)

Kommande Kurser

Relaterade Kategorier