Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Varaktighet 35 timmar
Kursplan
Varje session är 2 timmar
Dag 1: Session 1: Affärsoversikt över varför stor dataaffärsanalys i den offentliga sektorn
- Kasustudier från NIH, DoE
- Adoptionstempo av stor data hos statliga organ och hur de anpassar sin framtida verksamhet kring prediktiv stor dataanalys
- Bred skalningsytor inom DoD, NSA, IRS, USDA m.fl.
- Gränssnitt mellan stor data och legacydata
- Grundläggande förståelse för underliggande teknologier inom prediktiv analys
- Dataintegration och dashboardsvisualisering
- Bedragerihantering
- Generering av affärsregler/bedrageriupptäcktsregler
- Kontaktdetektering och profilering
- Kostnad-fördelsanalys för implementering av stor data
Dag 1: Session 2: Introduktion till stor data 1
- Huvudkaraktäristiker hos stor data: volym, mångfald, hastighet och sanningsenlighet. MPP-arkitektur för volym.
- Datalagrar – statisk schemaläggning, långsamt utvecklande dataset
- MPP-databaser som Greenplum, Exadata, Teradata, Netezza, Vertica m.fl.
- Hadoop-baserade lösningar – inga villkor på struktur av dataset.
- Typiskt mönster: HDFS, MapReduce (crunch), hämtning från HDFS
- Batch-passande för analytiska/interaktiva uppgifter
- Volym: CEP strömmande data
- Typiska val – CEP-produkter (t.ex. Infostreams, Apama, MarkLogic m.fl.)
- Inte helt produktions redo – Storm/S4
- NoSQL-databaser – (kolumnär och nyckel-värde): Bästa som analytiskt tillägg till datalager/databas
Dag 1 : Session 3 : Introduktion till stor data 2
NoSQL-lösningar
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hierarkisk) - GT.m, Cache
- KV Store (Ordenad) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Objektdatabas - ZopeDB, DB40, Shoal
- Dokumentlagring - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databaser, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Bred Kolumnar Lagring - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Slags data: Introduktion till datarentningsproblem i stor data
- RDBMS – statisk struktur/schema, främjar inte en agil, utforskande miljö.
- NoSQL – semi-strukturerad, tillräcklig struktur för att lagra data utan exakt schema innan lagring
- Problem med datarentning
Dag 1 : Session-4 : Stor data introduktion 3 : Hadoop
- När ska Hadoop väljas?
- STRUKTURERAD - Enterprise-datalagrar/databaser kan lagra massiv data (med kostnad) men ålägger struktur (inte bra för aktiv utforskning)
- SEMI-STRUKTURERAD data – svårt att hantera med traditionella lösningar (DW/DB)
- Lager av data = ENORM insats och statisk även efter implementering
- För mångfald & volym av data, bearbetad på varuhuvudsdatorer – HADOOP
- Varuhuvuds H/W krävs för att skapa en Hadoop-cluster
Introduktion till Map Reduce /HDFS
- MapReduce – distribuera beräkningar över flera servrar
- HDFS – göra data tillgängligt lokalt för beräkningsprocessen (med redundans)
- Data – kan vara ostrukturerad/schema-lös (till skillnad från RDBMS)
- Utvecklarens ansvar att ge mening åt data
- Programmering av MapReduce = arbete med Java (för-/emot), manuell inläsning av data till HDFS
Dag 2: Session-1: Stor data ekosystem-Bygga stor data ETL: universum av stor dataverktyg - vilka att använda och när?
- Hadoop vs. Andra NoSQL-lösningar
- För interaktiv, slumpvis åtkomst till data
- Hbase (kolumnorienterad databas) ovanpå Hadoop
- Slumpvis åtkomst till data men med begränsningar (max 1 PB)
- Inte bra för ad-hoc analys, bra för loggning, räkning, tidsserier
- Sqoop - Import från databaser till Hive eller HDFS (JDBC/ODBC åtkomst)
- Flume – Strömdata (t.ex. loggdata) till HDFS
Dag-2: Session-2: Stor data hanteringssystem
- Rörliga delar, beräkningsnoder start/fel :ZooKeeper - För konfiguration/koordinering/namngivningstjänster
- Komplexa pipeline/workflow: Oozie – hantera workflow, beroenden, daisy chain
- Deployment, konfiguration, clustermanagement, uppgradering m.fl. (sysadmin) :Ambari
- I molnet : Whirr
Dag-2: Session-3: Prediktiv analys inom affärsanalys -1: Grundläggande tekniker & maskininlärning baserad BI :
- Introduktion till maskininlärning
- Lärande av klassificeringstekniker
- Bayesisk prediktion- förberedelse av träningsfil
- Stödvektormaskin
- KNN p-Tree Algebra & vertikal gruvning
- Neuralt nätverk
- Stor data stor variabel problem -Slumptog (RF)
- Stor data automatikproblem – Multi-modell ensemble RF
- Automatisering genom Soft10-M
- Textanalytikverktyg-Treeminer
- Agilt lärande
- Agent-baserat lärande
- Distribuerat lärande
- Introduktion till Open source verktyg för prediktiv analys : R, Rapidminer, Mahut
Dag-2: Session-4 Prediktiv analys eco-system-2: Vanliga prediktiva analysproblem i Govt.
- Insiktsanalys
- Visualiseringsanalys
- Strukturerad prediktiv analys
- Ostrukturerad prediktiv analys
- Kontaktbetrageri/tillhandahållare profilering
- Rekommendationsmotor
- Mönsterdetektering
- Regel/scenariouptäckt –fel, bedrägeri, optimering
- Rotorsak upptäckt
- Stämningsanalys
- CRM-analys
- Nätverksanalys
- Textanalys
- Teknikassisterad granskning
- Bedragerianalys
- Realtidsanalys
Dag 3 : Sesion-1 : Realtid och skalbar analys över Hadoop
- Varför vanliga analgalgoritmar misslyckas i Hadoop/HDFS
- Apache Hama- för Bulk Synchronous distribuerade beräkningar
- Apache SPARK- för clusterberäkningar för realtidsanalys
- CMU Graphics Lab2- Grafik-baserat asynkront tillvägagångssätt för distribuerade beräkningar
- KNN p-Algebra-baserat tillvägagångssätt från Treeminer för reducerad hårdvarukostnad
Dag-3: Session-2: Verktyg för eDiscovery och forensik
- eDiscovery över stor data vs. Legacydata – en jämförelse av kostnad och prestanda
- Prediktiv kodning och teknikassisterad granskning (TAR)
- Live demo av en TAR-produkt (vMiner) för att förstå hur TAR fungerar för snabbare upptäckt
- Snabbare indexering genom HDFS –hastighet av data
- NLP eller Natural Language processing –olika tekniker och open source-produkter
- eDiscovery i främmande språk-teknik för bearbetning av främmande språk
Dag 3 : Session 3: Stor data BI för Cybersäkerhet – Förståelse för hela 360-gradersvyer av snabb datainsamling till kontaktiden
- Förståelse för grunderna av säkerhetsanalys-angreppsytan, felkonfiguration, värdskydd
- Nätverksinfrastruktur/ Stora datapipor / Respons ETL för realtidsanalys
- Preskriptiv vs prediktiv – Fast regelbaserad vs auto-identifiering av kontaktregler från Meta data
Dag-3: Session 4: Stor data i USDA : Tillämpning inom jordbrukssektorn
- Introduktion till IoT (Internet of Things) för jordbruk-sensorbaserad stor data och kontroll
- Introduktion till satellitbilder och dess tillämpning inom jordbruket
- Integrering av sensor och bilddata för jordfruktbarhet, odlingsrekommendationer och prognoser
- Jordbruksförsäkring och stor data
- Skördetapp prognos
Dag 4 : Session-1: Bedrägeriprevention BI från stor data i Govt-Bedragerianalys:
- Grundläggande klassificering av bedrägerianalys- regelbaserad vs prediktiv analys
- Övervakat vs oövervakat maskininlärning för bedrägerimönsterdetektering
- Tillhandahållare bedrägeri/överprissättning för projekt
- Medicare och Medicaid bedrägeri- bedrägeriupptäcktsmetoder för ansökningshantering
- Resa ersättningsbedrägerier
- IRS refundbedrägerier
- Kasustudier och live demo kommer att ges där data är tillgänglig.
Dag 4 : Session-2: Sociala media analys- Underrättelseinsamling och analys
- Stor data ETL API för att extrahera sociala mediedata
- Text, bild, metadata och video
- Stämningsanalys från sociala medieflöde
- Kontextuellt och icket-kontextuellt filtrering av sociala medieflöde
- Sociala media Dashboard för att integrera mångfaldig sociala medier
- Automatisk profilering av sociala media-profiler
- Live demo av varje analys kommer att ges genom Treeminer-verktyget.
Dag 4 : Session-3: Stor data analys inom bildbehandling och video feeds
- Bildlagringstekniker inom stor data- Lagringslösning för data som överstiger petabytes
- LTFS och LTO
- GPFS-LTFS ( Laminerad lagringslösning för stor bilddata)
- Grundläggande bildanalys
- Objektkänning
- Bildsegmentering
- Rörelsespårning
- 3-D bildrekonstruktion
Dag 4: Session-4: Stor data tillämpningar i NIH:
- Nyckelområden inom Bio-informatik
- Meta-genomik och stor data gruvningsproblem
- Stor data prediktiv analys för Farmakogenomik, Metabolomik och Proteomik
- Stor data i downstream Genomik process
- Tillämpning av stor data prediktiv analys inom Folkhälsan
Stor data Dashboard för snabb tillgång till mångfaldig data och visning :
- Integration av befintliga applikationsplattformar med Stor data Dashboard
- Stor data hantering
- Kasustudie av Stor data Dashboard: Tableau och Pentaho
- Använd Stor data-app för att pusha positionsbaserade tjänster i Govt.
- Spårningssystem och hantering
Dag 5 : Session-1: Hur man motiverar stor data BI implementering inom en organisation:
- Definiera ROI för stor data implementering
- Kasustudier för sparande av analytikertid för insamling och förberedelse av Data –ökning i produktivitetsvinster
- Kasustudier av intäktsvinster från sparande på licensierad databaskostnad
- Intäktsvinster från positionsbaserade tjänster
- Sparande från bedrägeriprevention
- En integrerad kalkylbladsansats för att beräkna ungefärlig kostnad vs. Intäktsvinster/sparande från Stor data implementering.
Dag 5 : Session-2: Steg för steg procedur att ersätta legacydatabas till Stor data System:
- Förståelse för praktisk Stor data Migrationsväg
- Vilken viktig information som behövs innan arkitektur av en Stor data implementering
- Vilka olika sätt för att beräkna volym, hastighet, mångfald och sanningsenlighet av data
- Hur man uppskattar dataväxt
- Kasustudier
Dag 5: Session 4: Översikt av Stor Data-leverantörer och deras produkter. Q/A session:
- Accenture
- APTEAN (Formerly CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Formerly 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Part of EMC)
Krav
- Grundläggande kunskap om affärsdrift och datasystem inom din egen sektor i den offentliga sektorn
- Grundläggande förståelse för SQL/Oracle eller relationella databaser
- Grundläggande förståelse för statistik (på kalkylbladsnivå)
Vittnesmål (1)
Tränarens förmåga att anpassa kursen till organisationens krav, snarare än bara att hålla kursen för dess egen skull.
Masilonyane - Revenue Services Lesotho
Kurs - Big Data Business Intelligence for Govt. Agencies
Maskintolkat