Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Varaktighet 14 timmar
Kursplan
Designa en öppen AIOps-arkitektur
- Översikt över viktiga komponenter i öppna AIOps-pipelines
- Dataflöde från insamling till larmning
- Jämförelse av verktyg och integrationsstrategi
Insamling och aggregering av data
- Inläsning av tidsstampsdata med Prometheus
- Logginsamling med Logstash och Beats
- Normalisering av data för kors-källkorrelation
Bygga övervakningsdashboarder
- Visualisering av metrik med Grafana
- Bygga Kibana-dashboarder för logganalys
- Använda Elasticsearch-frågor för att extrahera driftinsikter
Avvikelsedetektering och incidentförutsägelse
- Exportera övervakningsdata till Python-pipelines
- Träna ML-modeller för avvikelseupptäckt och prognos
- Implementera modeller för liveinferens i övervakningspipelinan
Larmning och automatisering med öppna verktyg
- Skapa larmregler för Prometheus och Alertmanager-rutning
- Utlösa skript eller API-flöden för automatisk svarshantering
- Använda orkestreringsverktyg med öppen källkod (t.ex. Ansible, Rundeck)
Integration och skalbarhetsöverväganden
- Hantera hög volym vid insamling och långsiktig lagring
- Säkerhet och åtkomstkontroll i stackar med öppen källkod
- Skala varje lager oberoende: insamling, bearbetning, larmning
Realtidsanvändningsområden och utökningar
- Fallstudier: prestandaoptimering, förhindrande av driftstopp och kostnadsoptimering
- Utöka pipelines med spåringsverktyg eller tjänstegrafiker
- Bästa praxis för drift och underhåll av AIOps i produktion
Sammanfattning och nästa steg
Krav
- Erfarenhet med övervakningsverktyg som Prometheus eller ELK
- God kännedom om Python och grunderna i machine learning
- Förståelse för IT-drift och larmningsflöden
Målgrupp
- Erfarna site reliability engineers (SRE)
- Dataingenjörer som arbetar inom drift
- DevOps-plattformsledare och infrastrukturarkitekter