Kom i kontakt
 Varaktighet 21 timmar

Kursplan

Introduktion till skalning av Ollama

  • Ollamas arkitektur och överväganden gällande skalning
  • Vanliga flaskhalsar i multi-användar-implementeringar
  • Bästa praxis för infrastrukturgenomförande

Resursallokation och GPU-optimering

  • Strategier för effektiv CPU-/GPU-utnyttjande
  • Överväganden gällande minne och bandbredd
  • Resursbegränsningar på container-nivå

Implementering med containrar och Kubernetes

  • Containerisering av Ollama med Docker
  • Körning av Ollama i Kubernetes-clustre
  • Lastbalansering och tjänsteupptäckt

Autoskalning och batchning

  • Design av autoskalningspolicyer för Ollama
  • Batchinferens-tekniker för optimering av genomströmning
  • Avvägning mellan latens och genomströmning

Optimering av latens

  • Profilering av inferensprestanda
  • Cachestrategier och modellwarm-up
  • Minimering av I/O- och kommunikationsöverhead

Övervakning och observerbarhet

  • Integrering av Prometheus för metrik
  • Byggande av instrumentpaneler med Grafana
  • Alarm och händelsehantering för Ollama-infrastruktur

Kostnadsstyrning och skalningsstrategier

  • Kostnadsmedveten GPU-allokation
  • Överväganden gällande moln- kontra on-prem-implementeringar
  • Strategier för hållbar skalning

Sammanfattning och nästa steg

Krav

  • Erfarenhet av Linux-systemadministration
  • Förståelse för containerisering och orkestrering
  • Kännedom om implementering av maskininlärningsmodeller

Targetgrupp

  • DevOps-ingenjörer
  • ML-infrastrukturteam
  • Site reliability engineers (SRE)

Antal deltagare


Pris per deltagare

Kommande Kurser

Relaterade Kategorier