Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Varaktighet 21 timmar
Kursplan
Introduktion till skalning av Ollama
- Ollamas arkitektur och överväganden gällande skalning
- Vanliga flaskhalsar i multi-användar-implementeringar
- Bästa praxis för infrastrukturgenomförande
Resursallokation och GPU-optimering
- Strategier för effektiv CPU-/GPU-utnyttjande
- Överväganden gällande minne och bandbredd
- Resursbegränsningar på container-nivå
Implementering med containrar och Kubernetes
- Containerisering av Ollama med Docker
- Körning av Ollama i Kubernetes-clustre
- Lastbalansering och tjänsteupptäckt
Autoskalning och batchning
- Design av autoskalningspolicyer för Ollama
- Batchinferens-tekniker för optimering av genomströmning
- Avvägning mellan latens och genomströmning
Optimering av latens
- Profilering av inferensprestanda
- Cachestrategier och modellwarm-up
- Minimering av I/O- och kommunikationsöverhead
Övervakning och observerbarhet
- Integrering av Prometheus för metrik
- Byggande av instrumentpaneler med Grafana
- Alarm och händelsehantering för Ollama-infrastruktur
Kostnadsstyrning och skalningsstrategier
- Kostnadsmedveten GPU-allokation
- Överväganden gällande moln- kontra on-prem-implementeringar
- Strategier för hållbar skalning
Sammanfattning och nästa steg
Krav
- Erfarenhet av Linux-systemadministration
- Förståelse för containerisering och orkestrering
- Kännedom om implementering av maskininlärningsmodeller
Targetgrupp
- DevOps-ingenjörer
- ML-infrastrukturteam
- Site reliability engineers (SRE)