Kom i kontakt

Kursplan

Grundläggande kunskaper om Tencent Hunyuan i produktion

  • Översikt över användningsfall för modellleverans med Tencent Hunyuan
  • Produktionskaraktäristika hos stora MoE-modeller
  • Gemensamma flaskhalsar gällande latens, genomströmning och kostnad
  • Definiera tjänstenivåmål (SLO) för inferensarbetsbelastningar

Arkitektur för driftsättning och leveransflöde

  • Komponenter i ett produktionsinferensstack
  • Välja mellan behållarbaserad, on-premise- och molndriftsättningsmodeller
  • Grundläggande principer för modellnedladdning, begärandestyrning (routing) och GPU-allokering
  • Utforma lösningar för tillförlitlighet och operativ enkelhet

Latensoptimering i praktiken

  • Användning av optimerade inferensmotorer som TensorRT där så är tillämpligt
  • KV-cache-koncept och praktisk cachejustering
  • Minska overhead för start, uppstart (warmup) och svar
  • Mätning av tid till första token och hastighet vid tokengenerering

Genomströmning, batchning och GPU-effektivitet

  • Strategier för kontinuerlig batchning och begärandebatchning
  • Hantera koncurrentskap och köbeteende
  • Förbättra GPU-utnyttjandet utan att försämra användarupplevelsen
  • Hantera begärander med lång kontext och blandade arbetsbelastningar

Kvantisering och kostnadskontroll

  • Varför kvantisering är viktigt för leverans i produktion
  • Praktiska avvägningar mellan FP16, INT8 och andra vanliga precisionsoptioner
  • Balanceera modellkvalitet, latens och infrastruktkostnad
  • Upprätta en enkel kontrolllista för kostnadsoptimering

Operativ verksamhet, övervakning och beredskapsgranskning

  • Autoskalningsutlösare för inferenstjänster
  • Övervaka latens, genomströmning, cachanvändning och GPU-status
  • Grundläggande principer för loggning, varningar och incidenthantering
  • Granska en referensdriftsättning och skapa en förbättringsplan

Krav

  • Grundläggande förståelse för driftsättning och arbetsflöden för inferens av stora språkmodeller
  • Erfarenhet av behållare, moln eller on-premise-infrastruktur samt API-baserade tjänster
  • Arbetsmässig kunskap i Python eller systemingenjörsuppgifter

Målgrupp

  • ML-ingénjörer som driftsätter LLM:er i produktion
  • Platform ingenjörer ansvariga för GPU-baserade inferenstjänster
  • Lösningsarkitekter som utvecklar skalbara AI-plattformar för leverans
 14 Timmar

Antal deltagare


Pris per deltagare

Kommande Kurser

Relaterade Kategorier