Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Varaktighet 14 timmar
Kursplan
Grundläggande kunskaper om Tencent Hunyuan i produktion
- Översikt över användningsfall för modellleverans med Tencent Hunyuan
- Produktionskaraktäristika hos stora MoE-modeller
- Gemensamma flaskhalsar gällande latens, genomströmning och kostnad
- Definiera tjänstenivåmål (SLO) för inferensarbetsbelastningar
Arkitektur för driftsättning och leveransflöde
- Komponenter i ett produktionsinferensstack
- Välja mellan behållarbaserad, on-premise- och molndriftsättningsmodeller
- Grundläggande principer för modellnedladdning, begärandestyrning (routing) och GPU-allokering
- Utforma lösningar för tillförlitlighet och operativ enkelhet
Latensoptimering i praktiken
- Användning av optimerade inferensmotorer som TensorRT där så är tillämpligt
- KV-cache-koncept och praktisk cachejustering
- Minska overhead för start, uppstart (warmup) och svar
- Mätning av tid till första token och hastighet vid tokengenerering
Genomströmning, batchning och GPU-effektivitet
- Strategier för kontinuerlig batchning och begärandebatchning
- Hantera koncurrentskap och köbeteende
- Förbättra GPU-utnyttjandet utan att försämra användarupplevelsen
- Hantera begärander med lång kontext och blandade arbetsbelastningar
Kvantisering och kostnadskontroll
- Varför kvantisering är viktigt för leverans i produktion
- Praktiska avvägningar mellan FP16, INT8 och andra vanliga precisionsoptioner
- Balanceera modellkvalitet, latens och infrastruktkostnad
- Upprätta en enkel kontrolllista för kostnadsoptimering
Operativ verksamhet, övervakning och beredskapsgranskning
- Autoskalningsutlösare för inferenstjänster
- Övervaka latens, genomströmning, cachanvändning och GPU-status
- Grundläggande principer för loggning, varningar och incidenthantering
- Granska en referensdriftsättning och skapa en förbättringsplan
Krav
- Grundläggande förståelse för driftsättning och arbetsflöden för inferens av stora språkmodeller
- Erfarenhet av behållare, moln eller on-premise-infrastruktur samt API-baserade tjänster
- Arbetsmässig kunskap i Python eller systemingenjörsuppgifter
Målgrupp
- ML-ingénjörer som driftsätter LLM:er i produktion
- Platform ingenjörer ansvariga för GPU-baserade inferenstjänster
- Lösningsarkitekter som utvecklar skalbara AI-plattformar för leverans