Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Kursplan
AI-suveränitet och lokal distribution av LLM
- Risker med molnbaserade LLM: datalagring, träning på indata, främmande jurisdiktion.
- Ollamas arkitektur: modellserver, register och OpenAI-kompatibelt API.
- Jämförelse med vLLM, llama.cpp och Text Generation Inference.
- Modelllicensiering: villkor för Llama, Mistral, Qwen och Gemma.
Installation och hårdvaruinställning
- Installation av Ollama på Linux med CUDA- och ROCm-stöd.
- Fallback för CPU-enbart läge och AVX/AVX2-optimering.
- Docker-deplouering och mappning av beständiga volymer.
- Inställning med flera GPU:er och strategier för VRAM-allokering.
Modellhantering
- Hämta modeller från Ollamas register: ollama pull llama3.
- Importera GGUF-modeller från HuggingFace och TheBloke.
- Kvantifieringsnivåer: Q4_K_M, Q5_K_M, Q8_0 avvägningar.
- Växla mellan modeller och begränsningar för samtidig modellbelastning.
Avanserade Modelfiles
- Skrivning av Modelfile-syntax: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Justering av temperatur, top_p och repeat_penalty.
- Systempromptengineering för rollspecifikt beteende.
- Skapa och publicera anpassade modeller till lokalt register.
API-integration
- OpenAI-kompatibelt /v1/chat/completions-slutpunkt.
- Strömmande svar och JSON-läge.
- Integration med LangChain, LlamaIndex och anpassade appar.
- Autorisering och hastighetsbegränsning med omvänd proxy.
Prefereanstoptimering
- Storlek på kontextfönstret och hantering av KV-cache.
- Batch-inference och parallell hantering av begäranden.
- Allokering av CPU-trådar och medvetenhet om NUMA.
- Övervakning av GPU-användning och minnesbelastning.
Säkerhet och efterlevnad
- Nätverksisolering för endpoints som serverar modeller.
- Inputfiltrering och pipeline för outputmoderering.
- Ljudning av prompter och slutföranden i loggar.
- Modellursprung och hash-verifiering.
Krav
- Mellanliggande kunskaper i Linux och containeradministration.
- Förståelse för maskininlärning och transformer-modeller på hög nivå.
- Kunskap om REST-API:er och JSON.
Målgrupp
- AI-ingeniörer och utvecklare som ersätter molnbaserade LLM-API:er.
- Organisationer med känsliga data som förhindrar användning av molnmodeller.
- Regerings- och försvarsteam som kräver luftavskärmade språkmodeller.
14 Timmar