Kom i kontakt

Kursplan

AI-suveränitet och lokal distribution av LLM

  • Risker med molnbaserade LLM: datalagring, träning på indata, främmande jurisdiktion.
  • Ollamas arkitektur: modellserver, register och OpenAI-kompatibelt API.
  • Jämförelse med vLLM, llama.cpp och Text Generation Inference.
  • Modelllicensiering: villkor för Llama, Mistral, Qwen och Gemma.

Installation och hårdvaruinställning

  • Installation av Ollama på Linux med CUDA- och ROCm-stöd.
  • Fallback för CPU-enbart läge och AVX/AVX2-optimering.
  • Docker-deplouering och mappning av beständiga volymer.
  • Inställning med flera GPU:er och strategier för VRAM-allokering.

Modellhantering

  • Hämta modeller från Ollamas register: ollama pull llama3.
  • Importera GGUF-modeller från HuggingFace och TheBloke.
  • Kvantifieringsnivåer: Q4_K_M, Q5_K_M, Q8_0 avvägningar.
  • Växla mellan modeller och begränsningar för samtidig modellbelastning.

Avanserade Modelfiles

  • Skrivning av Modelfile-syntax: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Justering av temperatur, top_p och repeat_penalty.
  • Systempromptengineering för rollspecifikt beteende.
  • Skapa och publicera anpassade modeller till lokalt register.

API-integration

  • OpenAI-kompatibelt /v1/chat/completions-slutpunkt.
  • Strömmande svar och JSON-läge.
  • Integration med LangChain, LlamaIndex och anpassade appar.
  • Autorisering och hastighetsbegränsning med omvänd proxy.

Prefereanstoptimering

  • Storlek på kontextfönstret och hantering av KV-cache.
  • Batch-inference och parallell hantering av begäranden.
  • Allokering av CPU-trådar och medvetenhet om NUMA.
  • Övervakning av GPU-användning och minnesbelastning.

Säkerhet och efterlevnad

  • Nätverksisolering för endpoints som serverar modeller.
  • Inputfiltrering och pipeline för outputmoderering.
  • Ljudning av prompter och slutföranden i loggar.
  • Modellursprung och hash-verifiering.

Krav

  • Mellanliggande kunskaper i Linux och containeradministration.
  • Förståelse för maskininlärning och transformer-modeller på hög nivå.
  • Kunskap om REST-API:er och JSON.

Målgrupp

  • AI-ingeniörer och utvecklare som ersätter molnbaserade LLM-API:er.
  • Organisationer med känsliga data som förhindrar användning av molnmodeller.
  • Regerings- och försvarsteam som kräver luftavskärmade språkmodeller.
 14 Timmar

Antal deltagare


Pris per deltagare

Kommande Kurser

Relaterade Kategorier