Kom i kontakt
 Varaktighet 21 timmar

Kursplan

Introduktion till multimodal AI och Ollama

  • Översikt över multimodalt lärande
  • Viktiga utmaningar med integration av syn och språk
  • Ollamas funktioner och arkitektur

Konfiguration av Ollama-miljön

  • Installation och konfigurering av Ollama
  • Arbetet med lokal modelldeployment
  • Integration av Ollama med Python och Jupyter

Arbete med multimodala indata

  • Integration av text och bilder
  • Incorporering av ljud och strukturerad data
  • Design av preprocessingspipelines

Applikationer för dokumentförståelse

  • Extraktion av strukturerad information från PDF:er och bilder
  • Kombinering av OCR med språkmodeller
  • Bygande av intelligenta flöden för dokumentanalys

Visuellt frågesvar (VQA)

  • Konfiguration av VQA-datasets och referensvärden
  • Träning och utvärdering av multimodala modeller
  • Byggande av interaktiva VQA-applikationer

Design av multimodala agenter

  • Principer för agentytes design med multimodalt resonemang
  • Kombinering av perception, språk och handling
  • Distribution av agenter för praktiska användningsfall

Avancerad integration och optimering

  • Finjustering av multimodala modeller med Ollama
  • Optimering av inferensprestanda
  • Skalbarhet och överväganden kring distribution

Sammanfattning och nästa steg

Krav

  • God förståelse för maskininlärningsbegrepp
  • Erfarenhet av djupinlärningsramverk såsom PyTorch eller TensorFlow
  • Behärskning av naturlig språkinformation och datorsyn

Målgrupp

  • Maskininlärningsingenjörer
  • AI-forskare
  • Produktutvecklare som integrerar flöden för syn och text

Antal deltagare


Pris per deltagare

Kommande Kurser

Relaterade Kategorier