Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Varaktighet 21 timmar
Kursplan
Introduktion till multimodal AI och Ollama
- Översikt över multimodalt lärande
- Viktiga utmaningar med integration av syn och språk
- Ollamas funktioner och arkitektur
Konfiguration av Ollama-miljön
- Installation och konfigurering av Ollama
- Arbetet med lokal modelldeployment
- Integration av Ollama med Python och Jupyter
Arbete med multimodala indata
- Integration av text och bilder
- Incorporering av ljud och strukturerad data
- Design av preprocessingspipelines
Applikationer för dokumentförståelse
- Extraktion av strukturerad information från PDF:er och bilder
- Kombinering av OCR med språkmodeller
- Bygande av intelligenta flöden för dokumentanalys
Visuellt frågesvar (VQA)
- Konfiguration av VQA-datasets och referensvärden
- Träning och utvärdering av multimodala modeller
- Byggande av interaktiva VQA-applikationer
Design av multimodala agenter
- Principer för agentytes design med multimodalt resonemang
- Kombinering av perception, språk och handling
- Distribution av agenter för praktiska användningsfall
Avancerad integration och optimering
- Finjustering av multimodala modeller med Ollama
- Optimering av inferensprestanda
- Skalbarhet och överväganden kring distribution
Sammanfattning och nästa steg
Krav
- God förståelse för maskininlärningsbegrepp
- Erfarenhet av djupinlärningsramverk såsom PyTorch eller TensorFlow
- Behärskning av naturlig språkinformation och datorsyn
Målgrupp
- Maskininlärningsingenjörer
- AI-forskare
- Produktutvecklare som integrerar flöden för syn och text