Kom i kontakt
 Varaktighet 14 timmar

Kursplan

Introduktion till Gemini 3:s multimodalitet

  • Förmågor över text, bilder, ljud och video
  • Modellval och översikt över ändpunkter
  • Centrala begrepp inom multimodal resonans

Arbete med text och strukturerade indata

  • Strategier för prompting vid textgenerering
  • Metadata, kontextfönster och embeddings
  • Textbaserad orkestrering av multimodala uppgifter

Bildförståelse och visuella arbetsflöden

  • Bildanalys och -tolkning med Gemini 3
  • Skapande av verktyg för visuell sökning och taggning
  • Byggande av interaktioner från bild till text och text till bild

Behandling av ljudindata

  • Arbetsflöden för taligenkänning och transkription
  • Detektering och tolkning av ljudhändelser
  • Integrering av ljud med text och visuella indata

Vidointelligens och scenanalys

  • Ramför-ram- och kontinuerlig videoresonans
  • Skapande av verktyg för sammanfattning och extraktion av höjdpunkter
  • Automatisering och innehållsflöden baserade på video

Design av multimodala tillämpningsarkitekturer

  • Kombinering av flera indataformer i en pipeline
  • Latens, kostnad och beräkningsmässiga överväganden
  • Bästa praxis för skalbara multimodala system

Prototypning av multimodala tillämpningar

  • Hands-on skapande av multimodala prototyper
  • Snabb iteration med prompt engineering
  • Testning och förfining av användarupplevelseflöden

Utrullning av multimodala lösningar

  • Utrullningsstrategier och miljösättning
  • Övervakning av prestanda i praktiken
  • Säkerhets- och efterlevnadsoverväganden

Sammanfattning och nästa steg

Krav

  • En förståelse för moderna AI-koncept
  • Erfarenhet av Python eller JavaScript
  • Kunskap om REST API:er

Targetgrupp

  • Designers
  • Innehållsskapare
  • Tekniska produktteam

Antal deltagare


Pris per deltagare

Vittnesmål (1)

Kommande Kurser

Relaterade Kategorier