Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Varaktighet 14 timmar
Kursplan
Introduktion till Gemini 3:s multimodalitet
- Förmågor över text, bilder, ljud och video
- Modellval och översikt över ändpunkter
- Centrala begrepp inom multimodal resonans
Arbete med text och strukturerade indata
- Strategier för prompting vid textgenerering
- Metadata, kontextfönster och embeddings
- Textbaserad orkestrering av multimodala uppgifter
Bildförståelse och visuella arbetsflöden
- Bildanalys och -tolkning med Gemini 3
- Skapande av verktyg för visuell sökning och taggning
- Byggande av interaktioner från bild till text och text till bild
Behandling av ljudindata
- Arbetsflöden för taligenkänning och transkription
- Detektering och tolkning av ljudhändelser
- Integrering av ljud med text och visuella indata
Vidointelligens och scenanalys
- Ramför-ram- och kontinuerlig videoresonans
- Skapande av verktyg för sammanfattning och extraktion av höjdpunkter
- Automatisering och innehållsflöden baserade på video
Design av multimodala tillämpningsarkitekturer
- Kombinering av flera indataformer i en pipeline
- Latens, kostnad och beräkningsmässiga överväganden
- Bästa praxis för skalbara multimodala system
Prototypning av multimodala tillämpningar
- Hands-on skapande av multimodala prototyper
- Snabb iteration med prompt engineering
- Testning och förfining av användarupplevelseflöden
Utrullning av multimodala lösningar
- Utrullningsstrategier och miljösättning
- Övervakning av prestanda i praktiken
- Säkerhets- och efterlevnadsoverväganden
Sammanfattning och nästa steg
Krav
- En förståelse för moderna AI-koncept
- Erfarenhet av Python eller JavaScript
- Kunskap om REST API:er
Targetgrupp
- Designers
- Innehållsskapare
- Tekniska produktteam
Vittnesmål (1)
Flöde, känsla och ämne i presentationen
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kurs - Google Gemini AI for Data Analysis
Maskintolkat