Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Varaktighet 14 timmar
Kursplan
Inledning till tal syntes och röstkloning
- Översikt över text till tal (TTS) och neural röst syntes
- Röstkloning jämfört med talgenerering: användningsområden och gränser
- Viktiga modeller: Tacotron, WaveNet, FastSpeech, VITS
Att arbeta med kommersiella plattformar
- Användning av ElevenLabs och Resemble AI
- Skapande, kloning och redigering av röster
- API-åtkomst och text till tal-flöden
Byggande med open source-verktyg
- Installation och konfiguration av Coqui TTS
- Utbildning av anpassade röster och hantering av datasets
- Generering av tal med fin justering (tonhöjd, hastighet, känsla)
Dataförberedelse och hantering av röstdatasets
- Insamling och rensning av röstexempel
- Segmentering, etikettering och justering av transkriptioner
- Etisk sourcing och röstmedgivande
Tillämpningsintegrering
- Inbäddning av TTS i webbplatser och tillämpningar
- Skapande av IVR-system och interaktiva botar
- Generering av syntetisk dialog för video och spel
Utvärdering av kvalitet och realism
- MOS (Mean Opinion Score) och förståelighetstester
- Styra uttrycksskå och prosodi
- Jämförelse av latens, lojalitet och realism
Etiska, rättsliga och styrelserelaterade överväganden
- Deepfake-risker och ansvarsfull användning
- Medgivande, tillhörighet och implikationer av upphovsrätt
- Regler och organisationspolicyer
Sammanfattning och nästa steg
Krav
- Förståelse för grundläggande maskininlärning
- Bekantskap med ljudfiler och redigeringsverktyg
- Grundläggande kunskaper i Python-programmering
Målgrupp
- AI-utvecklare och ingenjörer intresserade av tal syntes
- Innehållsskapare och medieteknologer som utforskar röstgenerering
- FoU-team som bygger personliga eller dynamiska ljudsystem