Kom i kontakt
 Varaktighet 14 timmar

Kursplan

Inledning till tal syntes och röstkloning

  • Översikt över text till tal (TTS) och neural röst syntes
  • Röstkloning jämfört med talgenerering: användningsområden och gränser
  • Viktiga modeller: Tacotron, WaveNet, FastSpeech, VITS

Att arbeta med kommersiella plattformar

  • Användning av ElevenLabs och Resemble AI
  • Skapande, kloning och redigering av röster
  • API-åtkomst och text till tal-flöden

Byggande med open source-verktyg

  • Installation och konfiguration av Coqui TTS
  • Utbildning av anpassade röster och hantering av datasets
  • Generering av tal med fin justering (tonhöjd, hastighet, känsla)

Dataförberedelse och hantering av röstdatasets

  • Insamling och rensning av röstexempel
  • Segmentering, etikettering och justering av transkriptioner
  • Etisk sourcing och röstmedgivande

Tillämpningsintegrering

  • Inbäddning av TTS i webbplatser och tillämpningar
  • Skapande av IVR-system och interaktiva botar
  • Generering av syntetisk dialog för video och spel

Utvärdering av kvalitet och realism

  • MOS (Mean Opinion Score) och förståelighetstester
  • Styra uttrycksskå och prosodi
  • Jämförelse av latens, lojalitet och realism

Etiska, rättsliga och styrelserelaterade överväganden

  • Deepfake-risker och ansvarsfull användning
  • Medgivande, tillhörighet och implikationer av upphovsrätt
  • Regler och organisationspolicyer

Sammanfattning och nästa steg

Krav

  • Förståelse för grundläggande maskininlärning
  • Bekantskap med ljudfiler och redigeringsverktyg
  • Grundläggande kunskaper i Python-programmering

Målgrupp

  • AI-utvecklare och ingenjörer intresserade av tal syntes
  • Innehållsskapare och medieteknologer som utforskar röstgenerering
  • FoU-team som bygger personliga eller dynamiska ljudsystem

Antal deltagare


Pris per deltagare

Kommande Kurser

Relaterade Kategorier