Kom i kontakt

Kursplan

Översikt över taligenkänningstekniker

  • Historia och utveckling av taligenkänning
  • Akustiska modeller, språkmodeller och avkodning
  • Modern arkitektur: RNN:er, transformers och Whisper

Ljudförbehandling och grunderna i transkribering

  • Hantering av ljudformat och urvalsfrekvenser
  • Rengöring, beskärning och segmentering av ljud
  • Textgenerering från ljud: realtid jämfört med satsvis (batch)

Hands-on med Whisper och andra API:er

  • Installation och användning av OpenAI Whisper
  • Anrop av molnbaserade API:er (Google, Azure) för transkribering
  • Jämförelse av prestanda, latens och kostnad

Språk, accenter och domänanpassning

  • Arbetande med flera språk och accenter
  • Anpassade ordförråd och tolerans för buller
  • Hantering av juridiskt, medicinskt eller tekniskt språk

Utdataformatering och integration

  • Lägga till tidsstämplar, interpunktion och talargestämpel
  • Export till text, SRT eller JSON-format
  • Integrering av transkriberingar i appar eller databaser

Laborationer för implementering av användningsscenarier

  • Transkribering av möten, intervjuer eller podcast
  • Tal-till-text-kommandosystem
  • Realtidsundertextning för video-/ljudströmmar

Utvärdering, begränsningar och etik

  • Noggrannhetsmått och modellmarkering (benchmarking)
  • Partiskhet och rättvisa i talmodeller
  • Överväganden kring sekretess och efterlevnad

Sammanfattning och nästa steg

Krav

  • En förståelse för generella begrepp inom AI och maskininlärning
  • Kännedom till ljud- eller mediafilformat och verktyg

Targetgrupp

  • Datavetare och AI-ingenjörer som arbetar med röstdata
  • Mjukvaruutvecklare som bygger transkriberingsbaserade applikationer
  • Organisationer som utforskar taligenkänning för automatisering
 14 Timmar

Antal deltagare


Pris per deltagare

Kommande Kurser

Relaterade Kategorier