Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Kursplan
Översikt över taligenkänningstekniker
- Historia och utveckling av taligenkänning
- Akustiska modeller, språkmodeller och avkodning
- Modern arkitektur: RNN:er, transformers och Whisper
Ljudförbehandling och grunderna i transkribering
- Hantering av ljudformat och urvalsfrekvenser
- Rengöring, beskärning och segmentering av ljud
- Textgenerering från ljud: realtid jämfört med satsvis (batch)
Hands-on med Whisper och andra API:er
- Installation och användning av OpenAI Whisper
- Anrop av molnbaserade API:er (Google, Azure) för transkribering
- Jämförelse av prestanda, latens och kostnad
Språk, accenter och domänanpassning
- Arbetande med flera språk och accenter
- Anpassade ordförråd och tolerans för buller
- Hantering av juridiskt, medicinskt eller tekniskt språk
Utdataformatering och integration
- Lägga till tidsstämplar, interpunktion och talargestämpel
- Export till text, SRT eller JSON-format
- Integrering av transkriberingar i appar eller databaser
Laborationer för implementering av användningsscenarier
- Transkribering av möten, intervjuer eller podcast
- Tal-till-text-kommandosystem
- Realtidsundertextning för video-/ljudströmmar
Utvärdering, begränsningar och etik
- Noggrannhetsmått och modellmarkering (benchmarking)
- Partiskhet och rättvisa i talmodeller
- Överväganden kring sekretess och efterlevnad
Sammanfattning och nästa steg
Krav
- En förståelse för generella begrepp inom AI och maskininlärning
- Kännedom till ljud- eller mediafilformat och verktyg
Targetgrupp
- Datavetare och AI-ingenjörer som arbetar med röstdata
- Mjukvaruutvecklare som bygger transkriberingsbaserade applikationer
- Organisationer som utforskar taligenkänning för automatisering
14 Timmar