Acoustic model and language model adaptation for a mobile dictation service

dc.contributorAalto-yliopistofi
dc.contributorAalto Universityen
dc.contributor.advisorKurimo, Mikko
dc.contributor.authorMansikkaniemi, André
dc.contributor.schoolElektroniikan, tietoliikenteen ja automaation tiedekuntafi
dc.contributor.supervisorSams, Mikko
dc.date.accessioned2012-03-12T06:47:55Z
dc.date.available2012-03-12T06:47:55Z
dc.date.issued2010
dc.description.abstractAutomatisk taligenkänning är en maskinstyrd metod genom vilken tal omvandlas till text. MobiDic är en mobil dikteringstjänst som använder ett serverbaserat automatiskt taligenkänningssystem för att omvandla tal inspelat på en mobiltelefon till läsbara och editerbara textdokument. I detta arbete undersöktes förmågan hos Tekniska Högskolans taligenkänningssystem att omvandla juridik-relaterat tal inspelat på en mobiltelefon med MobiDics klientprogram till korrekt text. Det fanns skillnader mellan test- och träningsdata gällande både akustik och språk. De akutiska bakgrundsmodellerna var tränade med tal som hade spelats in på en datormikrofon. Språkmodellerna var tränade med text från olika tidningar och nyhetstjänster. På grund av testdatans speciella karaktär har tyngdpunkten i arbetet legat på att förbättra taligenkänningsförmågan hos systemet genom adaptering av akustiska modeller och språkmodeller. Adaptering av akustiska modeller ger de bästa och pålitligaste resultaten i syftet att förbättra taligenkänningsförmågan. Genom att använda den globala cMLLR-metoden och endast 2 minuter av adapteringsdata kan man förminska antalet feltolkade ord med 15-22%. Genom att använda den regressionsklassbaserade cMLLR-metoden kan man uppnåytterligare förbättringar i taligenkänningsförmågan om det finns större mängder av adapteringsdata (> 10 min.) tillgängligt. Adaptering av språkmodellen gav ingen betydande förbättring av taligenkännings förmågan. Det främsta problemet var de stora skillnaderna mellan språkadapteringsdata och språket som förekom i de juridik-relaterade talinspelningarna.sv
dc.description.abstractAutomatic speech recognition is the machine-based method of converting speech to text. MobiDic is a mobile dictation service which uses a server-side speech recognition system to convert speech recorded on a mobile phone to readable and editable text notes. In this work, performance of the TKK speech recognition system has been evaluated on law-related speech recorded on a mobile phone with the MobiDic client application. There was mismatch between testing and training data in terms of both of acoustics and language. The background acoustic models were trained on speech recorded on PC microphones. The background language models were trained on texts from journals and news wire services. Because of the special nature of the testing data, main focus has been on using acoustic model and language model adaptation methods to enhance speech recognition performance. Acoustic model adaptation gives the highest and most reliable performance increase. Using the global cMLLR method, word error rate reductions between 15-22% can be reached with only 2 minutes of adaptation data. Regression class cMLLR can give even higher performance boosts if larger sets of audio adaptation data (> 10 min) are available. Language model adaptation was not able to significantly improve performance in this task. The main problems were differences between language adaptation data and language of the law-related speech data.en
dc.format.extent[3] + 70
dc.format.mimetypeapplication/pdf
dc.identifier.urihttps://aaltodoc.aalto.fi/handle/123456789/3176
dc.identifier.urnURN:NBN:fi:aalto-201203131407
dc.language.isoenen
dc.locationP1fi
dc.programme.majorLaskennallinen tekniikkafi
dc.programme.mcodeS-114
dc.publisherAalto Universityen
dc.publisherAalto-yliopistofi
dc.rights.accesslevelopenAccess
dc.subject.keywordautomatic speech recognitionen
dc.subject.keywordmobile dictationen
dc.subject.keywordacoustic model adaptationen
dc.subject.keywordlanguage model adaptationen
dc.subject.keywordautomatisk taligenk anningsv
dc.subject.keywordmobil dikteringsv
dc.subject.keywordadaptering av akustiska modellersv
dc.subject.keywordadaptering av språkmodellersv
dc.titleAcoustic model and language model adaptation for a mobile dictation serviceen
dc.titleAdaptering av akustiska modeller och språkmodeller för en mobil dikteringstjänsten
dc.typeG2 Pro gradu, diplomityöfi
dc.type.dcmitypetexten
dc.type.okmG2 Pro gradu, diplomityö
dc.type.ontasotDiplomityöfi
dc.type.ontasotMaster's thesisen
dc.type.publicationmasterThesis
local.aalto.digifolderAalto_89999
local.aalto.idinssi39404
local.aalto.openaccessyes

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
urn100143.pdf
Size:
645.82 KB
Format:
Adobe Portable Document Format