Signal and Data Processing

fa معرفی شبکه های عصبی پیمانه ای عمیق با ساختار فضایی-زمانی دوگانه جهت بهبود بازشناسی گفتار پیوسته فارسی Deep Modular Neural Networks with Double Spatio-temporal َAssociation Structure for Persian Continuous Speech Recognition مقالات پردازش گفتار Paper پژوهشي Research در این مقاله به معرفی شبکه‌های عصبی پیمانه ای عمیق و قابل رشد به منظور بهبود بازشناسی گفتار پیوسته پرداخته می شود. ساختار این شبکه ها و روش‎های پیش‎تعلیم معرفی شده برای آنها بگونه ای است که درعین هماهنگی با ساختار گفتار، در حافظه و محاسبات لازم صرفه جویی میشود. بدلیل قابلیت رشد این ساختارها، می‌توان در تعلیم آنها اطلاعات فضایی-زمانی بردارهای بازنمایی در ورودی و اطلاعات فضایی-زمانی برچسب آوایی آنها را در خروجی شبکه عصبی انجمن کرد. شبکه تعلیم یافته با این ساختار انجمنگر فضایی-زمانی دوگانه، میتواند زیرفضای زنجیره های معتبر آوایی دادگان را یادبگیرد. بنابراین، در ساختار خود زنجیره های خروجی نامعتبر را پالایش کرده و زنجیره های درست را میدهد. جهت بررسی عملکرد این ساختارها، از دودسته دادگان گفتاری فارس دات و فارس دات بزرگ استفاده شد. نتایج آزمایش‎ها نشان می‌دهند که میتوان دقت بازشناسی آوا را برروی دادگان فارس دات تا 2.7% با استفاده از شبکه‌های عصبی پیمانه ای عمیق نسبت به مدل‌های مخفی مارکوف بالابرد. که با توسعه آنها به ساختار فضایی-زمانی دوگانه این نتیجه تا 5.1% بهبودمی یابد. بدلیل عدم وجود برچسب های آوایی برای دادگان بزرگ، یک روش تعلیم نیمه سرپرستی شده برای تعلیم شبکه های عصبی برروی این دادگان پیشنهاد شده است که میتواند به درصد بازشناسی قابل مقایسه ای با مدلهای مخفی مارکوف دست یابد. <p>In this article, growable deep modular neural networks for continuous speech recognition are introduced. These networks can be grown to implement the spatio-temporal information of the frame sequences at their input layer as well as their labels at the output layer at the same time. The trained neural network with such double spatio-temporal association structure can learn the phonetic sequence subspace. Therefore, it can filter out invalid phonetic sequences in its own structure and output valid sequences. To evaluate the performance of these growable neural networks, we used FARSDAT and BIG FARSDAT datasets. Experimental results on FARSDAT show that deep modular neural networks outperform the phone accuracy rate of GMM-HMM models with an absolute improvement of 2.7%. Moreover, developing deep modular neural networks to a double spatio-temporal association structure improves their result by 5.1%. As there is no phonetic labeling for BIG FARSDAT, a semi-supervised learning algorithm is proposed to fine-tune the neural network with double spatio-temporal structure on this dataset, which achieves a comparable result with HMMs.</p> شبکه های عصبی عمیق, شبکه های عصبی پیمانه ای, پیش تعلیم, تعلیم نیمه سرپرستی شده, بازشناسی گفتار پیوسته Deep neural networks, Modular neural networks, Pre-training, Semi-supervised learning, Continuous speech recognition 39 56 http://jsdp.rcisp.ac.ir/browse.php?a_code=A-10-625-1&slc_lang=fa&sid=1 Zohreh Ansari زهره انصاری z_ansari@aut.ac.ir 10031947532846002664 10031947532846002664 No Amirkabir University of Technology دانشگاه صنعتی امیرکبیر Ali Seyyedsalehi علی سید صالحی ssalehi@aut.ac.ir 10031947532846002665 10031947532846002665 Yes Amirkabir University of Technology دانشگاه صنعتی امیرکبیر