Global ETD Search

41	Reconhecimento de fala contínua para o Português Brasileiro em sistemas embarcados. / Continuous speech recognition for Brazilian Portuguese in embedded systems. SILVA, Daniella Dias Cavalcante da. 30 July 2018 (has links) Submitted by Johnny Rodrigues (johnnyrodrigues@ufcg.edu.br) on 2018-07-30T21:22:20Z No. of bitstreams: 1 DANIELLA DIAS CAVALCANTE DA SILVA - TESE PPGEE 2011..pdf: 21267862 bytes, checksum: 34609e6f0c5b3d3d5dbe954562ec3132 (MD5) / Made available in DSpace on 2018-07-30T21:22:20Z (GMT). No. of bitstreams: 1 DANIELLA DIAS CAVALCANTE DA SILVA - TESE PPGEE 2011..pdf: 21267862 bytes, checksum: 34609e6f0c5b3d3d5dbe954562ec3132 (MD5) Previous issue date: 2011-12 / Com o advento da tecnologia, as máquinas predominam em quase todos os cenários do cotidiano das pessoas, sejam essas máquinas computadores, eletrodomésticos, dispositivos portáteis, etc. Com isso, nada melhor do que dotá-las com a capacidade de percepção e compreensão da voz humana, que é a forma mais simples, natural e eficaz do ser humano expressar seus pensamentos. Apesar de muitas pesquisas na área de Processamento Digital de Sinais de Voz (PDSV) terem permitido o desenvolvimento de sistemas de Reconhecimento de Faia bastante eficientes, requisitos de processamento ainda dificultam a implementação desses sistemas em dispositivos com pequeno poder computacional, como celulares, palmtops e eíetrodomésticos. Para permitir a implementação de sistemas de Reconhecimento de Faia nesse contexto, alguns trabalhos sacrificam a eficiência no processo de reconhecimento em nome da redução do tamanho físico e de exigências computacionais. Assim, a busca por modelagens acústicas e linguísticas othnizadas, associadas ao uso de bases de dados representativas, pode levar a ura compromisso entre desempenho do sistema em termos de taxas de reconhecimento e exigências computacionais impostas por sistemas embarcados. O objetivo principal deste trabalho consiste na modelagem da arquitetura de um sistema de reconhecimento de fala contínua para o português brasileiro, utilizando Modelos Ocultos de Markov, de forma a possibilitar sua implementação em um sistema embarcado com recursos computacionais limitados. A fim de selecionar a configuração que melhor atenda esse objetivo, foram realizados experimentos e análises, de modo a identificar possíveis adaptações, a partir de simplificações matemáticas e redução de parâmetros nas etapas do processo de reconhecimento. Em todo lho, foi considerada a relação entre a taxa de reconhecimento e o custo computacional. A arquitetura do sistema embarcado desenvolvida e o seu processo de modelagem, incluindo os experimentos, as análises e os seus respectivos resultados, serão apresentados e discutidos no decorrer deste documento. / WIth the advent of technology, machines predominate in aímost ali seenarios of everyday life. The possibiiity of performing human-maehine comniunication through speech makes this interact.ion easier and more productive. However, processing requirements still difficult tlíe implementation oF systems for automatic continuous speech recognition on devices with low computational power sucJi as mobile phones, palmtops and appliances. To allow the implementation of speech recognition systems in this context. some works sacrifice efficiency in the recognition process for redueing the chip area and computational requirements. For this purpose, it becomes necessary to research for optimized acoustic and language modeling, associated with use of representative databases, looking for a good compromise between recognitioa vaies and compuiational demands imposed by embedded systems. The main goai of this work is to model the architecture of a system for continuous speech recognition Brazilian Portuguese, in order to enable its implementation in an embedded system with limited computtng resources. In order to select the setting that best nieets this goal, experiments and analysis were performed. The purpose of these was to identify possible adaptations, from mathematical simpiifícations and reduction of parameters in the steps of the recognition process. During the deveiopinent of this work, the relationship between recognition rate and computational cost was considered. The embedded system architecture developed and its modeling process, including experiments. analysis and their results will be presented and díscussed thxoughout this document. Engenharia Elétrica. Engenharia de Software. Ciência da Computação. Reconhecimento de voz Fala contínua Sistemas embarcados Reconhecimento de fala contínua Modelos ocultos de Markov Processamento de sinais de voz Português Brasileiro Modelagem do sinal de voz Modelagem linguística Modelagem da pronúncia Modelagem acústica Sistemas de reconhecimento de voz Sistemas de reconhecimento vocal Voice recognition systems
42	Aplica??o do m?todo de fus?o para verifica??o de locutor independente de texto Silva, Mayara Ferreira da 10 July 2015 (has links) Submitted by Setor de Tratamento da Informa??o - BC/PUCRS (tede2@pucrs.br) on 2016-01-04T17:56:48Z No. of bitstreams: 1 DIS_MAYARA_FERREIRA_DA_SILVA_COMPLETO.pdf: 2803272 bytes, checksum: 9305b74451ec83ddca38d1c444ffb3dd (MD5) / Made available in DSpace on 2016-01-04T17:56:48Z (GMT). No. of bitstreams: 1 DIS_MAYARA_FERREIRA_DA_SILVA_COMPLETO.pdf: 2803272 bytes, checksum: 9305b74451ec83ddca38d1c444ffb3dd (MD5) Previous issue date: 2015-07-10 / Coordena??o de Aperfei?oamento de Pessoal de N?vel Superior - CAPES / This work presents an overview of text independent speaker verification, describing the basic operation of the system and the reviewing some important developments in speaker modeling and feature extraction from speech. Following, a point of improvement identified within the feature extraction stage leads to the main objective of this work: to determine one or more sets of coefficients relevant to speaker discrimination while minimizing the equal error rate (EER). The proposal is to replace the delta(?) and double-delta(??) coefficients by a linear predictor code (LPC) for the mel frequency cepstral coefficients (MFCC). In addition, score level fusion is employed to combine the ouputs of MFCC-only and MFCC-LPC systems, as well as MFCC-only and MFCC-?-?? systems. In all cases, performance is evaluated with respect to variations of the signal to noise-ratio (SNR) in the tested audio. In addition, the work introduces a new Brazilian Portuguese speech repository containing free-speech from 155 males. Results and discussions are presented with a reflection on the expected outcomes, as well as general comments and observations. Finally, concludings remarks are made about the work, featuring future prospects regarding text independent speaker verification research. This work attained a 4% reduction in the EER compared to the reference system (MFCC-only), with best results occuring in the case fusion of MFCC-only and MFCC-?-?? scores. / Este trabalho apresenta uma vis?o geral acerca de verifica??o de locutor independente de texto, demonstrando o funcionamento b?sico do sistema e as principais refer?ncias de m?todos j? utilizados ao longo de anos para extra??o de caracter?sticas da fala e modelamento do locutor. Detectado um ponto a ser trabalhado dentro da etapa de extra??o de caracter?sticas, objetiva-se determinar coeficientes ou um conjunto destes relevantes para discrimina??o do locutor, com o intuito de minimizar a EER (Equal Error Rate). A proposta consiste em substituir os coeficientes delta(?) e double-delta(?2) por coeficientes de um preditor LPC (Linear Predictor Coding) o qual realiza a predi??o dos coeficientes MFCC (Mel Frequency Cepstral Coeficients). Al?m disso, aplica-se uma fus?o a n?vel de score em fun??o de sistemas baseados em MFCC e LPC. Outra an?lise discutida no trabalho ? a fus?o de um sistema MFCC com ? e ??. Um t?pico tamb?m avaliado ? com rela??o a varia??es de SNRs (Signal to Noise Ratios) nos ?udios testados. Al?m disso, ? elaborado um banco de falas em portugu?s brasileiro. Por fim, s?o expostos os resultados obtidos e ? feita a an?lise dos mesmos, a fim de refletir sobre o que era esperado e levantar alguns coment?rios. Enfim, s?o feitas as considera??es a respeito do trabalho, e elencadas as perspectivas futuras em torno das pesquisas de verifica??o de locutor independente de texto. Com este trabalho atingiu-se uma redu??o de 4% na taxa de erro igual (EER) em compara??o ao sistema de refer?ncia, sendo que os melhores resultados foram apresentados pelo sistema que realiza um fus?o do sistema MFCC com o ? e ??. ENGENHARIA EL?TRICA REDES NEURAIS (COMPUTA??O) RELA??O HOMEM-M?QUINA RECONHECIMENTO DE VOZ (INFORM?TICA) SINTETIZADORES DE VOZ (INFORM?TICA) PROCESSAMENTO DE VOZ - T?CNICAS DIGITAIS ENGENHARIAS
43	[en] SPEECH RECOGNITION IN NOISE ENVIRONMENT / [es] RECONOCIMIENTO DE VOZ EN PRESCENCIA DE RUIDO / [pt] RECONHECIMENTO DE VOZ EM PRESENÇA DE RUÍDO DEBORA ANDREA DE OLIVEIRA SANTOS 02 October 2001 (has links) [pt] Este trabalho apresenta um estudo comparativo de três técnicas de melhoria das taxas de reconhecimento de voz em ambiente adverso, a saber: Normalização da Média Cepestral (CMN), Subtração Espectral e Regressão Linear no Sentido da Máxima Verossimilhança (MLLR), aplicadas isoladamente e em concomitância, duas a duas. Os testes são realizados usando um sistema simples: reconhecimento de palavras isoladas (dígitos de zero a nove, e meia), modo dependente do locutor, modelos ocultos de Markov do tipo contínuo, e vetores de atributos com doze coeficientes cepestrais derivados da análise de predição linear. São adotados três tipos de ruído (gaussiano branco, falatório e de fábrica) em nove razões sinal-ruído diferentes. Os resultados experimentais demonstram que o emprego isolado das técnicas de reconhecimento robusto é, em geral, vantajoso, pois nas diversas razões sinal-ruído para as quais os testes são efetuados, quando as taxas de reconhecimento não sofrem um acréscimo, mantém-se as mesmas obtidas quando não se aplica nenhum método de aumento da robustez. Analisando-se comparativamente as implementações isoladas e simultânea das técnicas, constata-se que a simultânea nem sempre é atraente, dependendo da dupla empregada. Apresentam-se, ainda, os resultados decorrentes do uso de modelos ruidosos, observando-se que, embora sejam inegavelmente melhores, sua utilização é inviável na prática. Das técnicas implementadas, a que representa resultados mais próximos ao emprego de modelos ruidosos é a MLLR, seguida pela CMN, e por último pela Subtração Espectral. Estas últimas, embora percam em desempenho para a primeira, apresentam como vantagem a simplicidade e a generalidade. No que concerne as técnicas usadas concomitantemente, a dupla Subtração Espectral e MLLR é a considerada de melhor performance, pois mostra-se conveniente em relação ao emprego isolado de ambos os métodos, o que nem sempre ocorre com o uso de outras combinações das técnicas individuais. / [en] This work presents a comparative study of three techniques for improving the speech recognition rates in adverse environment, namely: Cepstral Mean Normalization (CMN), Spectral Subtraction and Maximum Likelihood Linear Regression (MLLR). They are implemented in two ways: separately and in pairs. The tests are carried out on a simple system: recognition of isolated words (digits from zero to nine, and the word half), speaker-dependent mode, continuous hidden Markov models, and speech feature vectors with twelve cepstral coefficients derived from linear predictive analysis. Three types of noise are considered (the white one, voice babble and from factory) at nine different signal-to-noise ratios. Experimental result demonstrate that it is worth using separately the techniques of robust recognition. This is because for all signal-to-noise conditions when the recognition accuracy is not improved it is the same one obtained when no method for increasing the robustness is applied. Analyzing comparatively the isolated and simultaneous applications of the techniques, it is verified that the later is not always more attractive than the former one. This depends on the pair of techniques. The use of noisy models is also considered. Although it presents better results, it is not feasible to implement in pratical situations. Among the implemented techniques, MLLR presents closer results to the ones obtaneid with noisy models, followed by CMN, and, at last, by Spectral Subtraction. Although the two later ones are beaten by the first, in terms of recognition accuracy, their advantages are the simplicity and the generality. The use of simultaneous techniques reveals that the pair Spectral Subtraction and MLLR is the one with the best performance because it is superior in comparison with the individual use of both methods. This does not happen with other combination of techniques. / [es] Este trabajo presenta un estudio comparativo de tres técnicas de mejoría de las tasas de reconocimiento de voz en ambiente adverso, a saber: Normalización de la Media Cepextral (CMN), Substracción Espectral y Regresión Lineal en el Sentido de la Máxima Verosimilitud (MLLR), aplicadas separada y conjuntamente, dos a dos. Las pruebas son realizados usando un sistema simple: reconocimiento de palabras aisladas (dígitos de cero al nueve, y media), de modo dependiente del locutor, modelos ocultos de Markov de tipo contínuo, y vectores de atributos con doce coeficientes cepextrales derivados del análisis de predicción lineal. Se adoptan tres tipos de ruido (gausiano blanco, parlatorio y de fábrica) en nueve razones señal- ruido diferentes. Los resultados experimentales demuestran que el empleo aislado de las técnicas de reconocimiento robusto es, en general, ventajoso, pues en las diversas relaciones señal ruido para las cuales las pruebas son efetuadas, cuando la tasa de reconocimiento no aumenta, manteniendo las mismas tasas cuando no se aplica ningún método de aumento de robustez. Analizando comparativamente las implementaciones aisladas y simultáneas de las técnicas, se constata que no siempre la simultánea resulta atractiva, dependiendo de la dupla utilizada. Se presentan además los resultados al utilizar modelos ruidosos, observando que, aunque resultan mejores, su utilización em la práctica resulta inviable. De las técnicas implementadas, la que presenta resultados más próximos al empleo de modelos ruidosos es la MLLR, seguida por la CMN, y por último por la Substracción Espectral. Estas últimas, aunque tienen desempeño peor que la primera, tienen como ventaja la simplicidad y la generalidad. En lo que se refiere a las técnicas usadas concomitantemente, la dupla Substracción Espectral y MLLR es la de mejor performance, pues se muestra conveniente en relación al empleo aislado de ambos métodos, lo que no siempre ocurre con el uso de otras combinaciones de las técnicas individuales. [pt] RUIDO [en] NOISE [pt] NORMALIZACAO DA MEDIA CEPESTRAL [en] CEPSTRAL MEAN NORMALIZATION [pt] SUBTRACAO ESPECTRAL [en] SPECTRAL SUBTRACTION [pt] RECONHECIMENTO DE VOZ [en] SPEECH RECOGNITION
44	[en] CONTINUOUS SPEECH RECOGNITION BY COMBINING MFCC AND PNCC ATTRIBUTES WITH SS, WD, MAP AND FRN METHODS OF ROBUSTNESS / [pt] RECONHECIMENTO DE VOZ CONTINUA COMBINANDO OS ATRIBUTOS MFCC E PNCC COM METODOS DE ROBUSTEZ SS, WD, MAP E FRN CHRISTIAN DAYAN ARCOS GORDILLO 09 June 2014 (has links) [pt] O crescente interesse por imitar o modelo que rege o processo cotidiano de comunicação humana através de maquinas tem se convertido em uma das áreas do conhecimento mais pesquisadas e de grande importância nas ultimas décadas. Esta área da tecnologia, conhecida como reconhecimento de voz, em como principal desafio desenvolver sistemas robustos que diminuam o ruído aditivo dos ambientes de onde o sinal de voz é adquirido, antes de que se esse sinal alimente os reconhecedores de voz. Por esta razão, este trabalho apresenta quatro formas diferentes de melhorar o desempenho do reconhecimento de voz contınua na presença de ruído aditivo, a saber: Wavelet Denoising e Subtração Espectral, para realce de fala e Mapeamento de Histogramas e Filtro com Redes Neurais, para compensação de atributos. Esses métodos são aplicados isoladamente e simultaneamente, afim de minimizar os desajustes causados pela inserção de ruído no sinal de voz. Alem dos métodos de robustez propostos, e devido ao fato de que os e conhecedores de voz dependem basicamente dos atributos de voz utilizados, examinam-se dois algoritmos de extração de atributos, MFCC e PNCC, através dos quais se representa o sinal de voz como uma sequência de vetores que contêm informação espectral de curtos períodos de tempo. Os métodos considerados são avaliados através de experimentos usando os software HTK e Matlab, e as bases de dados TIMIT (de vozes) e NOISEX-92 (de ruído). Finalmente, para obter os resultados experimentais, realizam-se dois tipos de testes. No primeiro caso, é avaliado um sistema de referência baseado unicamente em atributos MFCC e PNCC, mostrando como o sinal é fortemente degradado quando as razões sinal-ruıdo são menores. No segundo caso, o sistema de referência é combinado com os métodos de robustez aqui propostos, analisando-se comparativamente os resultados dos métodos quando agem isolada e simultaneamente. Constata-se que a mistura simultânea dos métodos nem sempre é mais atraente. Porem, em geral o melhor resultado é obtido combinando-se MAP com atributos PNCC. / [en] The increasing interest in imitating the model that controls the daily process of human communication trough machines has become one of the most researched areas of knowledge and of great importance in recent decades. This technological area known as voice recognition has as a main challenge to develop robust systems that reduce the noisy additive environment where the signal voice was acquired. For this reason, this work presents four different ways to improve the performance of continuous speech recognition in presence of additive noise, known as Wavelet Denoising and Spectral Subtraction for enhancement of voice, and Mapping of Histograms and Filter with Neural Networks to compensate for attributes. These methods are applied separately and simultaneously two by two, in order to minimize the imbalances caused by the inclusion of noise in voice signal. In addition to the proposed methods of robustness and due to the fact that voice recognizers depend mainly on the attributes voice used, two algorithms are examined for extracting attributes, MFCC, and PNCC, through which represents the voice signal as a sequence of vectors that contain spectral information for short periods of time. The considered methods are evaluated by experiments using the HTK and Matlab software, and databases of TIMIT (voice) and Noisex-92 (noise). Finally, for the experimental results, two types of tests were carried out. In the first case a reference system was assessed based on MFCC and PNCC attributes, only showing how the signal degrades strongly when signal-noise ratios are higher. In the second case, the reference system is combined with robustness methods proposed here, comparatively analyzing the results of the methods when they act alone and simultaneously. It is noted that simultaneous mix of methods is not always more attractive. However, in general, the best result is achieved by the combination of MAP with PNCC attributes. [pt] REDES NEURAIS [en] NEURAL NETWORKS [pt] ATRIBUTOS [en] ATTRIBUTES [pt] SUBTRACAO ESPECTRAL [en] SPECTRAL SUBTRACTION [pt] RECONHECIMENTO DE VOZ [en] SPEECH RECOGNITION [pt] WAVELET DENOISING [en] WAVELET DENOISING [pt] REALCE [en] ENHANCEMENT [pt] SINAIS [en] SIGNALS [pt] ROBUSTEZ [en] ROBUSTNESS [pt] COMPENSACAO [en] ENHACEMENT [pt] MAPEAMENTO DE HISTOGRAMAS [en] HISTOGRAM MAPPING [pt] MFCC [en] MFCC [pt] PNCC [en] PNCC
45	[pt] DESENVOLVIMENTO DE MODELOS PARA PREVISÃO DE QUALIDADE DE SISTEMAS DE RECONHECIMENTO DE VOZ / [en] DEVELOPMENT OF PREDICTION MODELS FOR THE QUALITY OF SPOKEN DIALOGUE SYSTEMS BERNARDO LINS DE ALBUQUERQUE COMPAGNONI 12 November 2021 (has links) [pt] Spoken Dialogue Systems (SDS s) são sistemas baseados em computadores desenvolvidos para fornecerem informações e realizar tarefas utilizando o diálogo como forma de interação. Eles são capazes de reconhecimento de voz, interpretação, gerenciamento de diálogo e são capazes de ter uma voz como saída de dados, tentando reproduzir uma interação natural falada entre um usuário humano e um sistema. SDS s provém diferentes serviços, todos através de linguagem falada com um sistema. Mesmo com todo o desenvolvimento nesta área, há escassez de informações sobre como avaliar a qualidade de tais sistemas com o propósito de otimização do mesmo. Com dois destes sistemas, BoRIS e INSPIRE, usados para reservas de restaurantes e gerenciamento de casas inteligentes, diversos experimentos foram conduzidos no passado, onde tais sistemas foram utilizados para resolver tarefas específicas. Os participantes avaliaram a qualidade do sistema em uma série de questões. Além disso, todas as interações foram gravadas e anotadas por um especialista.O desenvolvimento de métodos para avaliação de performance é um tópico aberto de pesquisa na área de SDS s. Seguindo a idéia do modelo PARADISE (PARAdigm for DIalogue System Evaluation – desenvolvido pro Walker e colaboradores na AT&T em 1998), diversos experimentos foram conduzidos para desenvolver modelos de previsão de performance de sistemas de reconhecimento de voz e linguagem falada. O objetivo desta dissertação de mestrado é desenvolver modelos que permitam a previsão de dimensões de qualidade percebidas por um usuário humano, baseado em parâmetros instrumentalmente mensuráveis utilizando dados coletados nos experimentos realizados com os sistemas BoRIS e INSPIRE , dois sistemas de reconhecimento de voz (o primeiro para busca de restaurantes e o segundo para Smart Homes). Diferentes algoritmos serão utilizados para análise (Regressão linear, Árvores de Regressão, Árvores de Classificação e Redes Neurais) e para cada um dos algoritmos, uma ferramenta diferente será programada em MATLAB, para poder servir de base para análise de experimentos futuros, sendo facilmente modificado para sistemas e parâmetros novos em estudos subsequentes.A idéia principal é desenvolver ferramentas que possam ajudar na otimização de um SDS sem o envolvimento direto de um usuário humano ou servir de ferramenta para estudos futuros na área. / [en] Spoken Dialogue Systems (SDS s) are computer-based systems developed to provide information and carry out tasks using speech as the interaction mode. They are capable of speech recognition, interpretation, management of dialogue and have speech output capabilities, trying to reproduce a more or less natural spoken interaction between a human user and the system. SDS s provide several different services, all through spoken language. Even with all this development, there is scarcity of information on ways to assess and evaluate the quality of such systems with the purpose of optimization. With two of these SDS s ,BoRIS and INSPIRE, (used for Restaurant Booking Services and Smart Home Systems), extensive experiments were conducted in the past, where the systems were used to resolve specific tasks. The evaluators rated the quality of the system on a multitude of scales. In addition to that, the interactions were recorded and annotated by an expert. The development of methods for performance evaluation is an open research issue in this area of SDS s. Following the idea of the PARADISE model (PARAdigm for DIalogue System Evaluation model, the most well-known model for this purpose (developed by Walker and co-workers at AT&T in 1998), several experiments were conducted to develop predictive models of spoken dialogue performance. The objective of this dissertation is to develop and assess models which allow the prediction of quality dimensions as perceived by the human user, based on instrumentally measurable variables using all the collected data from the BoRIS and INSPIRE systems. Different types of algorithms will be compared to their prediction performance and to how generic they are. Four different approaches will be used for these analyses: Linear regression, Regression Trees, Classification Trees and Neural Networks. For each of these methods, a different tool will be programmed using MATLAB, that can carry out all experiments from this work and be easily modified for new experiments with data from new systems or new variables on future studies. All the used MATLAB programs will be made available on the attached CD with an operation manual for future users as well as a guide to modify the existing programs to work on new data. The main idea is to develop tools that would help on the optimization of a spoken dialogue system without a direct involvement of the human user or serve as tools for future studies in this area. [pt] RECONHECIMENTO DE VOZ [pt] SPOKEN DIALOGUE SYSTEMS [pt] LINGUAGEM FALADA [pt] ARVORES DE CLASSIFICACAO [pt] REDES NEURAIS [pt] ENGENHARIA ELETRICA - TESES [pt] REGRESSAO LINEAR [pt] ARVORES DE REGRESSAO [en] SPEECH RECOGNITION [en] SYSTEM PERFORMANCE EVALUATION [en] SPOKEN DIALOGUE SYSTEMS [en] SPOKEN LANGUAGE [en] CLASSIFICATION TREES [en] NEURAL NETWORKS [en] ELECTRICAL ENGINEERING - THESIS [en] LINEAR REGRESSION [en] REGRESSION TREES

Page generated in 0.1082 seconds