Global ETD Search

41	Confidence Measures for Automatic and Interactive Speech Recognition Sánchez Cortina, Isaías 07 March 2016 (has links) [EN] This thesis work contributes to the field of the {Automatic Speech Recognition} (ASR). And particularly to the {Interactive Speech Transcription} and {Confidence Measures} (CM) for ASR. The main goals of this thesis work can be summarised as follows: 1. To design IST methods and tools to tackle the problem of improving automatically generated transcripts. 2. To assess the designed IST methods and tools on real-life tasks of transcription in large educational repositories of video lectures. 3. To improve the reliability of the IST by improving the underlying (CM). Abstracts: The {Automatic Speech Recognition} (ASR) is a crucial task in a broad range of important applications which could not accomplished by means of manual transcription. The ASR can provide cost-effective transcripts in scenarios of increasing social impact such as the {Massive Open Online Courses} (MOOC), for which the availability of accurate enough is crucial even if they are not flawless. The transcripts enable search-ability, summarisation, recommendation, translation; they make the contents accessible to non-native speakers and users with impairments, etc. The usefulness is such that students improve their academic performance when learning from subtitled video lectures even when transcript is not perfect. Unfortunately, the current ASR technology is still far from the necessary accuracy. The imperfect transcripts resulting from ASR can be manually supervised and corrected, but the effort can be even higher than manual transcription. For the purpose of alleviating this issue, a novel {Interactive Transcription of Speech} (IST) system is presented in this thesis. This IST succeeded in reducing the effort if a small quantity of errors can be allowed; and also in improving the underlying ASR models in a cost-effective way. In other to adequate the proposed framework into real-life MOOCs, another intelligent interaction methods involving limited user effort were investigated. And also, it was introduced a new method which benefit from the user interactions to improve automatically the unsupervised parts ({Constrained Search} for ASR). The conducted research was deployed into a web-based IST platform with which it was possible to produce a massive number of semi-supervised lectures from two different well-known repositories, videoLectures.net and poliMedia. Finally, the performance of the IST and ASR systems can be easily increased by improving the computation of the {Confidence Measure} (CM) of transcribed words. As so, two contributions were developed: a new particular {Logistic Regresion} (LR) model; and the speaker adaption of the CM for cases in which it is possible, such with MOOCs. / [ES] Este trabajo contribuye en el campo del {reconocimiento automático del habla} (RAH). Y en especial, en el de la {transcripción interactiva del habla} (TIH) y el de las {medidas de confianza} (MC) para RAH. Los objetivos principales son los siguientes: 1. Diseño de métodos y herramientas TIH para mejorar las transcripciones automáticas. 2. Evaluar los métodos y herramientas TIH empleando tareas de transcripción realistas extraídas de grandes repositorios de vídeos educacionales. 3. Mejorar la fiabilidad del TIH mediante la mejora de las MC. Resumen: El {reconocimiento automático del habla} (RAH) es una tarea crucial en una amplia gama de aplicaciones importantes que no podrían realizarse mediante transcripción manual. El RAH puede proporcionar transcripciones rentables en escenarios de creciente impacto social como el de los {cursos abiertos en linea masivos} (MOOC), para el que la disponibilidad de transcripciones es crucial, incluso cuando no son completamente perfectas. Las transcripciones permiten la automatización de procesos como buscar, resumir, recomendar, traducir; hacen que los contenidos sean más accesibles para hablantes no nativos y usuarios con discapacidades, etc. Incluso se ha comprobado que mejora el rendimiento de los estudiantes que aprenden de videos con subtítulos incluso cuando estos no son completamente perfectos. Desafortunadamente, la tecnología RAH actual aún está lejos de la precisión necesaria. Las transcripciones imperfectas resultantes del RAH pueden ser supervisadas y corregidas manualmente, pero el esfuerzo puede ser incluso superior al de la transcripción manual. Con el fin de aliviar este problema, esta tesis presenta un novedoso sistema de {transcripción interactiva del habla} (TIH). Este método TIH consigue reducir el esfuerzo de semi-supervisión siempre que sea aceptable una pequeña cantidad de errores; además mejora a la par los modelos RAH subyacentes. Con objeto de transportar el marco propuesto para MOOCs, también se investigaron otros métodos de interacción inteligentes que involucran esfuerzo limitado por parte del usuario. Además, se introdujo un nuevo método que aprovecha las interacciones para mejorar aún más las partes no supervisadas (ASR con {búsqueda restringida}). La investigación en TIH llevada a cabo se desplegó en una plataforma web con el que fue posible producir un número masivo de transcripciones de videos de dos conocidos repositorios, videoLectures.net y poliMedia. Por último, el rendimiento de la TIH y los sistemas de RAH se puede aumentar directamente mediante la mejora de la estimación de la {medida de confianza} (MC) de las palabras transcritas. Por este motivo se desarrollaron dos contribuciones: un nuevo modelo discriminativo {logístico} (LR); y la adaptación al locutor de la MC para los casos en que es posible, como por ejemplo en MOOCs. / [CA] Aquest treball hi contribueix al camp del {reconeixment automàtic de la parla} (RAP). I en especial, al de la {transcripció interactiva de la parla} i el de {mesures de confiança} (MC) per a RAP. Els objectius principals són els següents: 1. Dissenyar mètodes i eines per a TIP per tal de millorar les transcripcions automàtiques. 2. Avaluar els mètodes i eines TIP per a tasques de transcripció realistes extretes de grans repositoris de vídeos educacionals. 3. Millorar la fiabilitat del TIP, mitjançant la millora de les MC. Resum: El {reconeixment automàtic de la parla} (RAP) és una tasca crucial per una àmplia gamma d'aplicacions importants que no es poden dur a terme per mitjà de la transcripció manual. El RAP pot proporcionar transcripcions en escenaris de creixent impacte social com els {cursos online oberts massius} (MOOC). Les transcripcions permeten automatitzar tasques com ara cercar, resumir, recomanar, traduir; a més a més, fa accessibles els continguts als parlants no nadius i els usuaris amb discapacitat, etc. Fins i tot, pot millorar el rendiment acadèmic de estudiants que aprenen de xerrades amb subtítols, encara que aquests subtítols no siguen perfectes. Malauradament, la tecnologia RAP actual encara està lluny de la precisió necessària. Les transcripcions imperfectes resultants de RAP poden ser supervisades i corregides manualment, però aquest l'esforç pot acabar sent superior a la transcripció manual. Per tal de resoldre aquest problema, en aquest treball es presenta un sistema nou per a {transcripció interactiva de la parla} (TIP). Aquest sistema TIP va ser reeixit en la reducció de l'esforç per quan es pot permetre una certa quantitat d'errors; així com també en en la millora dels models RAP subjacents. Per tal d'adequar el marc proposat per a MOOCs, també es van investigar altres mètodes d'interacció intel·ligents amb esforç d''usuari limitat. A més a més, es va introduir un nou mètode que aprofita les interaccions per tal de millorar encara més les parts no supervisades (RAP amb {cerca restringida}). La investigació en TIP duta a terme es va desplegar en una plataforma web amb la qual va ser possible produir un nombre massiu de transcripcions semi-supervisades de xerrades de repositoris ben coneguts, videoLectures.net i poliMedia. Finalment, el rendiment de la TIP i els sistemes de RAP es pot augmentar directament mitjançant la millora de l'estimació de la {Confiança Mesura} (MC) de les paraules transcrites. Per tant, es van desenvolupar dues contribucions: un nou model discriminatiu logístic (LR); i l'adaptació al locutor de la MC per casos en que és possible, per exemple amb MOOCs. / Sánchez Cortina, I. (2016). Confidence Measures for Automatic and Interactive Speech Recognition [Tesis doctoral no publicada]. Universitat Politècnica de València. https://doi.org/10.4995/Thesis/10251/61473 Reconocimiento automático del habla Transcripción Interactiva del habla Medidas de Confianza Repositorios de videos educacionales Reconeixement automàtic de la parla Transcripció Interactiva de la parla Mesures de confiança Repositoris de videos educacionals Automatic speech recognition Interactive Speech Transcription Confidence Measures Online educational repositories Massive Open Online Courses ASR IST CM MOOC LENGUAJES Y SISTEMAS INFORMATICOS
42	Estudio de los factores de patogenicidad/virulencia de Penicillium digitatum sobre frutos cítricos López Pérez, Mario 02 December 2013 (has links) Las pérdidas causadas por podredumbres durante la post-cosecha de frutos cítricos suelen suponer entre un 5 y un 10 % de la producción, siendo Penicillium digitatum el principal hongo patógeno, responsable de hasta el 80 % de las pérdidas causadas por podredumbres en frutos almacenados a temperatura ambiente. A pesar de la importancia económica de este patógeno nuestro conocimiento sobre los mecanismos de patogenicidad/ virulencia son muy escasos, en contraste con el avance experimentado en los últimos años en el conocimiento de las respuestas de defensa del fruto a la infección por este patógeno. Así, en el grupo de Fisiología y Biotecnología Postcosecha del IATA se está trabajando en la caracterización a nivel bioquímico y molecular de las respuestas de los frutos cítricos frente a la infección por P. digitatum y en el proceso de inducción de resistencia en frutos cítricos frente a la infección. Por este motivo en esta Tesis se han desarrollado un conjunto de herramientas esenciales para poder abordar la caracterización funcional de genes involucrados en virulencia/patogenicidad: transformación de P. digitatum mediada por Agrobacterium tumefaciens, utilización de la proteína verde fluorescente como marcadora, metodología para la obtención de mutantes de deleción de genes específicos, incluyendo mutantes nulos ¿ku80, vectores para silenciamiento génico mediante RNAi y la construcción de una genoteca de DNA genómico de P. digitatum. Se ha secuenciado y analizado el factor de transcripción PacC, que controla la expresión de un grupo de genes regulados por el pH ambiental. En P. digitatum se produce una acidificación del medio para adaptarlo al pH óptimo de su arsenal de enzimas. Se han obtenido mutantes de expresión constitutiva de PacC que presentan una disminución la capacidad infectiva en un 20 %. Mediante el empleo de técnicas de alto rendimiento se ha construido una genoteca substractiva de cDNA para obtener fragmentos de genes de P. digitatum que se inducen durante la infección de frutos de naranja y se ha analizado la expresión génica de los mismos y se ha elaborado una macromatriz conteniendo más de 1330 clones de la genoteca. El grupo de genes con mayor representación en la genoteca y con altos valores de inducción, corresponde a genes que codifican cinco proteasas diferentes. Además, en la genoteca substractiva también hay una alta representación de genes que codifican enzimas de degradación de la pared celular, y otras proteínas implicadas en glucólisis, respuesta a estrés o detoxificación. La ya demostrada importancia de las enzimas de degradación de la pared celular en la virulencia de hongos fitopatógenos, su abundancia y niveles de inducción en la macromatriz nos llevaron a estudiar más en profundidad algunos de estos genes (dos poligalacturonasas y una pectin liasa). Para comprobar su implicación en el proceso de infección se secuenciaron y se obtuvieron mutantes de P. digitatum en los que se eliminó el gen. La disminución de la virulencia de estos mutantes sobre frutos de naranja con respecto a la cepa silvestre fue de aproximadamente un 25 %. Del conjunto de genes relacionados con el metabolismo redox se seleccionó por su patrón de expresión el gen ris1, que codifica una naftaleno dioxigenasa posiblemente implicada en la detoxificación de compuestos aromáticos. A diferencia de los mutantes nulos en los genes de las poligalacturonasas o de la pectin liasa, los mutantes nulos ¿ris1 no presentaron ninguna alteración en su capacidad patogénica. / López Pérez, M. (2013). Estudio de los factores de patogenicidad/virulencia de Penicillium digitatum sobre frutos cítricos [Tesis doctoral no publicada]. Universitat Politècnica de València. https://doi.org/10.4995/Thesis/10251/34176 Penicillium digitatum Post-cosecha de frutos cítricos Podredumbre verde Mecanismos de patogenicidad Proteína verde fluorescente Obtención de mutantes de deleción Mutantes nulos Ku80 Factor de transcripción PacC Genoteca substractiva de cDNA Macromatriz Poligalacturonasas Pectin liasa Naftaleno dioxigenasa SSH

Search results

Confidence Measures for Automatic and Interactive Speech Recognition

Estudio de los factores de patogenicidad/virulencia de Penicillium digitatum sobre frutos cítricos