Spelling suggestions: "subject:"forminformation extraction rules"" "subject:"informationation extraction rules""
1 |
Apprentissage interactif de règles d'extraction d'information textuelle / Iteractive learning of textual information extraction rulesBannour, Sondes 16 June 2015 (has links)
L’Extraction d’Information est une discipline qui a émergé du Traitement Automatique des Langues afin de proposer des analyses fines d’un texte écrit en langage naturel et d’améliorer la recherche d’informations spécifiques. Les techniques d’extraction d’information ont énormément évolué durant les deux dernières décennies.Les premiers systèmes d’extraction d’information étaient des systèmes à base de règles écrites manuellement. L’écriture manuelle des règles étant devenue une tâche fastidieuse, des algorithmes d’apprentissage automatique de règles ont été développés.Ces algorithmes nécessitent cependant la rédaction d’un guide d’annotation détaillé, puis l’annotation manuelle d’une grande quantité d’exemples d’entraînement. Pour minimiser l’effort humain requis dans les deux familles d’approches de mise au point de règles, nous avons proposé, dans ce travail de thèse, une approche hybride qui combine les deux en un seul système interactif qui procède en plusieurs itérations.Ce système que nous avons nommé IRIES permet à l’utilisateur de travailler de manière duale sur les règles d’extraction d’information et les exemples d’apprentissage.Pour mettre en place l’approche proposée, nous avons proposé une chaîne d’annotation linguistique du texte et l’utilisation d’un langage de règles expressif pour la compréhensibilité et la généricité des règles écrites ou inférées, une stratégie d’apprentissage sur un corpus réduit pour ne pas discriminer les exemples positifs non encore annotés à une itération donnée, la mise en place d’un concordancier pour l’écriture de règles prospectives et la mise en place d’un module d’apprentissage actif(IAL4Sets) pour une sélection intelligente d’exemples.Ces propositions ont été mises en place et évaluées sur deux corpus : le corpus de BioNLP-ST 2013 et le corpus SyntSem. Une étude de différentes combinaisons de traits linguistiques utilisés dans les expressions des règles a permis de voir l’impactde ces traits sur les performances des règles. L’apprentissage sur un corpus réduit a permis un gain considérable en temps d’apprentissage sans dégradationde performances. Enfin, le module d’apprentissage actif proposé (IAL4Sets) a permis d’améliorer les performances de l’apprentissage actif de base de l’algorithme WHISK grâce à l’introduction de la notion de distance ou de similarité distributionnelle qui permet de proposer à l’utilisateur des exemples sémantiquement proches des exemples positifs déjà couverts. / Non communiqué
|
2 |
LIEF: An Algorithm for Learning Information Extraction Rules from Unstructured DocumentsPen, Chih-Jen 02 August 2001 (has links)
In the past, information was stored more or less well-structured in database. Nowadays, a lot of information is presented in unstructured format. The management of and retrieval from such large vast of textual information has been a challenging issue for organizations or individuals. Information extraction is the process of extracting relevant data from semi-structured or unstructured documents and transforming them into structured representations. Many information extraction learning techniques have been proposed. However, they are ineffectiveness on unstructured documents. Thus, in the research, we proposed a new information extraction learning algorithm, called LIEF, that enhancing existing information extraction learning techniques. According to the empirical evaluations on news documents that are unstructured format, the LIEF algorithm proposed showed its capabilities in accuracy rate.
|
Page generated in 0.7277 seconds