Return to search

Agrupamento e categoriza??o de documentos jur?dicos

Made available in DSpace on 2015-04-14T14:49:50Z (GMT). No. of bitstreams: 1
439389.pdf: 2902269 bytes, checksum: 8e1dea861e0b5f7c53712bc7f1561efe (MD5)
Previous issue date: 2011-03-25 / In this work we study the use of machine learning (clustering and classification) in judicial decisions search under electronic legal proceedings. We discuss and develop alternatives for precedent clustering, automatically generating classes to use to categorize when a user attaches new documents to its electronic legal proceeding. A changed version of the algorithm TClus, authored by Aggarwal, Gates and Yu was selected to be the use example, we propose removing its document and cluster discarding features and adding a cluster division feature. We introduce here a new paradigm bag of terms and law references instead of bag of words by generating attributes using two thesauri from the Brazilian Federal Senate and the Brazilian Federal Justice to detect legal terms a regular expressions to detect law references. In our use example, we build a corpus with precedents of the 4th Region s Federal Court. The clustering results were evaluated with the Relative Hardness Measure and the p-Measure which were then tested with Wilcoxon s Signed-ranks Test and the Count of Wins and Losses Test to determine its significance. The categorization results were evaluated by human specialists. The analysis and discussion of these results covered comparations of true/false positives against document similarity with the centroid, quantity of documents in the clusters, quantity and type of the attributes in the centroids e cluster cohesion. We also discuss attribute generation and its implications in the classification results. Contributions in this work: we confirmed that it is possible to use machine learning techniques in judicial decisions search, we developed an evolution of the TClus algorithm by removing its document and group discarding features and creating a group division feature, we proposed a new paradigm called bag of terms and law references evaluated by a prototype of the proposed process in a use case and automatic evaluation in the clustering phase and a human specialist evaluation in the categorization phase. / Este trabalho estuda a aplica??o de t?cnicas de aprendizado de m?quina (agrupamento e classifica??o) ? pesquisa de jurisprud?ncia, no ?mbito do processo judicial eletr?nico. Discute e implementa alternativas para o agrupamento dos documentos da jurisprud?ncia, gerando automaticamente classes que servem ao posterior processo de categoriza??o dos documentos anexados ao processo jur?dico. O algoritmo TClus de Aggarwal, Gates e Yu ? selecionado para desenvolvimento de exemplo de uso, com propostas de altera??o no descarte de documentos e grupos, e passando a incluir a divis?o de grupos. A proposta ainda introduz um paradigma "bag of terms and law references"em lugar do "bag of words", quando utiliza, na gera??o dos atributos, os tesauros do Senado Federal e da Justi?a Federal para detectar termos jur?dicos nos documentos e express?es regulares para detectar refer?ncias legislativas. No exemplo de uso, empregam-se documentos oriundos da jurisprud?ncia do Tribunal Regional Federal da 4a Regi?o. Os resultados dos agrupamentos foram avaliados pelas medidas Relative Hardness e p- e submetidos aos testes de signific?ncia de Wilcoxon e contagem de vit?rias e derrotas. Os resultados da categoriza??o foram avaliados por avaliadores humanos. A discuss?o e an?lise desses resultados abrangeu a compara??o do sucesso e falha na classifica??o em rela??o ? similaridade do documento com o centr?ide no momento da categoriza??o, ? quantidade de documentos nos grupos, ? quantidade e tipo de atributos nos centr?ides e ? coes?o dos grupos. Discute-se, ainda, a gera??o dos atributos e suas implica??es nos resultados da classifica??o. Contribui??es deste estudo: confirma??o da possibilidade de uso do aprendizado de m?quina na pesquisa jurisprudencial, evolu??o do algoritmo TClus ao eliminar os descartes de documentos e grupos e ao implementar a divis?o de grupos, proposta de novo paradigma bag of terms and law references, atrav?s de prototipa??o do processo proposto com exemplo de uso e avalia??es autom?ticas na fase de clustering, e por especialista humano na fase de categoriza??o.

Identiferoai:union.ndltd.org:IBICT/oai:tede2.pucrs.br:tede/5181
Date25 March 2011
CreatorsFurquim, Luis Ot?vio de Colla
ContributorsLima, Vera L?cia Strube de
PublisherPontif?cia Universidade Cat?lica do Rio Grande do Sul, Programa de P?s-Gradua??o em Ci?ncia da Computa??o, PUCRS, BR, Faculdade de Inform?ca
Source SetsIBICT Brazilian ETDs
LanguagePortuguese
Detected LanguageEnglish
Typeinfo:eu-repo/semantics/publishedVersion, info:eu-repo/semantics/masterThesis
Formatapplication/pdf
Sourcereponame:Biblioteca Digital de Teses e Dissertações da PUC_RS, instname:Pontifícia Universidade Católica do Rio Grande do Sul, instacron:PUC_RS
Rightsinfo:eu-repo/semantics/openAccess
Relation1974996533081274470, 500, 600, 1946639708616176246

Page generated in 0.0025 seconds