Global ETD Search

Combinação de classificadores em diferentes espaços de características para classificação de documentos

Submitted by Pedro Barros (pedro.silvabarros@ufpe.br) on 2018-06-25T22:35:53Z
No. of bitstreams: 2
license_rdf: 811 bytes, checksum: e39d27027a6cc9cb039ad269a5db8e34 (MD5)
TESE Roberto Hugo Wanderley Pinheiro.pdf: 6289465 bytes, checksum: 9baff75de0aed82ef29265d6f5c36b1f (MD5) / Made available in DSpace on 2018-06-25T22:35:53Z (GMT). No. of bitstreams: 2
license_rdf: 811 bytes, checksum: e39d27027a6cc9cb039ad269a5db8e34 (MD5)
TESE Roberto Hugo Wanderley Pinheiro.pdf: 6289465 bytes, checksum: 9baff75de0aed82ef29265d6f5c36b1f (MD5)
Previous issue date: 2017-02-20 / FACEPE / Classiﬁcação de Documentos é um problema no qual um documento em linguagem natural deve ser designado como pertencente à uma das classes pré-estabelecidas. A Classiﬁcação de Documentos, com vetores de características gerados pela Bag-of-Words, possui duas diﬁculdades notáveis: alta dimensionalidade e matriz de dados esparsa. Seleção de características reduzem essas diﬁculdades, mas descarta informação no processo. Uma alternativa é realizar transformações sobre as características, pois ao alterar as características é possível trabalhar sem descartar informações, possibilitando uma melhoria nas taxas de reconhecimento e, em alguns casos, redução da dimensionalidade e esparsidade. Dentre essas transformações, duas pouco utilizadas na literatura são: Dissimilarity Representation (DR), no qual cada documento é representado por um vetor composto de distâncias calculadas com relação a um conjunto de documentos referência; e Dichotomy Transformation (DT), no qual o problema original é transformado em um problema binário e cada documento é transformado em vários vetores com características obtidas pelo valor absoluto da diferença para os documentos de um subconjunto do conjunto original. A utilização da DR pode reduzir tanto a alta dimensionalidade quanto a esparsidade. Enquanto que a utilização da DT, apesar de não reduzir a dimensionalidade ou esparsidade, melhora as taxas de reconhecimento do classiﬁcador, pois trabalha com uma quantidade maior de documentos sobre um problema transformado para duas classes. Neste trabalho, são propostos dois sistemas de múltiplos classiﬁcadores para Classiﬁcação de Documentos: Combined Dissimilarity Spaces (CoDiS) e Combined Dichotomy Transformations (CoDiT), cada um baseado em uma das transformações citadas acima. Os múltiplos classiﬁcadores se beneﬁciam da necessidade de encontrar um conjunto para as transformações, pois utilizando diferentes conjuntos possibilita a criação de um sistema diverso e robusto. Experimentos foram realizados comparando as arquiteturas propostas com métodos da literatura usando até 47 bancos de dados públicos e os resultados mostram que as propostas atingem desempenho superior na maioria dos casos. / Text Classiﬁcation is a problem in which a natural language document is assigned to oneof the pre-establishedclasses. TextClassiﬁcation, with featurevectorsgenerated byBagof-Words, has two notable difﬁculties: high dimensionality and sparse data matrix. Feature selection reduces these difﬁculties, but discards information in the process. An alternative is to perform transformations over the features, because by altering the features it is possible to work without discarding information, allowing improvement of recognition rates and, in some cases, reduction of dimensionality and sparseness. Among these transformations, two underused in literature are: Dissimilarity Representation (DR), where each document is represented by a vector composed of distances calculated relative to a set of reference documents; and Dichotomy Transformation (DT), where the original problem is transformed into a binary problem and each document is transformed into several vectors with features obtained by the absolute value of the difference for the documents of a subset of the original set. The use of DR can reduce both the high dimensionality and sparseness. Whereas the use of DT, despite not reducing dimensionality or sparseness, improves the recognition rates of the classiﬁer, since it works with a larger amount of documents on a problem transformed into two classes. In this work, two multiple classiﬁers systems for Text Classiﬁcationa reproposed: Combined Dissimilarity Spaces (CoDiS) and Combined Dichotomy Transformations (CoDiT), each one based on the transformations mentioned above. The multiple classiﬁers beneﬁts from the need to ﬁnd a set for the transformations, because using different sets allows the creation of a diverse and robust system. Experiments were performed comparing the proposed architectures with literature methods using up to 47 public data bases and the results show that the proposals achieve superior performance in most cases.

https://repositorio.ufpe.br/handle/123456789/24893

Inteligência artificial

Recuperação da informação

Identifer	oai:union.ndltd.org:IBICT/oai:repositorio.ufpe.br:123456789/24893
Date	17 February 2017
Creators	PINHEIRO, Roberto Hugo Wanderley
Contributors	http://lattes.cnpq.br/8577312109146354, CAVALCANTI, George Darmiton da Cunha, REN, Tsang Ing
Publisher	Universidade Federal de Pernambuco, Programa de Pos Graduacao em Ciencia da Computacao, UFPE, Brasil
Source Sets	IBICT Brazilian ETDs
Language	Portuguese
Detected Language	Portuguese
Type	info:eu-repo/semantics/publishedVersion, info:eu-repo/semantics/doctoralThesis
Source	reponame:Repositório Institucional da UFPE, instname:Universidade Federal de Pernambuco, instacron:UFPE
Rights	Attribution-NonCommercial-NoDerivs 3.0 Brazil, http://creativecommons.org/licenses/by-nc-nd/3.0/br/, info:eu-repo/semantics/openAccess

Page generated in 0.0023 seconds

Combinação de classificadores em diferentes espaços de características para classificação de documentos

Description

Links & Downloads

Tags

Additional Fields