Classificação de relações semânticas abertas baseada em similaridade de estruturas gramaticais na língua portuguesa

Souza, Erick Nilsen Pereira de

Use este identificador para citar ou linkar para este item: https://repositorio.ufba.br/handle/ri/19271

Registro completo de metadados

Campo DC	Valor	Idioma
dc.contributor.advisor	Claro, Daniela Barreiro	-
dc.contributor.author	Souza, Erick Nilsen Pereira de	-
dc.creator	Souza, Erick Nilsen Pereira de	-
dc.date.accessioned	2016-05-25T12:52:22Z	-
dc.date.available	2016-05-25T12:52:22Z	-
dc.date.issued	2016-05-25	-
dc.date.submitted	2014-07-22	-
dc.identifier.uri	http://repositorio.ufba.br/ri/handle/ri/19271	-
dc.description.abstract	A Extração de Relações (ER) é uma tarefa da Extração da Informação (EI) responsável pela descoberta de relacionamentos semânticos entre conceitos em textos não estruturados. Quando a extração não é limitada por um conjunto prede nido de relações, a ER é dita Aberta (Open Relation Extraction), cujo principal desa o consiste em reduzir a proporção de extrações inválidas geradas pelos métodos que tratam desta tarefa. As soluções atuais, baseadas em aprendizado sobre um conjunto de features linguísticas especí cas, embora consigam eliminar grande parte das extra ções inválidas, possuem como desvantagem a alta dependência do idioma-alvo. Tal dependência decorre da di culdade inerente à determinação do conjunto de features mais representativo para o problema, considerando as peculiaridades de cada língua. Soluções deste tipo necessitam de bases de treinamento extensas, geralmente produzidas com auxílio de conhecimento linguístico especializado, recursos comuns na Língua Inglesa, mas inexistentes em outros idiomas. Com o objetivo de facilitar a aplicação da tarefa de ER Abertas a textos redigidos em outras línguas, é proposto um método para classi cação de relações baseado em similaridade de estruturas gramaticais, que constrói modelos a partir das estruturas morfológicas contidas nas extrações, com a nalidade de identi car padrões de similaridade que permitam distinguir relações válidas e inválidas, através da aplicação de algoritmos de detecção de isomor smo em subgrafos. Os resultados obtidos neste trabalho corroboram a hipótese de que a similaridade entre as estruturas gramaticais das relações pode ser utilizada para reduzir a quantidade de extrações inválidas, a partir de bases de exemplos com número reduzido de instâncias. Com isso, o esforço de classi cação pode ser minimizado através da substituição de conjuntos de treinamento baseados em features por conjuntos de exemplos com custo de construção inferior. Em particular, o Português do Brasil foi escolhido para a aplicação e validação da abordagem proposta, uma vez que constitui um dos vários idiomas que carecem deste tipo de recurso, sendo a abordagem precursora na extração de relações semânticas de domínio não limitado da língua. Para tanto, foi desenvolvido um modelo de extração e classi cação de relações abertas baseado em padrões gramaticais adaptados para a Língua Portuguesa, a partir do qual é possível comparar a qualidade de classi cação do método proposto com as principais abordagens baseadas em features. Resultados experimentais apresentam um aumento na qualidade de classi cação em relação aos métodos do estado da arte desta categoria, como o ReVerb [FSE11] e o WOE	pt_BR
dc.description.sponsorship	FAPESB	pt_BR
dc.language.iso	pt_BR	pt_BR
dc.rights	Acesso Aberto	pt_BR
dc.subject	Extração da informação	pt_BR
dc.subject	Isomor smo em subgrafos	pt_BR
dc.subject	Extração de relações abertas	pt_BR
dc.title	Classificação de relações semânticas abertas baseada em similaridade de estruturas gramaticais na língua portuguesa	pt_BR
dc.type	Dissertação	pt_BR
dc.contributor.referees	Salvador, Laís do Nascimento	-
dc.contributor.referees	Freitas, Frederico Luiz Gonçalves de	-
dc.publisher.departament	Instituto de Matemática. Departamento de Ciência da Computação	pt_BR
dc.publisher.program	Mestrado Multiinstitucional em Ciência da Computação	pt_BR
dc.publisher.initials	UFBA	pt_BR
dc.publisher.country	Brasil	pt_BR
dc.subject.cnpq	Ciência da Computação	pt_BR
Aparece nas coleções:	Dissertação (PGCOMP)

Arquivos associados a este item:

Não existem arquivos associados a este item.

Mostrar registro simples do item Visualizar estatísticas

DSpace JSPUI

O DSpace preserva e provê acesso fácil e aberto a todos os tipos de objetos digitais, incluindo: textos, imagens, vídeos e conjuntos de dados