Detalhes bibliográficos
Ano de defesa: |
2019 |
Autor(a) principal: |
Lima, Thiago Machado
 |
Orientador(a): |
Vieira, Renata
 |
Banca de defesa: |
Não Informado pela instituição |
Tipo de documento: |
Dissertação
|
Tipo de acesso: |
Acesso aberto |
Idioma: |
eng |
Instituição de defesa: |
Pontifícia Universidade Católica do Rio Grande do Sul
|
Programa de Pós-Graduação: |
Programa de Pós-Graduação em Ciência da Computação
|
Departamento: |
Escola Politécnica
|
País: |
Brasil
|
Palavras-chave em Português: |
|
Palavras-chave em Inglês: |
|
Área do conhecimento CNPq: |
|
Link de acesso: |
http://tede2.pucrs.br/tede2/handle/tede/9079
|
Resumo: |
Resolução de Correferência é uma tarefa que consiste em identificar menções em um discurso que se referem a uma mesma entidade. A tarefa tem o potencial de aprimorar outras tarefas de Processamento de Linguagem Natural como análise de sentimentos, extração de informação, sistemas de pergunta-resposta, entre outras. Algumas relações de correferência podem ser identificadas utilizando-se regras lexicais e sintáticas, enquanto para outras é necessário conhecimento semântico. No entanto, poucos trabalhos de resolução de correferência focaram em melhorias que possam ser realizadas com conhecimento semântico. O objetivo deste trabalho é aprimorar a tarefa de resolução de correferência utilizando semântica. Para isso, foram revisados os recursos semânticos disponíveis para o Português, dos quais foram selecionados para os experimentos o ContoPT, o Concept- Net e um modelo de word embeddings. Os experimentos foram realizados no CORP, uma ferramenta de correferência para o Português que já utiliza o OntoPT como recurso semântico. A avaliação foi composta pelas métricas MUC, B3 e CEAFe, utilizando-se os corpora Corref-PT e Summ-it++. Ao comparar com o OntoPT, obtivemos melhores resultados em termos de Medida-F utilizando o ContoPT e o ConceptNet. Nos experimentos com a regra de similaridade semântica que utiliza o modelo de word embeddings não foi posível atingirmos os resultados obtidos com as bases semânticas estruturadas. Textos com mais relações semânticas foram selecionados para análise de erros, na qual observamos algumasdificuldades envolvendo a detecção de relacionamentos semânticos. Para tratar essas dificuldades foram propostas melhorias. Como contribuição este trabalho traz, além da análise das bases, uma nova versão do CORP integrada com três novos recursos semânticos. A nova versão obteve uma maior Medida-F utilizando semântica em relação à versão anterior que utiliza o OntoPT. |