[en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE

Detalhes bibliográficos
Autor(a) principal: MATHEUS TELLES WERNER
Data de Publicação: 2020
Tipo de documento: Tese
Idioma: eng
Título da fonte: Repositório Institucional da PUC-RIO (Projeto Maxwell)
Texto Completo: https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=1
https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=2
http://doi.org/10.17771/PUCRio.acad.47317
Resumo: [pt] O Word Mover s Distance (WMD) proposto por Kusner et al. [ICML,2015] é uma função de distância entre documentos que se aproveita das relações semânticas entre palavras extraidas por suas Word Embeddings. Essa função de distância se mostrou bastante eficaz, obtendo taxas de erro estado da arte para problemas de classificação, porém ao mesmo tempo inviável para largas coleções ou grandes documentos devido a ser necessário computar um problema de transporte em um grafo bipartido completo para cada par de documentos. Assumindo algumas hipóteses, que são respaldadas por propriedades empíricas das distâncias entre as Word Embeddings, nós simplificamos o WMD de forma a obter uma nova função de distância o qual requer a solução de um problema de fluxo máximo em um grafo esparço, que pode ser resolvido mais rapidamente do que um problema de transporte em um grafo denso. Nossos experimentos mostram que conseguimos obter ganhos de performance até três ordens de magnitude acima do WMD enquanto mantendo as mesmas taxas de erro na tarefa de classificação de documentos.
id PUC_RIO-1_24a85f32a35fb3eabbbef8f6fa5a287c
oai_identifier_str oai:MAXWELL.puc-rio.br:47317
network_acronym_str PUC_RIO-1
network_name_str Repositório Institucional da PUC-RIO (Projeto Maxwell)
repository_id_str 534
spelling [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE [pt] UMA ABORDAGEM RÁPIDA E ECONÔMICA PARA WORD MOVER S DISTANCE [pt] DISTANCIA ENTRE DOCUMENTOS[pt] WORD MOVER S DISTANCE[pt] WORD EMBEDDINGS[en] DOCUMENT DISTANCE[en] WORD MOVER S DISTANCE[en] WORD EMBEDDINGS[pt] O Word Mover s Distance (WMD) proposto por Kusner et al. [ICML,2015] é uma função de distância entre documentos que se aproveita das relações semânticas entre palavras extraidas por suas Word Embeddings. Essa função de distância se mostrou bastante eficaz, obtendo taxas de erro estado da arte para problemas de classificação, porém ao mesmo tempo inviável para largas coleções ou grandes documentos devido a ser necessário computar um problema de transporte em um grafo bipartido completo para cada par de documentos. Assumindo algumas hipóteses, que são respaldadas por propriedades empíricas das distâncias entre as Word Embeddings, nós simplificamos o WMD de forma a obter uma nova função de distância o qual requer a solução de um problema de fluxo máximo em um grafo esparço, que pode ser resolvido mais rapidamente do que um problema de transporte em um grafo denso. Nossos experimentos mostram que conseguimos obter ganhos de performance até três ordens de magnitude acima do WMD enquanto mantendo as mesmas taxas de erro na tarefa de classificação de documentos.[en] The Word Mover s Distance (WMD) proposed in Kusner et. al. [ICML,2015] is a distance between documents that takes advantage of semantic relations among words that are captured by their Word Embeddings. This distance proved to be quite effective, obtaining state-of-the-art error rates for classification tasks, but also impracticable for large collections or documents because it needs to compute a transportation problem on a complete bipartite graph for each pair of documents. By using assumptions, that are supported by empirical properties of the distances between Word Embeddings, we simplify WMD so that we obtain a new distance whose computation requires the solution of a max flow problem in a sparse graph, which can be solved much faster than the transportation problem in a dense graph. Our experiments show that we can obtain a performance gain up to three orders of magnitude over WMD while maintaining the same error rates in document classification tasks.MAXWELLEDUARDO SANY LABEREDUARDO SANY LABERMATHEUS TELLES WERNER2020-04-02info:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/doctoralThesishttps://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=1https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=2http://doi.org/10.17771/PUCRio.acad.47317engreponame:Repositório Institucional da PUC-RIO (Projeto Maxwell)instname:Pontifícia Universidade Católica do Rio de Janeiro (PUC-RIO)instacron:PUC_RIOinfo:eu-repo/semantics/openAccess2022-08-04T00:00:00Zoai:MAXWELL.puc-rio.br:47317Repositório InstitucionalPRIhttps://www.maxwell.vrac.puc-rio.br/ibict.phpopendoar:5342022-08-04T00:00Repositório Institucional da PUC-RIO (Projeto Maxwell) - Pontifícia Universidade Católica do Rio de Janeiro (PUC-RIO)false
dc.title.none.fl_str_mv [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
[pt] UMA ABORDAGEM RÁPIDA E ECONÔMICA PARA WORD MOVER S DISTANCE
title [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
spellingShingle [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
MATHEUS TELLES WERNER
[pt] DISTANCIA ENTRE DOCUMENTOS
[pt] WORD MOVER S DISTANCE
[pt] WORD EMBEDDINGS
[en] DOCUMENT DISTANCE
[en] WORD MOVER S DISTANCE
[en] WORD EMBEDDINGS
title_short [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
title_full [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
title_fullStr [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
title_full_unstemmed [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
title_sort [en] A FAST AND SPACE-ECONOMICAL APPROACH TO WORD MOVER S DISTANCE
author MATHEUS TELLES WERNER
author_facet MATHEUS TELLES WERNER
author_role author
dc.contributor.none.fl_str_mv EDUARDO SANY LABER
EDUARDO SANY LABER
dc.contributor.author.fl_str_mv MATHEUS TELLES WERNER
dc.subject.por.fl_str_mv [pt] DISTANCIA ENTRE DOCUMENTOS
[pt] WORD MOVER S DISTANCE
[pt] WORD EMBEDDINGS
[en] DOCUMENT DISTANCE
[en] WORD MOVER S DISTANCE
[en] WORD EMBEDDINGS
topic [pt] DISTANCIA ENTRE DOCUMENTOS
[pt] WORD MOVER S DISTANCE
[pt] WORD EMBEDDINGS
[en] DOCUMENT DISTANCE
[en] WORD MOVER S DISTANCE
[en] WORD EMBEDDINGS
description [pt] O Word Mover s Distance (WMD) proposto por Kusner et al. [ICML,2015] é uma função de distância entre documentos que se aproveita das relações semânticas entre palavras extraidas por suas Word Embeddings. Essa função de distância se mostrou bastante eficaz, obtendo taxas de erro estado da arte para problemas de classificação, porém ao mesmo tempo inviável para largas coleções ou grandes documentos devido a ser necessário computar um problema de transporte em um grafo bipartido completo para cada par de documentos. Assumindo algumas hipóteses, que são respaldadas por propriedades empíricas das distâncias entre as Word Embeddings, nós simplificamos o WMD de forma a obter uma nova função de distância o qual requer a solução de um problema de fluxo máximo em um grafo esparço, que pode ser resolvido mais rapidamente do que um problema de transporte em um grafo denso. Nossos experimentos mostram que conseguimos obter ganhos de performance até três ordens de magnitude acima do WMD enquanto mantendo as mesmas taxas de erro na tarefa de classificação de documentos.
publishDate 2020
dc.date.none.fl_str_mv 2020-04-02
dc.type.status.fl_str_mv info:eu-repo/semantics/publishedVersion
dc.type.driver.fl_str_mv info:eu-repo/semantics/doctoralThesis
format doctoralThesis
status_str publishedVersion
dc.identifier.uri.fl_str_mv https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=1
https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=2
http://doi.org/10.17771/PUCRio.acad.47317
url https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=1
https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=47317&idi=2
http://doi.org/10.17771/PUCRio.acad.47317
dc.language.iso.fl_str_mv eng
language eng
dc.rights.driver.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.publisher.none.fl_str_mv MAXWELL
publisher.none.fl_str_mv MAXWELL
dc.source.none.fl_str_mv reponame:Repositório Institucional da PUC-RIO (Projeto Maxwell)
instname:Pontifícia Universidade Católica do Rio de Janeiro (PUC-RIO)
instacron:PUC_RIO
instname_str Pontifícia Universidade Católica do Rio de Janeiro (PUC-RIO)
instacron_str PUC_RIO
institution PUC_RIO
reponame_str Repositório Institucional da PUC-RIO (Projeto Maxwell)
collection Repositório Institucional da PUC-RIO (Projeto Maxwell)
repository.name.fl_str_mv Repositório Institucional da PUC-RIO (Projeto Maxwell) - Pontifícia Universidade Católica do Rio de Janeiro (PUC-RIO)
repository.mail.fl_str_mv
_version_ 1840643379556253696