Uma abordagem baseada em aprendizagem de máquina e grafos para segmentação de páginas

Detalhes bibliográficos
Ano de defesa: 2023
Autor(a) principal: Maia, Ana Lucia Lima Marreiros
Orientador(a): Não Informado pela instituição
Banca de defesa: Não Informado pela instituição
Tipo de documento: Tese
Tipo de acesso: Acesso aberto
Idioma: por
Instituição de defesa: Biblioteca Digitais de Teses e Dissertações da USP
Programa de Pós-Graduação: Não Informado pela instituição
Departamento: Não Informado pela instituição
País: Não Informado pela instituição
Palavras-chave em Português:
Link de acesso: https://www.teses.usp.br/teses/disponiveis/45/45134/tde-31072023-115633/
Resumo: Muitos documentos originalmente gerados em papel são digitalizados para possibilitar sua preservação ou para agilizar seu processamento por meio de ferramentas computacionais. Consultar documentos em bancos de dados de imagens ou extrair informações de interesse de imagens de documentos requer a análiseddo conteúdo da imagem. Em particular, uma etapa crítica nesta análise é a análise lógica de leiaute, que consiste em detectar os componentes da página e identificar suas funções lógicas. A análise lógica de leiaute permite estabelecer as relações entre os componentes e determinar informações mportantes, como a ordem de leitura. Uma etapa fundamental na análise lógica de leiaute é detectar e classificar essas componentes de página, como blocos de texto, figuras e tabelas, problema conhecido como segmentação de página. Nesta tese, propomos um método que segue uma abordagem bottom-up, combinando modelagem de grafos e técnicas de aprendizado de máquina, para o problema de segmentação de páginas. O método proposto consiste em um pipeline no qual algumas etapas estratégicas são implementadas por meio de algoritmos de aprendizado de máquina. Como os algoritmos de aprendizado de máquina são treináveis a partir de dados, o método proposto pode ser facilmente adaptado a conjuntos de documentos com diferentes características, desde que os dados de treinamento estejam disponíveis. Esta tese também discute um procedimento experimental para otimizar o pipeline. Os experimentos utilizaram imagens de documentos (revistas e artigos científicos) do PRIMA Layout Analysis Dataset, com leiautes diversificados e complexos. Os resultados experimentais demonstram o potencial do método proposto.