Neural Information Extraction from Semi-structured Documents

Sectors com la informació i tecnologia d'assegurances, finances i legal, processen un continu de factures, justificants, reclamacions o similar diàriament. L'èxit en l'automatització d'aquestes transaccions es basa en l'habilitat de digitalitzar correctament el contingut tex...

Descripción completa

Detalles Bibliográficos
Autor: Carbonell Nuñez, Manuel
Tipo de recurso: tesis doctoral
Estado:Versión publicada
Fecha de publicación:2020
País:España
Institución:CBUC, CESCA
Repositorio:TDR. Tesis Doctorales en Red
OAI Identifier:oai:www.tdx.cat:10803/671583
Acceso en línea:http://hdl.handle.net/10803/671583
Access Level:acceso abierto
Palabra clave:Inteligencia artificial
Artificial intelligence
Visió per computador
Visión por computador
Computer vision
Documents
Documentos
Tecnologies
004
id ES_ce07e083364bfcf9200c8e8afc85bdc9
oai_identifier_str oai:www.tdx.cat:10803/671583
network_acronym_str ES
network_name_str España
repository_id_str
spelling Neural Information Extraction from Semi-structured DocumentsCarbonell Nuñez, ManuelInteligencia artificialArtificial intelligenceVisió per computadorVisión por computadorComputer visionDocumentsDocumentosTecnologies004Sectors com la informació i tecnologia d'assegurances, finances i legal, processen un continu de factures, justificants, reclamacions o similar diàriament. L'èxit en l'automatització d'aquestes transaccions es basa en l'habilitat de digitalitzar correctament el contingut textual així com incorporar la comprensió semàntica. Aquest procés, conegut com Extracció d'Informació (EI) consisteix en diversos passos que són, el reconeixement de el text, la identificació d'entitats nomenades i en ocasions en reconèixer relacions entre aquestes entitats. En el nostre treball vam explorar models neurals multi-tasca a nivell d'imatge i de graf per solucionar els passos d'aquest procés de forma unificada. En el camí, vam estudiar els beneficis i inconvenients d'aquests enfocaments en comparació amb mètodes que resolen les tasques seqüencialment per separat.Sectores como la información y tecnología de seguros, finanzas y legal, procesan un continuo de facturas, justificantes, reclamaciones o similar diariamente. El éxito en la automatización de estas transacciones se basa en la habilidad de digitalizar correctamente el contenido textual asi como incorporar la comprensión semántica. Este proceso, conococido como Extracción de Información (EI) consiste en varios pasos que son, el reconocimiento del texto, la identificación de entidades nombradas y en ocasiones en reconocer relaciones entre estas entidades. En nuestro trabajo exploramos modelos neurales multi-tarea a nivel de imagen y de grafo para solucionar los pasos de este proceso de forma unificada. En el camino, estudiamos los beneficios e inconvenientes de estos enfoques en comparación con métodos que resuelven las tareas secuencialmente por separado.Sectors as fintech, legaltech or insurance process an inflow of million of forms, invoices, id documents, claims or similar every day. The success in the automation of these transactions depends on the ability to correctly digitize the textual content as well as to incorporate semantic understanding. This procedure, known as information extraction (IE) comprises the steps of localizing and recognizing text, identifying named entities contained in it and optionally finding relationships among its elements. In this work we explore multi-task neural models at image and graph level to solve all steps in a unified way. While doing so we find benefits and limitations of these end-to-end approaches in comparison with sequential separate methods.Universitat Autònoma de Barcelona. Programa de Doctorat en InformàticaUniversitat Autònoma de BarcelonaFornés Bisquerra, AliciaVillegas Santamaría, MauricioLladós, Josep202120212020info:eu-repo/semantics/doctoralThesisinfo:eu-repo/semantics/publishedVersion105 p.application/pdfapplication/pdfhttp://hdl.handle.net/10803/671583TDX (Tesis Doctorals en Xarxa)reponame:TDR. Tesis Doctorales en Redinstname:CBUC, CESCAInglésL'accés als continguts d'aquesta tesi queda condicionat a l'acceptació de les condicions d'ús establertes per la següent llicència Creative Commons: http://creativecommons.org/licenses/by-nc-nd/4.0/http://creativecommons.org/licenses/by-nc-nd/4.0/info:eu-repo/semantics/openAccessoai:www.tdx.cat:10803/6715832026-06-14T12:46:07Z
dc.title.none.fl_str_mv Neural Information Extraction from Semi-structured Documents
title Neural Information Extraction from Semi-structured Documents
spellingShingle Neural Information Extraction from Semi-structured Documents
Carbonell Nuñez, Manuel
Inteligencia artificial
Artificial intelligence
Visió per computador
Visión por computador
Computer vision
Documents
Documentos
Tecnologies
004
title_short Neural Information Extraction from Semi-structured Documents
title_full Neural Information Extraction from Semi-structured Documents
title_fullStr Neural Information Extraction from Semi-structured Documents
title_full_unstemmed Neural Information Extraction from Semi-structured Documents
title_sort Neural Information Extraction from Semi-structured Documents
dc.creator.none.fl_str_mv Carbonell Nuñez, Manuel
author Carbonell Nuñez, Manuel
author_facet Carbonell Nuñez, Manuel
author_role author
dc.contributor.none.fl_str_mv Fornés Bisquerra, Alicia
Villegas Santamaría, Mauricio
Lladós, Josep
dc.subject.none.fl_str_mv Inteligencia artificial
Artificial intelligence
Visió per computador
Visión por computador
Computer vision
Documents
Documentos
Tecnologies
004
topic Inteligencia artificial
Artificial intelligence
Visió per computador
Visión por computador
Computer vision
Documents
Documentos
Tecnologies
004
description Sectors com la informació i tecnologia d'assegurances, finances i legal, processen un continu de factures, justificants, reclamacions o similar diàriament. L'èxit en l'automatització d'aquestes transaccions es basa en l'habilitat de digitalitzar correctament el contingut textual així com incorporar la comprensió semàntica. Aquest procés, conegut com Extracció d'Informació (EI) consisteix en diversos passos que són, el reconeixement de el text, la identificació d'entitats nomenades i en ocasions en reconèixer relacions entre aquestes entitats. En el nostre treball vam explorar models neurals multi-tasca a nivell d'imatge i de graf per solucionar els passos d'aquest procés de forma unificada. En el camí, vam estudiar els beneficis i inconvenients d'aquests enfocaments en comparació amb mètodes que resolen les tasques seqüencialment per separat.
publishDate 2020
dc.date.none.fl_str_mv 2020
2021
2021
dc.type.none.fl_str_mv info:eu-repo/semantics/doctoralThesis
info:eu-repo/semantics/publishedVersion
format doctoralThesis
status_str publishedVersion
dc.identifier.none.fl_str_mv http://hdl.handle.net/10803/671583
url http://hdl.handle.net/10803/671583
dc.language.none.fl_str_mv Inglés
language_invalid_str_mv Inglés
dc.rights.none.fl_str_mv http://creativecommons.org/licenses/by-nc-nd/4.0/
info:eu-repo/semantics/openAccess
rights_invalid_str_mv http://creativecommons.org/licenses/by-nc-nd/4.0/
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv 105 p.
application/pdf
application/pdf
dc.publisher.none.fl_str_mv Universitat Autònoma de Barcelona
publisher.none.fl_str_mv Universitat Autònoma de Barcelona
dc.source.none.fl_str_mv TDX (Tesis Doctorals en Xarxa)
reponame:TDR. Tesis Doctorales en Red
instname:CBUC, CESCA
instname_str CBUC, CESCA
reponame_str TDR. Tesis Doctorales en Red
collection TDR. Tesis Doctorales en Red
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869419931539341312
score 15,301629