Distilling Structure from Imagery: Graph-based Models for the Interpretation of Document Images

Des del seu inici, la comunitat investigadora sobre reconeixement de patrons i visió per computador ha reconegut la importància d’aprofitar la informació estructural de les imatges. Els grafs s’han seleccionat com el marc adequat per representar aquest tipus d’informació a causa de la seva flexibili...

Descripción completa

Detalles Bibliográficos
Autor: Riba Fiérrez, Pau
Tipo de recurso: tesis doctoral
Estado:Versión publicada
Fecha de publicación:2020
País:España
Institución:CBUC, CESCA
Repositorio:TDR. Tesis Doctorales en Red
OAI Identifier:oai:www.tdx.cat:10803/670774
Acceso en línea:http://hdl.handle.net/10803/670774
Access Level:acceso abierto
Palabra clave:Visió per computador
Visión por computador
Computer vision
Reconeixement de patrons
Reconocimiento de patrones
Pattern recognition
Representacions basades en Grafs
Representaciones basadas en Grafos
Graph-based representati
Tecnologies
004
Descripción
Sumario:Des del seu inici, la comunitat investigadora sobre reconeixement de patrons i visió per computador ha reconegut la importància d’aprofitar la informació estructural de les imatges. Els grafs s’han seleccionat com el marc adequat per representar aquest tipus d’informació a causa de la seva flexibilitat i poder de representació capaç de codificar, tant els components, objectes i entitats com les seves relacions. Tot i que els grafs s’han aplicat amb èxit a una gran varietat de tasques -com a resultat de la seva naturalesa simbòlica i relacional- sempre han patit d’algunes limitacions comparats amb mètodes estadístics. Això es deu al fet que algunes operacions matemàtiques trivials no tenen una equivalència en el domini dels grafs. Per exemple, en la base de moltes aplicacions de reconeixement de patrons hi ha la necessitat de comparar objectes. No obstant això, aquesta operació trivial no està degudament definida per grafs quan considerem vectors de característiques. Al llarg d’aquesta recerca, el principal domini d’aplicació està basat en el tema de l’Anàlisi i Reconeixement d’Imatges de Documents. Aquest és un subcamp de la Visió per Computador que té com a objectiu compendre imatges de documents. En aquest context, l’estructura -particularment la representació en forma de graf- proporciona una dimensió complementària al contingut de la imatge. En Visió per Computador la primera dificultat que ens trobem recau en construir una representació significativa de grafs capaç de codificar les característiques rellevants d’una imatge donada. Això es deu al fet que és un procés que ha de trobar un equilibri entre la simplicitat de la representació i la flexibilitat, per tal de representar les diferents deformacions que apareixen en cada domini d’aplicació. Hem estudiat aquest tema en l’aplicació de la recerca de paraules, dividint els diferents traços en grafemes –les unitats més petites d’un alfabet manuscrit&-. També, hem investigat diferents metodologies per accelerar el procés de comparació entre grafs perquè la recerca de paraules o, inclús, de forma més general, l’aplicació en la recerca de grafs, pugui incloure grans col·leccions de documents. Aquestes metodologies han estat principalment dues: (a) un sistema d’indexació de grafs combinat amb un sistema de votació en l’àmbit de nodes capaç d’eliminar resultats improbables i (b) usant representacions jeràrquiques de grafs que duen a terme la majoria de les comparacions en una versió reduïda del graf original, mitjançant comparatives entre els nivells més abstractes i els més detallats. A més a més, la representació jeràrquica també ha demostrat obtenir una representació més robusta que el graf original, lidiant amb el soroll i les deformacions de manera elegant. Per tant, proposem explotar aquesta informació en forma de codificació jeràrquica del graf que permeti utilitzar tècniques estadístiques clàssiques. Els nous avenços en aprenentatge profund geomètric han aparegut com una generalització de les metodologies d’aprenentatge profund aplicades a dominis no Euclidians –com grafs i varietats–, i han promogut un gran interès en la comunitat científica per aquests esquemes de representació. Així doncs, proposem una distància de grafs capaç d’obtenir resultats comparables a l’estat de l’art en diferents tasques aprofitant aquests nous desenvolupaments, però considerant les metodologies tradicionals com a base. També hem realitzat una col·laboració industrial amb la finalitat d’extreure informació automàtica de les factures de l’empresa (amb dades anònimes). El resultat ha estat el desenvolupament d’un sistema de detecció de taules en documents administratius. D’aquesta manera les xarxes neuronals basades en grafs han demostrat ser aptes per detectar patrons repetitius, els quals, després d’un procés d’agregació, constitueixen una taula.