Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas

En este artículo se describe un sistema desarrollado para la extracción de grandes cuerpos de texto de Internet, teniendo como motivación el valor que ofrecen los ejemplos de lenguaje natural disponibles en la red para las tareas de aprendizaje no supervisado de dichos naturales, dado por caracterís...

ver descrição completa

Detalhes bibliográficos
Autores: Cadavid Rengifo, Héctor Fabio, Gómez Perdomo, Jonatan
Formato: artículo
Estado:Versión publicada
Fecha de publicación:2009
País:Colombia
Recursos:Escuela Colombiana de Ingeniería Julio Garavito
Repositorio:Repositorio Institucional ECI
Idioma:español
OAI Identifier:oai:repositorio.escuelaing.edu.co:001/1903
Acesso em linha:https://repositorio.escuelaing.edu.co/handle/001/1903
Access Level:acceso abierto
Palavra-chave:corpus web
crawler
aprendizaje no supervisado de lenguajes
programación concurrente
web corpus
unsupervised language learning
concurrent programming
id CO_ee72b0e8a55d215d466cae8a70fde6f8
oai_identifier_str oai:repositorio.escuelaing.edu.co:001/1903
network_acronym_str CO
network_name_str Colombia
repository_id_str
dc.title.none.fl_str_mv Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
title Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
spellingShingle Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
Cadavid Rengifo, Héctor Fabio
corpus web
crawler
aprendizaje no supervisado de lenguajes
programación concurrente
web corpus
crawler
unsupervised language learning
concurrent programming
title_short Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
title_full Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
title_fullStr Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
title_full_unstemmed Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
title_sort Sistema de extracción de cuerpos de texto de la web para tareas lingüísticas
dc.creator.none.fl_str_mv Cadavid Rengifo, Héctor Fabio
Gómez Perdomo, Jonatan
author Cadavid Rengifo, Héctor Fabio
author_facet Cadavid Rengifo, Héctor Fabio
Gómez Perdomo, Jonatan
author_role author
author2 Gómez Perdomo, Jonatan
author2_role author
dc.contributor.none.fl_str_mv Informática
dc.subject.none.fl_str_mv corpus web
crawler
aprendizaje no supervisado de lenguajes
programación concurrente
web corpus
crawler
unsupervised language learning
concurrent programming
topic corpus web
crawler
aprendizaje no supervisado de lenguajes
programación concurrente
web corpus
crawler
unsupervised language learning
concurrent programming
description En este artículo se describe un sistema desarrollado para la extracción de grandes cuerpos de texto de Internet, teniendo como motivación el valor que ofrecen los ejemplos de lenguaje natural disponibles en la red para las tareas de aprendizaje no supervisado de dichos naturales, dado por características como su enorme volumen, permanente actualización respecto de las alteraciones del lenguaje, y bajo costo, en tiempo y recursos, en cuanto a los mecanismos tradicionales de construcción de corpus para esas tareas de aprendizaje. Se presentan las estrategias incorporadas al sistema con el fin de maximizar el aprovechamiento de los recursos de hardware y así reducir los tiempos de extracción, al igual que se presentan las características de extensibilidad para los formatos soportados, y adaptabilidad respecto a la manera como el sistema limpia los contenidos para obtener muestras de lenguaje natural puras. Al final del artículo se presentan los resultados experimentales obtenidos con uno de los dominios de contenido en español más grande de Internet: es.wikipedia.org, a través de los cuales se concluye sobre la validez y aplicabilidad de un corpus extraído directamente de la Internet para un eventual proceso de aprendizaje de morfología o sintaxis.
publishDate 2009
dc.date.none.fl_str_mv 2009
2021-12-04T16:03:44Z
2021-12-04T16:03:44Z
dc.type.none.fl_str_mv Artículo de revista
info:eu-repo/semantics/publishedVersion
http://purl.org/coar/resource_type/c_6501
Text
info:eu-repo/semantics/article
http://purl.org/redcol/resource_type/ART
format article
status_str publishedVersion
dc.identifier.none.fl_str_mv 01205609
https://repositorio.escuelaing.edu.co/handle/001/1903
identifier_str_mv 01205609
url https://repositorio.escuelaing.edu.co/handle/001/1903
dc.language.none.fl_str_mv spa
language spa
dc.relation.none.fl_str_mv 60
3
54
29
N/A
Ingeniería e Investigación
Chomsky, N., Knowledge of Language: Its Nature, Origin, and Use., Praeger, 1986.
Clark, A., Unsupervised Language Acquisition: Theory and Practice., Tesis presentada a la Universidad Génova, para optar al grado de Doctor of Philosophy, Dicembre, 2002.
Parekh, R., Honavar, V., Grammar inference, automata induction, and language acquisition., 2000.
Navigli, R., Velardi, P., Gangemi, A., Ontology learning and its application to automated terminology translation., IEEE Intelligent Systems, Vol. 18, No. 1, 2003, pp. 22­31.
Zhou, L., Ontology learning: state of the art and open issues., Information Technology and Management archive, Vol. 8 , No. 3, September, 2007, pp. 241­252.
Church, K. W., Mercer, R. L., Introduction to the special issue on computational linguistics using large corpora., Comput. Linguist., Vol. 19, No. 1, 1993, pp. 1­24.
Marianne Hundt, N. N., Biewer, C., Corpus Linguistics and the Web., Language and Computers 59, Kenilworth: Rodopi, 2007.
Keller, F., Lapata, M., Using the web to obtain frequencies for unseen bigrams., Comput. Linguist., Vol. 29, No. 3, 2003, pp. 459­484.
Kilgarriff, A., Grefenstette, G., Introduction to the special issue on the web as corpus., Computational Linguistics, Vol. 29, 2003, pp. 333­347.
Miller, R. C., Bharat, K., Sphinx: a framework for creating personal, site-specific web crawlers., in WWW7: Proceedings of the seventh international conference on World Wide Web 7, (Amsterdam, The Netherlands, The Netherlands), Elsevier Science Publishers B. V., 1998., pp. 119­130.
Kehoe, A. R., Webcorp: Applying the web to linguistics and linguistics to the web., in WWW2002 Conference, Honolulu, Hawaii, 2002.
Mattson, G., Sanders, B. A., Massingill. B. L., Patterns for Parallel Programming., Addison-Wesley Professional, 2004.
Krishnamurthy, A., Yelick, K., Optimizing parallel programs with explicit synchronization., SIGPLAN Not. 30, 1995, pp. 96-204.
Gelbukh, A., Sidorov, G., Procesamiento automático del español con enfoque en recursos léxicos grandes., IPN, Mexico, 2006.
dc.rights.none.fl_str_mv https://creativecommons.org/licenses/by/4.0/
info:eu-repo/semantics/openAccess
Atribución 4.0 Internacional (CC BY 4.0)
rights_invalid_str_mv https://creativecommons.org/licenses/by/4.0/
Atribución 4.0 Internacional (CC BY 4.0)
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv 7 páginas.
application/pdf
application/pdf
dc.publisher.none.fl_str_mv Scielo
Colombia
publisher.none.fl_str_mv Scielo
Colombia
dc.source.none.fl_str_mv http://www.scielo.org.co/scielo.php?script=sci_arttext&pid=S0120-56092009000300009
reponame:Repositorio Institucional ECI
instname:Escuela Colombiana de Ingeniería Julio Garavito
instacron:Escuela Colombiana de Ingeniería Julio Garavito
instname_str Escuela Colombiana de Ingeniería Julio Garavito
instacron_str Escuela Colombiana de Ingeniería Julio Garavito
institution Escuela Colombiana de Ingeniería Julio Garavito
reponame_str Repositorio Institucional ECI
collection Repositorio Institucional ECI
_version_ 1825051860952678400
spelling Sistema de extracción de cuerpos de texto de la web para tareas lingüísticasCadavid Rengifo, Héctor FabioGómez Perdomo, Jonatancorpus webcrawleraprendizaje no supervisado de lenguajesprogramación concurrenteweb corpuscrawlerunsupervised language learningconcurrent programmingEn este artículo se describe un sistema desarrollado para la extracción de grandes cuerpos de texto de Internet, teniendo como motivación el valor que ofrecen los ejemplos de lenguaje natural disponibles en la red para las tareas de aprendizaje no supervisado de dichos naturales, dado por características como su enorme volumen, permanente actualización respecto de las alteraciones del lenguaje, y bajo costo, en tiempo y recursos, en cuanto a los mecanismos tradicionales de construcción de corpus para esas tareas de aprendizaje. Se presentan las estrategias incorporadas al sistema con el fin de maximizar el aprovechamiento de los recursos de hardware y así reducir los tiempos de extracción, al igual que se presentan las características de extensibilidad para los formatos soportados, y adaptabilidad respecto a la manera como el sistema limpia los contenidos para obtener muestras de lenguaje natural puras. Al final del artículo se presentan los resultados experimentales obtenidos con uno de los dominios de contenido en español más grande de Internet: es.wikipedia.org, a través de los cuales se concluye sobre la validez y aplicabilidad de un corpus extraído directamente de la Internet para un eventual proceso de aprendizaje de morfología o sintaxis.Internet content, used as text corpus for natural language learning, offers important characteristics for such task, like its huge volume, being permanently up-to-date with linguistic variants and having low time and resource costs regarding the traditional way that text is built for natural language machine learning tasks. This paper describes a system for the automatic extraction of large bodies of text from the Internet as a valuable tool for such learning tasks. A concurrent programming-based, hardware-use optimisation strategy significantly improving extraction performance is also presented. The strategies incorporated into the system for maximising hardware resource exploitation, thereby reducing extraction time are presented, as are extendibility (supporting digital-content formats) and adaptability (regarding how the system cleanses content for obtaining pure natural language samples). The experimental results obtained after processing one of the biggest Spanish domains on the internet, are presented (i.e. es.wikipedia.org). Such results are used for presenting initial conclusions about the validity and applicability of corpus directly extracted from Internet as morphological or syntactical learning input.ScieloColombiaInformática2021-12-04T16:03:44Z2021-12-04T16:03:44Z2009Artículo de revistainfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_6501Textinfo:eu-repo/semantics/articlehttp://purl.org/redcol/resource_type/ART7 páginas.application/pdfapplication/pdf01205609https://repositorio.escuelaing.edu.co/handle/001/1903http://www.scielo.org.co/scielo.php?script=sci_arttext&pid=S0120-56092009000300009reponame:Repositorio Institucional ECIinstname:Escuela Colombiana de Ingeniería Julio Garavitoinstacron:Escuela Colombiana de Ingeniería Julio Garavitospa6035429N/AIngeniería e InvestigaciónChomsky, N., Knowledge of Language: Its Nature, Origin, and Use., Praeger, 1986.Clark, A., Unsupervised Language Acquisition: Theory and Practice., Tesis presentada a la Universidad Génova, para optar al grado de Doctor of Philosophy, Dicembre, 2002.Parekh, R., Honavar, V., Grammar inference, automata induction, and language acquisition., 2000.Navigli, R., Velardi, P., Gangemi, A., Ontology learning and its application to automated terminology translation., IEEE Intelligent Systems, Vol. 18, No. 1, 2003, pp. 22­31.Zhou, L., Ontology learning: state of the art and open issues., Information Technology and Management archive, Vol. 8 , No. 3, September, 2007, pp. 241­252.Church, K. W., Mercer, R. L., Introduction to the special issue on computational linguistics using large corpora., Comput. Linguist., Vol. 19, No. 1, 1993, pp. 1­24.Marianne Hundt, N. N., Biewer, C., Corpus Linguistics and the Web., Language and Computers 59, Kenilworth: Rodopi, 2007.Keller, F., Lapata, M., Using the web to obtain frequencies for unseen bigrams., Comput. Linguist., Vol. 29, No. 3, 2003, pp. 459­484.Kilgarriff, A., Grefenstette, G., Introduction to the special issue on the web as corpus., Computational Linguistics, Vol. 29, 2003, pp. 333­347.Miller, R. C., Bharat, K., Sphinx: a framework for creating personal, site-specific web crawlers., in WWW7: Proceedings of the seventh international conference on World Wide Web 7, (Amsterdam, The Netherlands, The Netherlands), Elsevier Science Publishers B. V., 1998., pp. 119­130.Kehoe, A. R., Webcorp: Applying the web to linguistics and linguistics to the web., in WWW2002 Conference, Honolulu, Hawaii, 2002.Mattson, G., Sanders, B. A., Massingill. B. L., Patterns for Parallel Programming., Addison-Wesley Professional, 2004.Krishnamurthy, A., Yelick, K., Optimizing parallel programs with explicit synchronization., SIGPLAN Not. 30, 1995, pp. 96-204.Gelbukh, A., Sidorov, G., Procesamiento automático del español con enfoque en recursos léxicos grandes., IPN, Mexico, 2006.https://creativecommons.org/licenses/by/4.0/info:eu-repo/semantics/openAccessAtribución 4.0 Internacional (CC BY 4.0)2021-12-05T08:02:03Z
score 15.223283