[en] AN APPROACH TO MODEL, STORE AND ACCESS BIOLOGICAL SEQUENCES

[pt] As pesquisas na área da biologia molecular vêm produzindo um grande volume de dados e estes precisam ser bem organizados, estruturados e persistidos. Na sua grande maioria os dados biológicos são armazenados em arquivos no formato texto. Para grandes volumes de dados, o caminho natural seria ut...

Descripción completa

Detalles Bibliográficos
Autor: CRISTIAN TRISTAO
Tipo de recurso: tesis doctoral
Estado:Versión publicada
Fecha de publicación:2013
País:Brasil
Institución:Pontifícia Universidade Católica do Rio de Janeiro (PUC-RIO)
Repositorio:Repositório Institucional da PUC-RIO (Projeto Maxwell)
Idioma:portugués
OAI Identifier:oai:MAXWELL.puc-rio.br:21436
Acceso en línea:https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=21436&idi=1
https://www.maxwell.vrac.puc-rio.br/colecao.php?strSecao=resultado&nrSeq=21436&idi=2
http://doi.org/10.17771/PUCRio.acad.21436
Access Level:acceso abierto
Palabra clave:[pt] ESTRUTURA
[pt] BASE DE DADOS
[pt] MODELAGEM CONCEITUAL
[en] STRUCTURE
[en] BIG DATA
[en] CONCEPTUAL MODELING
Descripción
Sumario:[pt] As pesquisas na área da biologia molecular vêm produzindo um grande volume de dados e estes precisam ser bem organizados, estruturados e persistidos. Na sua grande maioria os dados biológicos são armazenados em arquivos no formato texto. Para grandes volumes de dados, o caminho natural seria utilizar SGBDs para gerenciá-los. Contudo, estes sistemas não possuem estruturas adequadas para representar e manipular dados específicos ao domínio. Por exemplo, sequências biológicas normalmente são tratadas como simples cadeias de caracteres (tipo texto/varchar) ou BLOB, e desta forma perde-se todo um conjunto de informações composicionais, posicionais e de conteúdo. Esta tese argumenta que a gerência de dados (estrutura, armazenamento e acesso de dados) se transformou em um dos principais problemas para o domínio de pesquisas da bioinformática. Desta maneira propõe-se um modelo conceitual biológico para representar informações do dogma central da biologia molecular, bem como um tipo abstrato de dado (ADT – do inglês Abstract Data Types) específico para a manipulação de sequências biológicas e seus derivados.