Acrónimo del inglés. Base de datos pública y gratuita que contiene una extensa colección de secuencias de nucleótidos obtenidas a partir de más de 300.000 especies. Además de la secuencia, incluye información bibliográfica, anotaciones funcionales y, si se trata de una secuencia codificante, su traducción conceptual a proteína. Cada registro contiene una secuencia ininterrumpida de una molécula de polinucleótido (ADN genómico, ARN genómico, ARN precursor, ARNm (ADNc), ARN ribosómico, ARN de transferencia, ARN pequeño nuclear o ARN pequeño citoplasmático). De su gestión y distribución se encarga el NCBI (National Center for Biotechnology Information) en los Estados Unidos de América, con el ENA (European Nucleotide Archive) y el DDBJ (DNA Data Bank of Japan). Estas instituciones forman el consorcio INSDC (International Nucleotide Sequence Database Collaboration) que diariamente actualizan sus contenidos para que todas ellas dispongan de la misma información simultáneamente.
alineamiento de secuencias
Forma de representar y comparar dos o más secuencias o cadenas de ADN, ARN, o estructuras primarias proteicas para resaltar sus zonas de similitud, que podrían indicar o sugerir relaciones funcionales o evolutivas entre los ácidos nucleicos o proteínas consultados. Las secuencias alineadas se escriben con letras, que representan aminoácidos o nucleótidos, en filas de una matriz en las que, si es necesario, se insertan espacios para que las zonas con idéntica o similar estructura se alineen de forma paralela en la misma posición. Las secuencias alineadas suelen estar identificadas por un número situado a la izquierda que es el de acceso al GenBank, o a cualquier otra base de datos.
identificador gi
Acrónimo del inglés. En español, identificador de información genética. Es aquel asignado con carácter único por el NCBI a cada versión de cada registro de secuencia. A partir de 2016, el NCBI dejó de asignar este identificador a los nuevos registros y ya no se incluye en los formatos GenBank, GenPept o Fasta. Sin embargo, el gi se retiene en las secuencias que lo tenían asignado y sigue siendo aceptado como input en los servicios del NCBI que previamente lo aceptaban.
NCBI
Sigla del inglés. En español, Centro Nacional para la Información Biotecnológica de EE. UU. Es parte de la United States Library of Medicine, que es una rama de los National Institutes of Health (NIH) del Gobierno de EE. UU., y alberga una serie de bases de datos relevantes para la biotecnología y la biomedicina. Constituye una importante fuente de herramientas biotecnológicas y de servicios entre los que destacan el GenBank, PubMed y BLAST.
número de acceso
En bioinformática, es un identificador único asignado a un registro en una base de datos de secuencias biológicas. El registro puede contener distintos tipos de información, como una secuencia (ADN, ARN o proteína) y anotaciones sobre la misma, una estructura proteica o un conjunto de datos biológicos, como datos de transcriptómica. La estructura de los números de acceso es muy variable y es característica del tipo de registro y de la base de datos que lo asigna. Por ejemplo, el número de acceso de una secuencia de nucleótidos en GenBank/EMBL/DDBJ consta de una letra y cinco números (por ejemplo, X97398) o de dos letras y seis números (como, AF172350), mientras que el número de acceso de una estructura en el Protein Data Bank (PDB) consta de un dígito y tres letras u otra mezcla de letras y números (por ejemplo, 1OJ6, 3RGK). Si se introducen cambios en la secuencia o en las anotaciones del registro, lo que sí cambia es la versión de la secuencia, que se indica después del número de acceso, del que va separada por un punto (como, por ejemplo, FR820587.1). Si se producen cambios en el registro FRE820587.1, el nuevo registro tendrá un identificador FR820587.2. En cualquier caso, las bases de datos retornan siempre la última versión cuando se busca el número de acceso sin el número de versión.
RefSeq
Acrónimo del inglés. Base de datos de secuencias de referencia de acceso abierto, anotada y seleccionada que contiene secuencias de nucleótidos disponibles públicamente, así como de sus productos proteicos y que se introdujo en 2000. Está construida por el Centro Nacional de Información Biotecnológica (NCBI) y, a diferencia de GenBank, proporciona un registro único para cada molécula biológica (ADN, ARN o proteína) para los principales organismos, desde virus hasta procariotas y eucariotas, y también incluye secuencias artificiales, como vectores. Esta base de datos se deriva en su mayoría de registros del INSDC, pero solo es accesible desde el NCBI.
ENA
Acrónimo del inglés. En español, Archivo europeo de nucleótidos. Repositorio gestionado desde el Reino Unido, que proporciona acceso gratuito y sin restricciones a secuencias de ADN y ARN anotadas. Los datos son proporcionados por el Instituto Europeo de Bioinformática del Laboratorio Europeo de Biología Molecular (EMBL-EBI). También almacena información complementaria, como procedimientos experimentales, detalles del ensamblaje de secuencias y otros metadatos relacionados con proyectos de secuencia.
gi
Acrónimo del inglés. Identificador asignado por el NCBI, que consta de una serie de números y que se asigna consecutivamente a cada registro de secuencia de ácido nucleico o proteína en el NCBI, de manera que es único para cada versión de una secuencia. Aunque el NCBI sigue asignando este identificador, actualmente se fomenta la utilización preferente del número de acceso acompañado de la versión del registro (por ejemplo, FR820587.2).
INSDC
Sigla del inglés. En español, consorcio de colaboración internacional entre las organizaciones DDBJ, EMBL-EBI y NCBI, que intercambian diariamente diversas bases de datos de secuencias de nucleótidos, de acceso gratuito y sin restricciones.