Forma más utilizada actualmente para representar pangenomas. 1. (variation graph or sequence graph). Estructura que representa todas las secuencias genómicas (genes, variantes, inserciones, deleciones, etc.) presentes en una población o especie determinada, organizadas en un grafo donde los nodos representan fragmentos de ADN y los arcos o bordes, conectan estos fragmentos según las distintas posibles secuencias que pueden existir en diferentes individuos. Se trata una de representación computacional del conjunto completo de la variación genética dentro de una especie (o grupo de organismos relacionados), que utiliza una estructura de grafo, en lugar de una secuencia lineal usual. Las herramientas más comunes actualmente, aunque en constante evolución y por tanto, aunque en riesgo de quedar obsoletas o superadas por otras, son: i) kit de herramientas de grafos de variación (VG Toolkit); ii) minigrafo / minigrafo-cactus (minigraph / minigraph-cactus); iii) constructor de grafos de pangenoma (pangenome graph builder, pggb); y iv) ensamblaje gráfico de fragmentos (graphical fragment assembly, gfa). 2. Grafos de de Bruijn coloreados (colored de Bruijn graphs). Este tipo es una extensión del grafo de de Bruijn tradicional, donde cada nodo (kámeros o k-mer) está «coloreado» para indicar en qué genomas o muestras están presentes. Los «colores» no son colores literales, sino etiquetas que indican la procedencia. El grafo de de Bruijn resulta muy útil para representar grandes conjuntos de genomas bacterianos.
pangenoma
Conjunto de genes presentes en los genomas secuenciados de todas las cepas de una misma especie o de un grupo relacionado de organismos. Representa la diversidad genética total de esa especie. Esta definición de pangenoma, denominada “pangenoma de presencia-ausencia” (presence–absence variation pangenome), es la más común en la literatura científica, aunque algunos especialistas en la disciplina de Pangenómica definen tres tipos de pangenoma, que implican diferencias en la representación del mismo y en su inclusión de genes y secuencias no codificantes. El pangenoma se divide en dos componentes principales: i) genoma central o núcleo, que representa a los genes que están presentes en todas las cepas y por estar conservados son esenciales para las funciones básicas de la especie; y ii) genoma accesorio o dispensable, que representa los genes que están presentes únicamente en algunas cepas. Estos genes diferenciales suelen estar relacionados con la adaptación al ambiente, resistencia a antibióticos, o mecanismos de patogenicidad, pero también suelen incluir secuencias típicas de fagos, plásmidos y otros elementos genéticos móviles. La importancia del pangenoma en Fitopatología es clave, ya que permite entender la diversidad genética de los patógenos y su interacción con las plantas anfitrionas u hospedadoras. Permite: i) conocer la variabilidad genética de los patógenos e identificar genes que están presentes solo en algunas cepas de un patógeno, como genes de virulencia, efectores, o de resistencia a plaguicidas, fundamental para comprender por qué ciertas cepas son más agresivas o difíciles de controlar que otras; y ii) entender la coevolución planta-patógeno, al permitir estudiar cómo los genes de los patógenos evolucionan para evadir los mecanismos de defensa de las plantas. Así, algunos genes de efectores pueden perderse por deleción o acumular mutaciones que alteren su secuencia para evitar ser detectados por genes de resistencia en las plantas. El conocimiento de qué genes del pangenoma están implicados en la infección, permite diseñar estrategias para mejorar la resistencia e identificar dianas moleculares para mejorar genéticamente cultivos determinados mediante edición genética o cruzamientos dirigidos. La identificación de los genes únicos y accesorios favorece el desarrollo de métodos, técnicas de detección y reactivos específicos de detección y diagnóstico para identificar cepas nuevas, más virulentas o resistentes. El estudio del pangenoma puede mostrar cómo una población patógena cambia con el tiempo, ayudando a predecir posibles brotes o fallos en el control basado en resistencia genética. Como ejemplo concreto, en el hongo fitopatógeno Magnaporthe oryzae (causante del añublo del arroz), el análisis del pangenoma ha permitido identificar genes de efectores que determinan si una cepa puede infectar a ciertas variedades de arroz y ello ha sido clave para el diseño de programas de mejora genética más eficaces. El pangenoma se puede representar, de forma básica, como una lista de genes presentes o ausentes en cada cepa o individuo, mediante una matriz. Como segundo tipo de pangenoma, denominado “secuencia representativa del pangenoma” (representative sequence pangenome), también puede expresarse como una concatenación de genomas completos o sus secuencias representativas, lo que es útil para análisis comparativos. El tercer tipo, denominado “pangenoma gráfico” (pangenome graph o graphical pangenome), integra múltiples secuencias genómicas de organismos de la misma población, especie o género en un único genoma de referencia.