Las estimaciones de recombinación, mutación y selección positiva a nivel de todo el genoma inspiran diversos impulsores de Mycobacterium bovis

Gracias por visitar Nature. La versión de tu navegador tiene compatibilidad limitada con CSS. Para disfrutar de la mejor experiencia, te recomendamos usar una versión más reciente del navegador (o desactivar el modo de compatibilidad en Internet Explorer). Para garantizar la compatibilidad continua, mostraremos los sitios sin estilos ni JavaScript.
La secuenciación genómica ha revitalizado el campo de la investigación de enfermedades infecciosas, revelando la epidemiología, la patogénesis, las interacciones huésped-patógeno y el proceso evolutivo impuesto a los patógenos. El complejo Mycobacterium tuberculosis (MTBC) considera a Mycobacterium bovis como uno de sus miembros adaptativos animales que causa tuberculosis (TB) en mamíferos terrestres y es un modelo típico de evolución bacteriana. Al igual que otros miembros del MTBC, se asume que Mycobacterium bovis es un patógeno estrictamente clonado, de evolución lenta, y obviamente no hay signos de recombinación o transferencia horizontal de genes. En este trabajo, aplicamos genómica comparativa a un conjunto de datos de secuenciación del genoma completo (WGS) compuesto por 70 bovinos M. de diferentes pedigríes (Europa y África) para obtener información sobre la diversidad genética del ganado M. Poder evolutivo. Se utilizan tres métodos diferentes para estimar los signos de reorganización. A nivel mundial, se ha identificado y confirmado un pequeño número de eventos de recombinación mediante dos métodos independientes con un sólido respaldo. Sin embargo, en comparación con las mutaciones, la recombinación tiene un efecto más débil en la diversidad de M. bovis (r/m global = 0,037). La diferencia r/m promedio obtenida en el complejo clonal de Mycobacterium bovis en nuestro conjunto de datos es consistente con el concepto general de que el grado de recombinación puede variar en gran medida entre los linajes asignados a la misma especie taxonómica. Con base en este trabajo, no se puede descartar la recombinación en Mycobacterium bovis, por lo que debería ser objeto de mayores esfuerzos en futuras investigaciones de genómica comparativa, en las que la WGS de grandes conjuntos de datos de diferentes escenarios epidemiológicos en todo el mundo es crucial. Luego se realizó un análisis adicional en el conjunto de datos más pequeño de Mycobacterium bovis (n = 42) de la prevalencia de TB en múltiples hospedadores, y se identificaron más de 1800 loci, de los cuales al menos una cepa mostró un polimorfismo de un solo nucleótido (SNP). La mayoría (87,1%) se localiza en la región codificante, y la proporción global de cambios no sinónimos (dN/dS) con respecto a los cambios sinónimos supera 1,5, lo que indica que la selección positiva es una importante fuerza evolutiva ejercida sobre M. bovis. Se detectó una mayor proporción de SNP en genes ricos en categorías funcionales de "metabolismo lipídico", "pared celular y procesos celulares" y "metabolismo intermedio y respiración", lo que revela su potencial en la biología y la evolución de la importancia de Mycobacterium bovis. Un análisis más detallado de los genes en los ancestros MTBC propensos a la transferencia horizontal de genes e incluidos en el sistema 3R (reparación, replicación y recombinación del ADN) revela el valor negativo promedio global de la prueba D neutral de Taijima, lo que indica un escaneo selectivo previo. El reciente cuello de botella tras la expansión poblacional sigue siendo el principal factor evolutivo que impulsa al patógeno obligatorio Mycobacterium bovis a combatir al huésped.
El complejo Mycobacterium tuberculosis (MTBC) es uno de los taxones de patógenos bacterianos más exitosos y un caso típico de evolución bacteriana. Sus miembros muestran una identidad de nucleótidos sorprendentemente alta a nivel genómico (> 99%)1,2. Diferentes ecotipos de MTBC pueden causar tuberculosis (TB), que es una enfermedad granulomatosa infecciosa, en una amplia gama de especies hospedadoras, desde micromamíferos hasta humanos3,4,5. Actualmente, el complejo incluye humanos [M. tuberculosis (Mtb), Mycobacterium africanum] y patógenos adaptados a animales (Mycobacterium bovis, Mycobacterium capitum, Mycobacterium pinnipedum, Mycobacterium microtobacter, Mycobacterium mongee, Mycobacterium miysani, Mycobacterium surika, "Bacillus chimpanzee" y "dassie")5,6. M. canettii (también conocida como "Nodobacter glabrata") La identidad de nucleótidos promedio con las micobacterias antes mencionadas es del 98%, y trabajos de genómica comparativa han demostrado que M. canettii y el resto de MTBC han divergido recientemente del ancestro común.7 Considerando este concepto, algunos autores llaman a M. canettii Miembro del MTBC 8.
El MTBC se describe sistemáticamente como un complejo clonal estricto, y su estructura poblacional está claramente gobernada por diversidad reducida, cuellos de botella, escaneo selectivo y deriva genética9,10. Suponiendo una evolución clonal estricta compleja, como los polimorfismos faltantes, no se puede restaurar por recombinación. Con base en esta premisa, los eventos consecutivos de la deleción genómica de la región diferencial (RD) y TbD1 (región de deleción 1 específica de Mtb) se han propuesto como marcadores moleculares de la evolución del MTBC2,5,11. El trabajo de genómica comparativa y secuenciación del genoma completo (WGS) respalda la división de los miembros adaptados a humanos en nueve linajes (Mycobacterium tuberculosis L1 a L4, L7 y L8; y Mycobacterium africanum L5, L6 y L9), los linajes L2 a L4 compartían la región de deleción TbD12,11,12,13. Además, se propone que los miembros adaptados a los animales comparten un ancestro común, que se define por deleciones específicas del clado en RD7, RD8, RD9 y RD102, 5 y 14.
La transferencia horizontal de genes (HGT) y los eventos de recombinación se consideran poco frecuentes y ocurren en los ancestros del MTBC, a diferencia de la historia diferente de todo el miembro del MTBC15,16,17. Dos informes tempranos de Hughes y colaboradores (2002) y Gutacker y colaboradores (2006) sugirieron que los eventos de recombinación podrían contribuir a la formación de polimorfismos que marcan loci específicos en cepas de M. tuberculosis18,19. Las razones de la evidente falta de recombinación en el MTBC son: (1) el proceso mecánico y la pérdida de la capacidad de la HGT; (2) la rareza de los eventos de HGT; (3) la imposibilidad de que se produzcan eventos de recombinación en el nicho del MTBC14,17. Recientemente, algunos estudios de secuenciación del genoma completo (WGS) aplicados a la cepa MTBC 20 y a Mycobacterium bovis 21 han proporcionado evidencia de recombinación, los primeros en mostrar que las cepas MTBC a menudo intercambian pequeños fragmentos de ADN, pero debido a la variación limitada de la secuencia de nucleótidos, estos eventos aún no se han notado.
Mycobacterium bovis es el miembro del MTBC que se recupera con mayor frecuencia en el ganado (principalmente bovino), aunque también puede aislarse de animales salvajes en libertad y cercados4,22,23,24. M. bovis evolucionó en cinco complejos clonales principales [Europeo 1 (Eu1), Europeo 2 (Eu2), Europeo 3 (Eu3), Africano 1 (Af1) y África 2 (Af2)], según el perfil de espoligotipado, deleciones específicas y polimorfismos de un solo nucleótido (SNP) 25, 26, 27, 28, 29 en genes específicos. Estos complejos clonales demuestran la diversa estructura de la población de Mycobacterium bovis y su asociación con regiones geográficas. Además, el reciente trabajo de WGS realizado por Zimpel y colaboradores (2020) diseñó una filogenia basada en el SNP de Mycobacterium bovis, con más de 1.900 genomas, lo que indica que existen al menos cuatro linajes diferentes (denominados Lb1 a Lb1 a Lb4), no son completamente consistentes con el complejo clonal previamente definido, aunque también se puede confirmar la especificidad geográfica30. Estos autores realizaron análisis diferenciales de filogenia y datación molecular, pero no estudiaron la recombinación30.
Trabajos previos con diferentes técnicas moleculares, como la espoligotipificación, MIRU-VNTR (unidad de repetición intercalada de micobacterias-número variable de repeticiones en tándem) y la reciente tipificación de SNP revelaron un cierto nivel de diversidad genética entre las cepas de M. bovis 31,32,33,34,35. La diferenciación de la variación genética se ha convertido en una herramienta importante en el estudio de la epidemiología de enfermedades, lo cual es útil para comprender en profundidad la patogénesis, la virulencia y la transmisión de enfermedades. La aparición del método WGS brinda la posibilidad de revelar los factores impulsores evolutivos impuestos por el genoma de Mycobacterium bovis en el proceso de adaptación y persistencia a diferentes hospedadores y escenarios epidemiológicos.
En este trabajo, utilizamos el análisis genómico comparativo en varios conjuntos de datos de Mycoplasma bovis (n = 70), incluyendo aislados de diferentes complejos clonales, para obtener información sobre el proceso evolutivo de Mycoplasma bovis, especialmente para resolver relaciones filogenéticas y eventos de recombinación. Como complemento a este análisis, un subconjunto de datos de aislados de M. bovis (n = 42) obtenidos de un área de tuberculosis multihuésped bien caracterizada en Portugal 31,36 se exploró más a fondo para inferir la no identidad El equilibrio entre la proporción relativa de sustituciones de nucleótidos sentido (dN) a sinónimos (dS), así como la contribución evolutiva de genomas específicos mencionados en la literatura, son 37,38 obtenidos por ancestros MTBC a través de HGT, y codifican componentes génicos del sistema 3R (reparación, replicación y recombinación del ADN) 39. Elija genes obtenidos a través de HGT porque pueden representar polimorfismos antiguos, por lo que se espera que puedan contener una mayor proporción de cambios sinónimos. Los genes incluidos en el sistema 3R se seleccionaron porque trabajos previos con cepas de M. tuberculosis indicaron selecciones negativas/de purificación generales que actúan sobre estos genes, y podrían desempeñar un papel importante en la evolución 39. Otro objetivo de este trabajo es inferir la existencia de eventos de reorganización. Por esta razón, considerando que nuestro conjunto de datos de Portugal solo contiene los genomas del complejo clonal europeo 2 y las cepas a las que no se les ha asignado dicho complejo, decidimos incluir datos genómicos disponibles públicamente para obtener finalmente una muestra representativa de todos los complejos clonales y mejorar la robustez y la amplitud de los resultados.
42 genomas de Mycoplasma bovis recientemente secuenciados de la escena de tuberculosis multihuésped endémica portuguesa (detalles a continuación), previamente caracterizados desde una perspectiva epidemiológica36, son el centro de este trabajo. Considerando que el conjunto de datos de Portugal solo tiene representantes de los complejos de clones europeos 2 y cepas sin complejos designados, se han agregado datos de secuenciación de genoma completo disponibles públicamente para expandir el conjunto de datos que incluye todos los representantes de los complejos de clones de M. bovis. Por lo tanto, se utilizaron tres fuentes de datos de secuenciación de genoma completo en este trabajo: ensamblaje de genoma completo/borrador, hasta 10 andamios almacenados en NCBI (Centro Nacional de Información Biotecnológica) (n = 15 aislados); almacenado en SRA (el archivo fastq de Illumina del archivo de lectura de secuencias) representa la compleja diversidad de clones de M. bovis (n = 12 aislados)30; y 42 genomas recientemente secuenciados de Portugal. Mycobacterium bovis BCG (bacilo de Calmette-Guérin) se excluyó de la búsqueda del NCBI. M. bovis AF2122/97 se utiliza habitualmente como genoma de referencia para su inclusión en el conjunto de datos. Debido a la falta de disponibilidad pública de la secuencia completa del genoma representada por el complejo de clonación African 1 y al reducido número de genomas de cepas representativas de Af2 y Eu1, en estos casos se utilizaron los datos de secuenciación originales proporcionados por SRA. El trabajo de Zimpel y sus colaboradores (2020) ayudó a identificar el genoma del complejo de clonación mencionado y a seleccionar Mycobacterium bovis para su inclusión en el conjunto de datos. Para Eu3, solo se describe un tipo de genoma (Branger et al., 2020), por lo que el genoma que incluimos es un representante independiente del complejo Eu3.
A nivel mundial, este conjunto de datos incluye 70 M. bovis bovinos aislados de 8 especies hospedadoras, distribuidas en 12 países entre 1985 y 2016. Treinta y seis especies se designan como Eu2, siete como Eu1, una como Eu3, tres como Af1, cuatro como Af2 y 19 no son atribuibles a ningún complejo clonal (detalles a continuación). La información detallada (incluido el número de acceso) de Mycobacterium bovis utilizada en este estudio se muestra en la Tabla 1 y la Tabla Suplementaria 1.
42 genomas completos recientemente secuenciados de Mycobacterium bovis de los puntos calientes de tuberculosis animal de Portugal y distribuidos durante más de 12 años son el centro de este estudio, ya que los sistemas potenciales de enfermedades de la fauna silvestre y el ganado se han monitoreado regularmente 31,36 (Fig. 1 suplementaria). De acuerdo con los procedimientos posteriores, estas cepas se aislaron de ganado bovino (n = 14), ciervo rojo (n = 16) y jabalí (n = 12) de 2003 a 2015: recolecte y manipule a los animales de acuerdo con las pautas de protocolo recomendadas Las muestras de tejido están en el Manual para animales terrestres de la OIE y se inoculan en medio sólido y líquido de piruvato de Stonebrink y Löwenstein-Jensen. Los cultivos se incuban a 37 °C y el crecimiento se controla una vez a la semana durante al menos 12 semanas. Las colonias se almacenan directamente en una solución de glicerol a -80 °C. En el medio selectivo para Mycobacterium (Middlebrook 7H9, BD Diagnostics), las muestras originales archivadas se sometieron a un único pase in vitro para obtener el ADN del programa WGS. Para ello, la solución madre del cultivo congelado se enriqueció con 5% de piruvato sódico y 10% de ADS (50 g de albúmina, 20 g de glucosa, 8,5 g de cloruro sódico en 1 L de agua) en Middlebrook 7H9 a 37 °C. Tras 4 semanas de crecimiento, se renovó el medio y se monitoreó regularmente el cultivo hasta observar crecimiento. Las células se recolectaron por centrifugación, el sedimento se resuspendió en 500 µL de solución salina tamponada con fosfato (PBS), se calentó a 99 °C durante 30 minutos, se centrifugó y el sobrenadante se conservó a -20 °C hasta la WGS. Todos los procedimientos se llevan a cabo en instalaciones de bioseguridad de nivel 3.
La biblioteca genómica de extremos emparejados WGS se prepara utilizando el índice único de cada muestra de ADN y utiliza tecnología Illumina MiSeq (2 × 250 pb) (40 muestras) y HiSeq (2 × 150 pb) (dos aislados) (Eurofins Genomics, Alemania) para la secuenciación. Según las instrucciones del fabricante, utilice el analizador de genoma Illumina con módulo de doble extremo para secuenciar el ADN genómico y el kit de preparación de bibliotecas de ADN Nextera XT de Illumina para construir la biblioteca.
Teniendo en cuenta los datos recuperados del SRA (n = 12), la identificación del complejo clonal puede utilizarse como metadatos de la publicación correspondiente 30, 41, 43. Al considerar el genoma completo, excepto Mycobacterium bovis AF2122/97 y Mycobacterium bovis 3601, que son miembros reconocidos del complejo clonal Eu1 y Eu3 25, 29, respectivamente, es el mismo que el genoma completo de Mycobacterium tuberculosis H37Rv (número de acceso NCBI NC_000962.3). El alineamiento genómico se realiza utilizando MAFFT (programa de alineamiento múltiple de secuencias de aminoácidos o nucleótidos, versión 7.458) y el parámetro -addfragments48. Luego, busque la ausencia de diferentes complejos clonales y/o la presencia de características de SNP.
El Mycobacterium bovis recientemente secuenciado (n = 42) y las lecturas originales del borrador del genoma ensamblado (n = 3) alinean el complejo con el genoma de referencia Mycobacterium tuberculosis H37Rv a través de la tubería vSNP y la presencia de la eliminación y/o características SNP de diferentes clones. Se realizó una búsqueda.
Recopilar información sobre la ausencia de características y/o la presencia/ausencia de SNP y perfiles de espoligotipado para asignar datos genómicos al complejo clonal correspondiente. En los cuatro borradores de ensamblaje, no se puede inferir el perfil de espoligotipado, por lo que se incluyen en el grupo "sin complejidad".
El flujo de trabajo bioinformático seguido en este trabajo comienza con el ensamblaje de novo y el mapeo a una estrategia de referencia, con el objetivo de explorar eventos de recombinación y polimorfismos genómicos específicos. La Figura 1 muestra un diagrama de flujo de los pasos seguidos. Para el análisis de recombinación, se utilizan todos los genomas para aumentar la robustez de las inferencias y los indicadores relacionados.
Para reducir los errores en la generación de secuencias de consenso genómico, primero obtuvimos el ensamblaje de novo y, posteriormente, los alineamientos múltiples de núcleo. El pipeline de Unicycler está disponible en https://github.com/rrwick/Unicycler49 y se utiliza para realizar el ensamblaje de novo de 54 genomas secuenciados (42 nuevos secuenciados y 12 archivos fastq recuperados de SRA). En resumen, antes del ensamblaje desde cero, se realizó un análisis de calidad de lectura en FastQC versión 0.11.7 (https://github.com/s-andrews/FastQC) y Trimmomatic versión 0.36 (se aplican las opciones "Cortar adaptadores y otras secuencias específicas de iluminación de las lecturas" y "Cortar bases del final de la lectura, si la calidad del umbral es inferior a 20") (http://www.usadellab.org/cms/?page=trimmomatic) 50. Posteriormente, se utilizó el optimizador SPAdes 49 para el ensamblaje del genoma y Pilon versión 1.1851 para la optimización posterior al ensamblaje. Se seleccionó un modo de puenteo conservador para evitar un ensamblaje incorrecto, y se buscó y seleccionó un tamaño de k-meros entre el 20 % y el 95 % de la longitud de la lectura. Siga las pautas de SPAdes y considere el tamaño de lectura, elimine los contigs menores de 300 pb y establezca un límite de cobertura de profundidad de lectura de 20 de 52. En la estrategia de ensamblaje de novo, las regiones genómicas como los parálogos altamente repetitivos de prolina-glutamato (PE) y prolina-prolina glutamato (PPE) no se eliminaron.
La calidad del ensamblaje de novo se evalúa a través del proceso QUAST (http://quast.sourceforge.net/quast.html), que facilita la renovación del contig y el mapeo del genoma de referencia M. bovis AF2122/97 (número de acceso NCBI LT708304.1) (consulte la Tabla complementaria 1 para conocer los parámetros de calidad).
Con la ayuda del pipeline vSNP (https://github.com/USDA-VS/vSNP), el archivo FASTQ del M. bovis recién secuenciado de la secuenciación de Illumina se compara con el genoma de referencia M. bovis AF2122/97 (LT708304.1). De acuerdo con las recomendaciones de mejores prácticas del Genome Analysis Toolkit (GATK) 53, 54, 55 aplique parámetros de filtro estándar o puntuaciones de masa de variantes para la recalibración. Los resultados se filtran utilizando la puntuación de masa SAMtools más baja de 150 y AC = 2. También utilice Kraken (http://ccb.jhu.edu/software/kraken/) para verificar las lecturas para descartar contaminación. El pipeline vSNP utilizado para mapear las estrategias de secuencia en nuestro trabajo examina una serie de SNP y objetivos definidos, y también excluye escenarios de infección mixta. La cobertura del genoma leído es mejor del 99% (Tabla suplementaria 1).
Para evitar errores de mapeo y SNP erróneos, filtre una variante en los siguientes casos: (1) está respaldada por menos de 20 lecturas, (2) se encuentra con una frecuencia de menos de 0.9, (3) está en al menos una cepa, pero al menos hay espacios en otra cepa. El visualizador de genómica integrada (IGV) versión 2.4.19 (http://software.broadinstitute.org/software/igv/)56 se utilizó para verificar visualmente los SNP y las posiciones con problemas de mapeo o alineación. Dado que los genes de prolina-glutamato (PE) y prolina-glutamato de prolina (PPE) están altamente duplicados y son parte de una familia de múltiples genes, la secuenciación y el mapeo incorrecto de Illumina los malinterpretan fácilmente, por lo que se prefieren El flujo de trabajo de bioinformática micobacteriana eliminó miembros del complejo de tuberculosis cuando se utilizó la estrategia de mapeo a secuencia para confirmar SNP. Por lo tanto, filtramos los genes PE/PPE y los indels del análisis.
Según Bovilist (http://genolist.pasteur.fr/BoviList/), todos los SNP se dividen en categorías funcionales. El pipeline SnpEff (https://pcingola.github.io/SnpEff/) se utiliza para inferir las consecuencias de los SNP (cambios sinónimos o no sinónimos). Se creó una nueva base de datos del genoma de Mycobacterium bovis AF2122/97 (LT708304.1).
El alineamiento múltiple del genoma central se realizó con Parsnp v1.2, disponible en https://github.com/marbl/parsnp57, utilizando 69 genomas completos/borradores de ensamblajes (con la opción -c) y M. bovis AF2122/97 (LT708304.1) como referencia. Se realizaron cuatro alineamientos múltiples: solo los miembros del complejo de clonación Eu2 (n = 37), incluyendo todos los miembros del complejo de clonación europeo (n = 44), incluyendo el punto de unión de los complejos de clonación europeo y africano (n = 51), y todos los Mycobacterium bovis en este estudio (n = 70).
La alineación central generada por Parsnp se utiliza para inferir el árbol filogenético de máxima verosimilitud (ML) utilizando CIPRES Science Gateway v3.3 (http://www.phylo.org/)58 usando RAxML y realizar 1000 réplicas guiadas.
Se utilizan tres algoritmos y herramientas bioinformáticas diferentes para comprobar la presencia de eventos de recombinación en paralelo: el software SplitsTree4, la tubería Gubbins (linaje imparcial a través de la recombinación en secuencias de nucleótidos) y el software RDP4 (programa de detección de recombinación, versión beta 4.101).
El método de descomposición por división implementado en SplitsTree4 v4.15.1 (http://www.splitstree.org/)59 se utiliza para calcular la red filogenética sin raíz, utilizando la prueba Phi para la verificación estadística, con un umbral de significancia de p = 0,05. El análisis de alineamiento múltiple básico de Parsnp se utiliza como entrada, y se implementa la descomposición por división como estándar de red.
Gubbins pipeline v2.3.1 (https://github.com/sanger-pathogens/gubbins60 se ejecuta con parámetros predeterminados como otra forma de evaluar el impacto de la recombinación en Mycobacterium bovis. El algoritmo implementado en el pipeline reconstruye el linaje del clon relevante El ensamblaje completo del genoma/borrador de nuestro conjunto de datos y el genoma de referencia (bovino AF2122/97, LT708304.1) son mutuamente; y escanea la posición del SNP en cada rama del árbol para detectar el grupo de SNP que representa el evento de recombinación. El cero de la rama Suponga que no hay ningún evento de recombinación, lo que significa que los SNP que aparecen en la rama deberían estar distribuidos de manera uniforme. La alineación múltiple central de Parsnp y el árbol ML con mejor puntuación de RAxML se utilizan como archivos de entrada.
Finalmente, para confirmar el evento de reorganización sugerido por la secuencia de Gubbins, los seis algoritmos implementados en RDP467 (RDP61, GENECONV62, Bootscan63, Maxchi64, Chimaera65 y SiScan66) se aplican al alineamiento múltiple principal de Parsnp con la configuración predeterminada. Determinamos que al menos tres de los algoritmos implementados en RDP4 deben demostrar consistentemente una señal importante para verificar cada evento de recombinación.
Considerando que tanto el software Gubbins como el RDP buscan señales de recombinación comprobando los alineamientos múltiples del núcleo en una ventana de hasta 500 pb, y confirmando que la inclusión de genes PE/PPE durante el ensamblaje de novo no interferirá con las señales de recombinación encontradas, se realiza un análisis adicional por homolinealidad. Compruebe la vecindad del gen que identifica el evento de recombinación. El mapa sinlineal que utiliza el genoma completo se construyó utilizando la alineación multigenoma MAUVE (http://darlinglab.org/mauve/mauve.html) para excluir translocaciones o inversiones genómicas locales. Además, se utilizó todo el genoma para realizar un análisis de homolinealidad en la secuencia de aminoácidos a través del servidor web SyntTax (https://archaea.i2bc.paris-saclay.fr/SyntTax/).
Un análisis más profundo del conjunto de datos genómicos obtenidos del sistema portugués de tuberculosis multihuésped consiste en verificar el polimorfismo de los genes mencionados en la literatura. Estos genes son 37,38 y el gen que codifica 3R, obtenido por los ancestros del MTBC mediante los componentes del sistema HGT (reparación, replicación y recombinación del ADN) 39. Utilice ClustalX v2.1 (http://www.clustal.org/clustal2/) y DnaSP v6.12.03 (http://www.ub.edu/dnasp/) para calcular la diversidad génica y la diversidad de nucleótidos (π), así como la entrada del parámetro de la prueba D neutral de Tajima.
Se obtuvo un árbol filogenético de máxima verosimilitud (ML) basado en 69 aislamientos de Mycoplasma bovis y genomas de referencia (Figura 2A). En comparación con los árboles basados ​​en un solo gen o árboles basados ​​en múltiples locus, esta estrategia permite la generación de árboles más potentes que no capturan la variabilidad de todo el genoma y, por lo tanto, muestran una menor capacidad para discriminar entre especies 68,69. La estructura topológica del árbol ML suele ser consistente con la compleja clasificación de clones. El genoma de Eu2 está agrupado en una rama, y ​​el genoma de Af1 también está agrupado (Figura 2A). El resultado también es consistente con la relación evolutiva conocida de Mycobacterium bovis, es decir, hay una gran diferencia entre el miembro Eu1 y el grupo que consiste en todos los demás complejos clonales y genomas, pero el complejo clonal 30 no está especificado. La pequeña inconsistencia entre el complejo clonal y la relación observada en el árbol filogenético puede explicarse por el hecho de que el complejo clonal se describe en función de regiones genómicas específicas, mientras que el árbol filogenético se basa en alineaciones múltiples de genomas centrales que representan el genoma completo.
El árbol filogenético de máxima verosimilitud (RGT) se construye a partir de la alineación genómica central del genoma de Mycobacterium bovis antes (A) y después (B) de la eliminación del sitio de recombinación. Los colores de las ramas representan el complejo clonal de Mycobacterium bovis: Europa 1 es morado, Europa 2 es rojo, Europa 3 es azul, África 1 es naranja y África 2 es verde. El árbol está enraizado y dibujado a escala, y la longitud de las ramas se mide como reemplazo de cada sitio.
Se describe que el complejo Mycobacterium tuberculosis evolucionó clonalmente, y la mayor parte de la evidencia acumulada a lo largo de los años apoya la idea de que los eventos de HGT y recombinación en curso no ocurrirán en el nivel detectable de MTBC15,17,18.
Trabajos previos han demostrado que puede haber una recombinación limitada entre cepas de MTBC20,21, mientras que otros no han logrado identificar eventos de recombinación mensurables70,71. Vuelva a discutir este tema con el enfoque en Mycobacterium bovis, que es diferente del trabajo previo que solo consideró Mycobacterium tuberculosis70,71; o considere MTBC como un todo, con casi ningún M. bovis representando 20; o solo considere fracciones restrictivas de ganado. El conjunto de datos de micobacterias, en este trabajo, hay un total de 70 cepas, que representan todos los complejos clonales, utilizados para detectar recombinación. El conjunto de datos se escala de acuerdo con cuatro niveles acumulativos: (1) miembros de Eu2, (2) todos los miembros del complejo de clones europeos (es decir, Europa), (3) complejo de clones europeo y africano (Eu + Af) y (4) todas las colecciones de datos (incluidos los genomas que no están incluidos en ningún complejo de clonación ya descrito).
Para profundizar en esta hipótesis, se desarrolló una red de descomposición dividida para evaluar la ausencia de eventos de recombinación entre genomas, ya que este método permite visualizar la relación ancestral entre individuos y mostrar señales filogenéticas contradictorias. Los cuatro conjuntos de datos del análisis confirmaron la existencia de bucles en la red (es decir, áreas que no convergen en un solo árbol), pero la prueba Phi carece de respaldo estadístico (Eu2, p = 0,0956; Europa, p = 0,1637; Eu + Af, p = 0,2774; conjunto de datos completo, p = 0,2451), lo que proporciona poca evidencia de la existencia de eventos de reorganización (Figuras 3A-D).
En Europa 2 genomas (n = 37) (A), genomas europeos (n = 44) (B), genomas europeos y africanos (n = 51) (C) y todo el conjunto de datos (n = 70) (D).
Después de este análisis, y teniendo en cuenta las observaciones cíclicas en todas las redes, se aplicó el algoritmo de reconstrucción implementado en el pipeline de Gubbins para reconstruir el linaje clonal y complementar la estimación del efecto de la recombinación en el genoma de M. bovis. Infiera el número acumulado de eventos de recombinación, la mayoría de los cuales ocurrieron en ramas terminales (es decir, en un solo genoma) (Tabla 2). Estos indicadores muestran la consistencia de todo el conjunto de datos e indican que la frecuencia de los eventos de recombinación es de 200 a 300 veces la de las mutaciones. Una vez que el parámetro rho/theta que representa las tasas relativas de recombinación y mutaciones puntuales en la rama parece estar entre 0,0037 y 0,0056 (Tabla 3). Recientemente, el trabajo publicado de la cepa 38 M. bovis demostró un valor rho/theta más alto (rho/theta = 0,1) que el obtenido en este conjunto de datos, pero el trabajo de Patané y colegas utilizó un ensamblaje basado en referencia para inferir los parámetros de recombinación. Un detalle de procedimiento, debido al procedimiento de ensamblaje, se ha asociado con la abundancia de posibles eventos de recombinación en la rama terminal.
A continuación, el parámetro r/m representa la razón de diversidad de la recombinación y la introducción de mutaciones, y su valor medio está entre 0,025 y 0,037, lo que indica que, en comparación con las mutaciones, la recombinación tiene un impacto general menor en la diversidad genética de M. bovis (Tabla 3). Para una comparación exhaustiva, se utilizó un método similar para estimar el parámetro r/m para el conjunto de datos MTBC compuesto por 23 genomas, que mostró un valor medio de 0,48620, mientras que para el conjunto de datos de 38 M. bovis de Patané y colegas, demostró que el valor medio es 0,98. En el primer estudio, solo dos de los 23 genomas incluidos en el trabajo de M. bovis (M. bovis BCG y la cepa de referencia), por lo que el valor obtenido puede estar sesgado debido a la sobreexpresión del genoma de M. tuberculosis. En el segundo informe, las poblaciones de Mycobacterium bovis analizadas se recuperaron principalmente de Estados Unidos y de hospedadores ganaderos. Por el contrario, en nuestro conjunto de datos, se representan más ubicaciones geográficas y especies hospedadoras, y también se utilizan genomas agrupados en diferentes complejos clonales con diferentes características genéticas poblacionales, logrando así un conocimiento poblacional más profundo y amplio. El valor promedio de diferencia r/m obtenido con nuestro conjunto de datos es consistente con el concepto de que el grado de recombinación varía en gran medida entre los linajes asignados a la misma especie taxonómica, por lo que estos resultados indican que el complejo clonal de M. bovis puede exhibir diferencias de recombinación. El impacto también es como lo sugieren Didelot y Maiden72. Sin embargo, expandir significativamente este conjunto de datos al incluir un mayor número de genomas de M. bovis permitirá una mayor clarificación de este punto. Tanto los parámetros r/m como rho/theta muestran variabilidad entre ramas, y este resultado es consistente con los informes sobre otras especies bacterianas72,73.
Finalmente, para confirmar los eventos de reorganización identificados por el pipeline de Gubbins, se utilizaron seis algoritmos diferentes en el software RDP4 para probar de forma independiente diferentes comparaciones múltiples de núcleos. Globalmente, menos de la mitad de los eventos identificados por Gubbins fueron confirmados por RDP4 (Tablas 4 y 5). Considerando todo el conjunto de datos, se confirmaron tres eventos de recombinación, dos que involucraban nodos internos y el otro que involucraba un solo genoma en una rama terminal, para el cual no se pudieron asignar complejos clonales (Tablas 4 y 5). La identificación de eventos en ramas terminales puede indicar que la recombinación aún está en progreso en cepas contemporáneas de M. bovis o que el resultado está mal ubicado70. En esta región de recombinación hipotética, aproximadamente el 20% de las posiciones tienen nucleótidos indefinidos (N), lo que afecta la señal de recombinación (Figura Suplementaria 2). Además, esta región afecta al gen rrs, que codifica el ARN ribosómico 16S, que se espera esté altamente conservado. Por lo tanto, esta posible señal de recombinación podría deberse a errores de secuenciación o desalineamiento. Posteriormente, se realizó el alineamiento completo del genoma entre Mb0003 y Mycobacterium bovis AF2122/97, y se confirmó la existencia de nucleótidos y SNP indefinidos. Por lo tanto, los posibles problemas relacionados con el alineamiento incorrecto no se debieron a la información biológica implementada en este trabajo, que surgió tras el aprendizaje del programa.
No se encontraron huecos ni nucleótidos indefinidos en las regiones de recombinación de los nodos internos (Figuras 4 y 5). Con respecto a estos eventos, uno contiene solo el genoma Eu2 y afecta al gen pks12, que codifica una posible policétido sintasa; mientras que el otro está registrado en el genoma Eu1 y afecta al gen narX que codifica una posible nitrato reductasa (Tabla 4). En general, el análisis de recombinación muestra que hay un número limitado de fragmentos de recombinación con soporte estadístico, y los indicadores inferidos indican que la recombinación tiene un bajo impacto en el linaje de M. bovis. Se espera que la señal de recombinación sea baja, pero es importante distinguir la verdadera señal de evolución del ruido de fondo, lo cual es una tarea desafiante. Para reducir la señal de ruido introducida por los problemas de ensamblaje y desajuste basados ​​en referencias 70, 71, todo el resto, excepto el genoma completo, se ensambló desde cero, y la calidad del ensamblaje se verificó y aseguró mediante el análisis de la secuenciación QUAST (Tabla Suplementaria 1). Además, se realizó una serie de análisis complementarios para garantizar la robustez y la precisión del estudio general. Por lo tanto, la calidad de la secuenciación de los genes narX y pks12 se evaluó mediante el mapeo de lecturas frente a Mycobacterium bovis AF2122/97. La posición recomendada del SNP en la región de recombinación se confirmó aplicando los criterios mencionados en la sección de métodos (al menos 20 lecturas y una frecuencia de cambio de 0,9). El polimorfismo del gen narX se confirmó plenamente en los dos genomas (Mb1792361 y Mb7240415; 2,3%) y en los genomas del genoma pks12: Mb0891, Mb1711, Mb1789, Mb1870, Mb17046, Mb1756 y Mb12. Sin embargo, en el genoma Mb2043, seis de las ocho posiciones no cumplen el criterio de profundidad de lectura, ya que el SNP cuenta con un máximo de 17 lecturas, lo cual está por debajo del valor de corte establecido de 20. Por lo tanto, se puede confirmar la recombinación de seis genomas (8,6%) en este sitio genómico (Figuras 4 y 5).
La visualización detallada del alineamiento de la región de recombinación del conjunto de datos de Mycobacterium bovis afecta al gen narX, que codifica una posible nitrato reductasa. No se encontraron huecos ni nucleótidos indefinidos en la región de recombinación de los nodos internos. Este evento en particular se registra en el genoma Eu1. La calidad de la secuenciación del gen narX se evaluó mediante el trazado de las lecturas de Mycobacterium bovis AF2122/97. Confirme la ubicación recomendada del SNP en el área de recombinación aplicando los criterios mencionados en la sección de métodos (al menos 20 lecturas y una frecuencia de cambio de 0,9). El polimorfismo del gen narX se confirmó completamente en los genomas de Mb1792361 y Mb7240415 (2,3%).
Visualización detallada del alineamiento de la región de recombinación del conjunto de datos de Mycoplasma bovis que afecta al gen pks12. No se encontraron huecos ni nucleótidos indefinidos en la región de recombinación de los nodos internos. En cuanto al evento que afecta al gen pks12, que codifica la posible policétido sintasa, este solo contiene el genoma Eu2. La calidad de la secuenciación de pks12 se evaluó mediante el mapeo de lecturas de Mycobacterium bovis AF2122/97. Confirme la ubicación recomendada del SNP en el área de recombinación aplicando los criterios mencionados en la sección de métodos (al menos 20 lecturas y una frecuencia de cambio de 0,9). Los polimorfismos de los genomas Mb0891, Mb1711, Mb1789, Mb1870, Mb1758, Mb2043 y Mb1960 se han confirmado completamente.
Los genes PE y PPE presentan regiones repetitivas que la secuenciación y el mapeo erróneo de Illumina pueden malinterpretar fácilmente. Por lo tanto, suelen eliminarse del flujo de trabajo bioinformático de los miembros de M. tuberculosis solo cuando se utiliza la estrategia de mapeo a secuencia. La inferencia de eventos de recombinación aplicada en este trabajo se basa en el ensamblaje de novo sin filtrar PE/PPE. Creemos que, al implementar tres métodos y algoritmos complementarios diferentes a través de SplitsTree, la secuencia de Gubbins y el software RDP4, las estrategias aplicadas son robustas para procesar y filtrar las regiones reorganizadas causadas por señales de error. Sin embargo, para excluir la interferencia del gen PE/PPE en los software Gubbins y RDP4 para identificar clústeres de SNP y, por lo tanto, la identificación de las regiones de recombinación que se propone que afectan a los genes narX y pks12, se examinó la vecindad de estos genes (Fig. Suplementaria 3-5). En M. bovis AF2122/97, el gen narX está separado por narK2 y Mb1764c, mientras que pks12 está rodeado por Mb2075c y Mb2073c (Figura Suplementaria 3-5). El mapa generado mediante el mapa de sinlíneas MAUVE del genoma completo proporciona información sobre la conservación y el reordenamiento de la secuencia génica, mostrando cuatro bloques colineales y sin signos de translocación o inversión genómica. Además, el análisis de complementación con la secuencia de aminoácidos demostró la homología en todos los genomas completos, y no se encontró PE/PPE en las regiones adyacentes de narX o pks12. Para narX, un genoma (Mb0030) tiene una puntuación de sinonimia menor porque el gen narX se identificó como dos fragmentos (fragmentos 1891 y 1890). En el caso de pks12, debido a similitudes, Mb0030 y Mb003 mostraron puntuaciones de sinlinealidad más bajas, mientras que pks12 se identificó en dos y tres fragmentos, respectivamente, que representan diferentes dominios de la proteína (Figura Suplementaria 3-5). Teniendo en cuenta esta información, y considerando que tanto el software Gubbins como el RDP4 realizan análisis, se verifica el alineamiento múltiple central del máximo de 500 pb en la ventana. Esto confirma que el gen PE/PPE no interfiere con la señal de recombinación que afecta a narX y pks12.
Aunque las señales de recombinación detectadas en este conjunto de datos pueden considerarse residuales, es cierto que no se puede descartar la recombinación en M. bovis, por lo que debería seguir siendo objeto de futuros análisis, en los que se secuencien genomas completos de diferentes escenarios epidemiológicos de importancia.
La comparación de los árboles filogenéticos ML obtenidos antes y después de la corrección de recombinación (Figura 2A, B) no condujo a cambios significativos en la relación filogenética inferida, y las cepas de M. bovis se agruparon en el mismo grupo.
Tras mapear 42 lecturas de M. bovis recién secuenciadas con el genoma de referencia AF2122/97 de M. bovis, se obtuvo un alineamiento de SNP con 1816 posiciones polimórficas. La mayoría de los SNP (87,1%) se localizan en la región codificante, y los genes afectados se caracterizan según las categorías funcionales que se muestran en Bovilist (Figuras 6A, B). Considerando el número total de genes en cada categoría funcional, los genes de la categoría "metabolismo lipídico" mostraron más SNP, seguidos de los de "pared celular y procesos celulares" y "metabolismo intermedio y respiración", lo que revela su presencia en la evolución de M. bovis.
Análisis jerárquico del conjunto de datos de M. bovis de Portugal (n = 42). Número total de SNP registrados y genes afectados para cada categoría funcional (A). Número total de cambios sinónimos y no sinónimos registrados por categoría funcional (B).
A escala global, la relación dN/dS promedio es superior a 1,5, lo que indica que la presión evolutiva global busca eliminar el estado ancestral y representa un escenario de purificación positivo (diversificado o dirigido) o relajado. En las categorías de «virulencia, desintoxicación, adaptación», «secuencias de inserción y fagos» y «proteínas reguladoras», más de dos tercios de los SNP no son sinónimos (Figura 6B).
En todas las categorías, hay genes con múltiples SNP, lo que resulta en una tasa de mutación promedio (es decir, el SNP promedio por gen) mayor a 1 (Figura 6A). Pks12 (Mb2074c) con 15 SNP y fas (Mb2553c) con 8 SNP tienen valores de mutación más altos. Ambos genes están involucrados en el metabolismo de ácidos grasos. El gen pks codifica la policétido sintasa (PKS), que es una enzima multifuncional involucrada en la biosíntesis de lípidos de la pared celular micobacteriana74,75. Este gen codifica un polipéptido multifuncional que está involucrado en la síntesis de micocétidos74,76. El gen fas está involucrado en la síntesis de ácido micólico. Ambos genes juegan un papel importante en la biosíntesis de la pared celular en contacto con el huésped.
Para estudiar más a fondo la evolución de Mycobacterium bovis, se analizaron dos conjuntos de genes específicos. Trabajos publicados previamente que utilizaron la composición de secuencias y métodos filogenéticos identificaron genes que fueron adquiridos por ancestros MTBC a través de HGT antes de la diversificación37,38. Estos genes se enumeran en la Tabla complementaria 2. Se analizó la distribución de SNP de un total de 77 genes que pueden estar relacionados con HGT, y se identificaron 26 sitios polimórficos, que en la mayoría de los casos (78%) resultaron en cambios no sinónimos (NS) (Tabla complementaria 2). Trabajos previos sobre el genoma de MTBC demostraron que la supuesta región HGT exhibe una mayor proporción de SNP NS en comparación con el resto del genoma. Si uno piensa que estas regiones de recombinación fueron adquiridas por ancestros MTBC y, por lo tanto, sobrerrepresentan polimorfismos antiguos, entonces se espera que la proporción de cambios sinónimos sea mayor, porque se espera que las sustituciones NS sean eliminadas por selección negativa debido a que los cambios de aminoácidos pueden cambiar la función de la proteína. Por lo tanto, nuestros resultados indican que las consecuencias funcionales pueden derivar de la sustitución de genes similares a HGT, lo que refleja su importancia para una valiosa diversidad genética adaptativa.
Paralelamente a este análisis, se examinaron exhaustivamente los genes que codifican los componentes del sistema 3R (reparación, replicación y recombinación del ADN) de acuerdo con la lista publicada previamente por dos Vultos y colaboradores (2008)39. El intercambio de fragmentos idénticos de ADN no se puede observar directamente, aunque puede ser un proceso frecuente cuando intervienen bacterias estrechamente relacionadas, como en el caso de este conjunto de datos; además, este proceso puede ser la clave de los métodos de reparación del ADN72, por lo que desempeña un papel en la recombinación homóloga. Se identificaron un total de 26 posiciones polimórficas distribuidas por 54 genes (Tabla complementaria 3). En este conjunto de genes, los cambios de NS explicaron alrededor del 65% de las consecuencias, lo que es coherente con informes anteriores sobre cepas de Mycobacterium tuberculosis.


Hora de publicación: 21 de octubre de 2021