Спасибо за посещение Nature. Используемая вами версия браузера имеет ограниченную поддержку CSS. Для оптимальной работы рекомендуем использовать более новую версию браузера (или отключить режим совместимости в Internet Explorer). В то же время, для обеспечения дальнейшей поддержки, мы будем отображать сайты без стилей и JavaScript.
Секвенирование генома оживило область исследований инфекционных заболеваний, раскрывая эпидемиологию заболевания, патогенез, взаимодействие хозяина и патогена и эволюционный процесс, навязанный патогенам. Комплекс Mycobacterium tuberculosis (MTBC) рассматривает Mycobacterium bovis как одного из своих адаптивных членов животных, вызывающих туберкулез (ТБ) у наземных млекопитающих, и является типичной моделью эволюции бактерий. Как и другие члены MTBC, Mycobacterium bovis считается строго клонированным, медленно эволюционирующим патогеном, и, очевидно, нет никаких признаков рекомбинации или горизонтального переноса генов. В этой работе мы применяем сравнительную геномику к набору данных последовательности всего генома (WGS), состоящему из 70 коров M. из разных родословных (Европа и Африка), чтобы получить представление о генетическом разнообразии крупного рогатого скота M. Эволюционная сила. Для оценки признаков реорганизации используются три различных метода. Во всем мире небольшое количество событий рекомбинации было идентифицировано и подтверждено двумя независимыми методами с надежной поддержкой. Тем не менее, по сравнению с мутациями, рекомбинация оказывает более слабое влияние на разнообразие M. bovis (общее r/m = 0,037). Разница средних значений r/m, полученная в клональном комплексе Mycobacterium bovis в нашем наборе данных, согласуется с общей концепцией о том, что степень рекомбинации может значительно варьироваться между линиями, отнесенными к одному и тому же таксономическому виду. Основываясь на этой работе, рекомбинацию в Mycobacterium bovis нельзя исключить, поэтому она должна стать предметом дальнейших усилий в будущих сравнительных геномных исследованиях, в которых WGS больших наборов данных из различных эпидемиологических сценариев по всему миру имеет решающее значение. Затем был проведен дополнительный анализ меньшего набора данных Mycobacterium bovis (n = 42) из распространенности туберкулеза у нескольких хозяев, и было идентифицировано более 1800 локусов, из которых по крайней мере один штамм показал однонуклеотидный полиморфизм (SNP). Большая часть (87,1%) расположена в кодирующей области, а глобальное соотношение несинонимичных изменений (dN/dS) к синонимичным превышает 1,5, что указывает на то, что позитивный отбор является важной эволюционной силой, действующей на M. bovis. Более высокая доля однонуклеотидных полиморфизмов (SNP) была обнаружена в генах, богатых функциональными категориями «липидный метаболизм», «клеточная стенка и клеточные процессы» и «промежуточный метаболизм и дыхание», что раскрывает их потенциал в биологии и эволюции Mycobacterium bovis. Более детальное изучение генов предков MTBC, склонных к горизонтальному переносу генов и входящих в систему 3R (репарация, репликация и рекомбинация ДНК), выявляет глобальное среднее отрицательное значение D-нейтрального теста Тайдзимы, что указывает на прошедшее селективное сканирование. Недавнее «бутылочное горлышко» после расширения популяции по-прежнему остается основным эволюционным фактором, способствующим борьбе обязательного патогена Mycobacterium bovis с хозяином.
Комплекс Mycobacterium tuberculosis (MTBC) является одним из наиболее успешных таксонов бактериальных патогенов и типичным примером эволюции бактерий. Его члены демонстрируют удивительно высокую идентичность нуклеотидов на геномном уровне (> 99%)1,2. Различные экотипы MTBC могут вызывать туберкулез (ТБ), инфекционное гранулематозное заболевание, у широкого спектра видов хозяев от мелких млекопитающих до человека3,4,5. В настоящее время комплекс включает людей [M. Tuberculosis (Mtb), Mycobacterium africanum] и патогены, адаптированные к животным (Mycobacterium bovis, Mycobacterium capitum, Mycobacterium pinnipedum, Mycobacterium microtobacter, Mycobacterium mongee, Mycobacterium miysani, Mycobacterium surika, «Bacillus chimpanzee» и «Dassie»)5,6. M. canettii (также известный как «Nodobacter glabrata»). Средняя идентичность нуклеотидов с вышеупомянутыми микобактериями составляет 98%, а сравнительная геномика показала, что M. canettii и остальная часть MTBC недавно отделились от общего предка.7 Учитывая эту концепцию, некоторые авторы называют M. canettii членом MTBC 8.
MTBC систематически описывается как строгий клональный комплекс, и его популяционная структура явно регулируется сниженным разнообразием, бутылочными горлышками, селективным сканированием и генетическим дрейфом9,10. Предполагая, что сложная строгая клональная эволюция, такая как отсутствующие полиморфизмы, не может быть восстановлена путем рекомбинации. Исходя из этой предпосылки, последовательные события геномной делеции дифференциального региона (RD) и TbD1 (Mtb-специфический регион делеции 1) были предложены в качестве молекулярных маркеров эволюции MTBC2,5,11. Сравнительная геномика и работа по полногеномному секвенированию (WGS) подтверждают разделение адаптированных к человеку членов на девять линий (Mycobacterium tuberculosis L1–L4, L7 и L8; и Mycobacterium africanum L5, L6 и L9), линии L2–L4 имеют общую делецию региона TbD12,11,12,13. Кроме того, предполагается, что адаптированные к животным члены имеют общего предка, который определяется кладоспецифичными делециями в RD7, RD8, RD9 и RD102, 5 и 14.
События горизонтального переноса генов (ГПГ) и рекомбинации считаются редкими и происходят у предков МТБК, а не из-за разной истории всего члена MTBC15,16,17. Два ранних отчета Хьюза и соавторов (2002) и Гутакера и соавторов (2006) предположили, что события рекомбинации могут способствовать формированию полиморфизмов, маркирующих определенные локусы в штаммах M. tuberculosis18,19. Причины очевидного отсутствия рекомбинации в МТБК: (1) механический процесс и потеря способности ГПГ; (2) редкость событий ГПГ; (3) отсутствие вероятности событий рекомбинации в нише МТБК14,17. Недавно некоторые исследования по секвенированию всего генома (WGS), проведенные в отношении штамма MTBC 20 и Mycobacterium bovis 21, предоставили доказательства рекомбинации, впервые показав, что штаммы MTBC часто обмениваются небольшими фрагментами ДНК, но из-за ограниченной вариабельности нуклеотидной последовательности эти события до сих пор не были замечены.
Mycobacterium bovis является наиболее часто выделяемым представителем рода MTBC у домашнего скота (в основном крупного рогатого скота), хотя его также можно выделить от диких животных, находящихся на свободном выгуле и в загонах4,22,23,24. M. bovis эволюционировала в пять основных клональных комплексов [европейский 1 (Eu1), европейский 2 (Eu2), европейский 3 (Eu3), африканский 1 (Af1) и африканский 2 (Af2)], согласно профилю сполиготипирования, специфическим делециям и однонуклеотидным полиморфизмам (SNP) 25, 26, 27, 28, 29 в определенных генах. Эти клональные комплексы демонстрируют разнообразную структуру популяции Mycobacterium bovis и ее связь с географическими регионами. Кроме того, недавняя работа по полному секвенированию генов (WGS), проведённая Зимпелем и соавторами (2020), позволила построить филогению на основе однонуклеотидного полиморфизма (SNP) Mycobacterium bovis с более чем 1900 геномами, что указывает на существование по крайней мере четырёх различных линий (обозначенных как Lb1, Lb1 и Lb4). Они не полностью соответствуют ранее определённому клональному комплексу, хотя географическая специфичность также может быть подтверждена30. Эти авторы провели дифференциальный анализ филогении и молекулярное датирование, но не изучали рекомбинацию30.
Предыдущие исследования с использованием различных молекулярных методов, таких как сполиготипирование, MIRU-VNTR (микобактериальное вкрапленное повторение единиц-вариабельное тандемное повторение) и недавнее типирование однонуклеотидных полиморфизмов (SNP), выявили определённый уровень генетического разнообразия среди штаммов M. bovis [31,32,33,34,35]. Дифференциация генетической изменчивости стала важным инструментом в изучении эпидемиологии заболеваний, что способствует глубокому пониманию патогенеза, вирулентности и передачи инфекции. Появление метода полного секвенирования генов (WGS) позволило выявить эволюционные движущие факторы, обусловленные геномом Mycobacterium bovis в процессе адаптации и персистенции к различным хозяевам и эпидемиологическим сценариям.
В этой работе мы используем сравнительный геномный анализ различных наборов данных Mycoplasma bovis (n=70), включая изоляты из разных клональных комплексов, чтобы получить представление об эволюционном процессе Mycoplasma bovis, в частности, для определения филогенетических связей и событий рекомбинации. В качестве дополнения к данному анализу был дополнительно изучен поднабор изолятов M. bovis (n = 42), полученных из хорошо охарактеризованной многохозяинной туберкулезной зоны в Португалии31,36, с целью сделать вывод о неидентичности. Баланс между относительным соотношением смысловых (dN) и синонимичных (dS) нуклеотидных замен, а также эволюционный вклад конкретных геномов, упомянутых в литературе, 37,38 получен предками MTBC посредством ГПГ и кодируют компоненты генов системы 3R (репарация, репликация и рекомбинация ДНК)39. Выбирайте гены, полученные посредством ГПГ, поскольку они могут представлять древние полиморфизмы, поэтому ожидается, что они могут содержать более высокую долю синонимичных изменений. Гены, включённые в систему 3R, были выбраны, поскольку предыдущие исследования штаммов M. tuberculosis выявили общие негативные/очищающие отборы, которые воздействуют на эти гены, и они могут играть важную роль в эволюции 39. Другая цель данной работы — сделать вывод о существовании событий реорганизации. Учитывая, что наш набор данных из Португалии содержит только геномы европейского комплекса клонов 2 и штаммов, не относящихся к этому комплексу, мы решили включить общедоступные данные о геномах, чтобы в конечном итоге получить репрезентативную информацию обо всех комплексах клонов и повысить надёжность и широту результатов.
В центре данной работы находятся 42 новых секвенированных генома Mycoplasma bovis из эндемичной для Португалии многохозяинной сцены туберкулеза (подробности ниже), ранее охарактеризованных с эпидемиологической точки зрения36. Учитывая, что набор данных из Португалии содержит только представителей европейских 2-клоновых комплексов и штаммов без обозначенных комплексов, были добавлены общедоступные данные полногеномного секвенирования для расширения набора данных, который включает всех представителей клоновых комплексов M. bovis. Поэтому в данной работе использовались три источника данных полногеномного секвенирования: полная/черновая сборка генома, до 10 скаффолдов, хранящаяся в NCBI (Национальный центр биотехнологической информации) (n = 15 изолятов); хранящаяся в SRA (файл Illumina fastq архива прочтений последовательностей), представляет сложное разнообразие клонов M. bovis (n = 12 изолятов)30; и 42 новых секвенированных генома из Португалии. Mycobacterium bovis BCG (бацилла Кальметта-Герена) была исключена из поиска NCBI. M. bovis AF2122/97 обычно используется в качестве референсного генома для включения в набор данных. В связи с отсутствием в открытом доступе полной последовательности генома, представленной комплексом клонирования African 1, и небольшим количеством геномов репрезентативных штаммов Af2 и Eu1, в этих случаях использовались оригинальные данные секвенирования, предоставленные SRA. Работа Zimpel и его соавторов (2020) помогла идентифицировать геном из вышеупомянутого комплекса клонирования и выбрать Mycobacterium bovis для включения в набор данных. Для Eu3 описан только один тип генома (Branger et al., 2020), поэтому включаемый нами геном является отдельным представителем комплекса Eu3.
В глобальном масштабе этот набор данных включает 70 случаев M. bovis крупного рогатого скота, выделенных от 8 видов хозяев, распространенных в 12 странах с 1985 по 2016 год. 36 видов обозначены как Eu2, 7 видов — Eu1, 1 вид — Eu3, 3 вида — Af1, 4 вида — Af2, а 19 видов не относятся ни к одному клональному комплексу (подробности ниже). Подробная информация (включая регистрационный номер) о Mycobacterium bovis, использованная в данном исследовании, представлена в таблице 1 и дополнительной таблице 1.
42 новых секвенированных целых генома Mycobacterium bovis из очагов туберкулеза животных в Португалии, распространенных в течение более 12 лет, являются центром этого исследования, поскольку потенциальные системы заболеваний диких животных и домашнего скота регулярно отслеживались31,36 (Дополнительный рис. 1). Согласно последующим процедурам, эти штаммы были выделены от крупного рогатого скота (n = 14), благородных оленей (n = 16) и кабанов (n = 12) с 2003 по 2015 год: отбирайте и обращайтесь с животными в соответствии с рекомендуемыми руководящими принципами протокола Образцы тканей находятся в Справочнике по наземным животным МЭБ и инокулируются на твердой среде пирувата Стоунбринка и Левенштейна-Йенсена и жидкой среде. Культуры инкубируют при 37 °C, а рост проверяют один раз в неделю в течение как минимум 12 недель. Колонии хранят непосредственно в растворе глицерина при температуре -80ºC. В селективной среде для микобактерий (Middlebrook 7H9, BD Diagnostics) исходные архивные образцы были пропущены через один пассаж in vitro для получения ДНК программы WGS. Для этого замороженный исходный раствор культуры обогащали 5% пирувата натрия и 10% ADS (50 г альбумина, 20 г глюкозы, 8,5 г хлорида натрия в 1 л воды) на среде Middlebrook 7H9 при температуре 37 °C Retrain. Через 4 недели роста среду обновляли, и культуру регулярно контролировали до появления роста. Клетки собирали центрифугированием, осадок ресуспендировали в 500 мкл фосфатно-солевого буфера (PBS), нагревали при 99 °C в течение 30 минут, центрифугировали, а супернатант хранили при -20 °C до WGS. Все процедуры проводятся в помещениях биологической безопасности 3-го уровня.
Библиотека парных геномов WGS готовится с использованием уникального индекса каждого образца ДНК и секвенируется с помощью технологий Illumina MiSeq (2 × 250 пб) (40 образцов) и HiSeq (2 × 150 пб) (два изолята) (Eurofins Genomics, Германия). Для секвенирования геномной ДНК используйте анализатор Illumina Genome Analyzer с двухсторонним модулем, следуя инструкции производителя, и набор Nextera XT DNA Library Prep Kit от Illumina для создания библиотеки.
Учитывая данные, полученные в результате SRA (n = 12), идентификацию комплекса клонов можно использовать в качестве метаданных соответствующей публикации [30, 41, 43]. При рассмотрении полного генома, за исключением Mycobacterium bovis AF2122/97 и Mycobacterium bovis 3601, которые являются признанными членами клональных комплексов Eu1 и Eu3 [25, 29, соответственно], он совпадает с полным геномом Mycobacterium tuberculosis H37Rv (регистрационный номер NCBI NC_000962.3). Выравнивание геномов выполняется с использованием MAFFT (программы множественного выравнивания аминокислотных или нуклеотидных последовательностей, версия 7.458) с параметром -addfragments48. Затем выполняется поиск отсутствия различных клональных комплексов и/или наличия признаков SNP.
Недавно секвенированная Mycobacterium bovis (n = 42) и исходные прочтения собранного проекта генома (n = 3) выравнивают комплекс с референсным геномом Mycobacterium tuberculosis H37Rv через конвейер vSNP и наличие признаков делеции и/или SNP разных клонов. Был проведен поиск.
Соберите информацию об отсутствии признаков и/или наличии/отсутствии однонуклеотидных полиморфизмов (SNP) и профилей сполиготипирования, чтобы отнести геномные данные к соответствующему клональному комплексу. Для четырёх черновых сборок профиль сполиготипирования не может быть выведен, поэтому они включены в группу «без сложности».
Биоинформатический рабочий процесс, описанный в данной работе, начинается со сборки de novo и картирования референтной стратегии с целью изучения событий рекомбинации и специфических полиморфизмов генома. На рисунке 1 представлена блок-схема следующих этапов. Для анализа рекомбинации используются все геномы, что повышает надёжность выводов и связанных с ними показателей.
Чтобы уменьшить количество ошибок при генерации консенсусных последовательностей генома, мы сначала получили сборку de novo, а затем множественные выравнивания ядра. Конвейер Unicycler в настоящее время доступен по адресу https://github.com/rrwick/Unicycler49 и используется для сборки de novo 54 секвенированных геномов (42 новых секвенированных и 12 файлов fastq, восстановленных из SRA). Коротко говоря, перед сборкой с нуля был проведён анализ качества прочтений в FastQC версии 0.11.7 (https://github.com/s-andrews/FastQC) и Trimmomatic версии 0.36 (применены опции «Вырезание адаптеров и других последовательностей, специфичных для освещения, из прочтений» и «Вырезание оснований с конца прочтения, если качество ниже порогового значения 20») (http://www.usadellab.org/cms/?page=trimmomatic) 50. Затем для сборки генома использовался оптимизатор SPAdes optimizer49, а для оптимизации после сборки — Pilon версии 1.1851. Для предотвращения некорректной сборки был выбран консервативный режим мостиков, а размер k-мера был выбран в диапазоне от 20% до 95% от длины прочтения. Следуйте рекомендациям SPAdes и учитывайте размер прочтений, удаляйте контиги размером менее 300 п.н. и устанавливайте пороговое значение глубины покрытия в 20 прочтений, равное 52. В стратегии сборки de novo геномные области, такие как высокоповторяющиеся паралоги пролин-глутамат (PE) и пролин-пролин-глутамат (PPE), не удалялись.
Качество сборки de novo оценивается с помощью конвейера QUAST (http://quast.sourceforge.net/quast.html), который облегчает обновление контига и картирование эталонного генома M. bovis AF2122/97 (регистрационный номер NCBI LT708304.1) (параметры качества см. в дополнительной таблице 1).
С помощью конвейера vSNP (https://github.com/USDA-VS/vSNP) файл FASTQ недавно секвенированного M. bovis из секвенирования Illumina сравнивается с референсным геномом M. bovis AF2122/97 (LT708304.1). В соответствии с рекомендациями передовой практики набора инструментов анализа генома (GATK) 53, 54, 55 применяются стандартные параметры фильтра или варианты массовых оценок для повторной калибровки. Результаты фильтруются с использованием самого низкого массового показателя SAMtools, равного 150, и AC = 2. Также используется Kraken (http://ccb.jhu.edu/software/kraken/) для проверки показаний с целью исключения заражения. Конвейер vSNP, используемый для сопоставления со стратегиями секвенирования в нашей работе, проверяет ряд определенных SNP и мишеней, а также исключает сценарии смешанного заражения. Покрытие прочитанного генома составляет более 99% (Дополнительная таблица 1).
Чтобы избежать ошибок картирования и неправильных SNP, отфильтруйте вариант в следующих случаях: (1) он поддерживается менее чем 20 прочтениями, (2) он обнаружен с частотой менее 0,9, (3) он есть по крайней мере в одном штамме, но по крайней мере в другом штамме есть пробелы. Интегрированный просмотрщик геномики (IGV) версии 2.4.19 (http://software.broadinstitute.org/software/igv/)56 использовался для визуальной проверки SNP и позиций с проблемами картирования или выравнивания. Поскольку гены пролин-глутамата (PE) и пролин-пролин-глутамата (PPE) сильно дуплицированы и являются частью многогенного семейства, их легко неправильно понять при секвенировании и неправильном картировании Illumina, поэтому они являются предпочтительными Рабочий процесс биоинформатики микобактерий удалил членов туберкулезного комплекса при использовании стратегии картирования для подтверждения SNP. Поэтому мы исключили гены PE/PPE и индели из анализа.
Согласно Bovilist (http://genolist.pasteur.fr/BoviList/), все однонуклеотидные полиморфизмы (SNP) делятся на функциональные категории. Для определения последствий SNP (синонимичных или несинонимичных изменений) используется конвейер SnpEff (https://pcingola.github.io/SnpEff/). Создана новая база данных генома Mycobacterium bovis AF2122/97 (LT708304.1).
Множественное выравнивание основного генома было выполнено с помощью Parsnp v1.2, в настоящее время доступного по адресу https://github.com/marbl/parsnp57, с использованием 69 полных геномов/черновых сборок (с опцией -c), и M. bovis AF2122/97 (LT708304.1) в качестве референса. Было выполнено четыре множественных выравнивания основного генома: только для членов клонирующего комплекса Eu2 (n = 37), включая всех членов европейского клонирующего комплекса (n = 44), включая точку соединения европейского и африканского клонирующих комплексов (n = 51), и включая все Mycobacterium bovis в данном исследовании (n = 70).
Выравнивание ядра, сгенерированное Parsnp, используется для построения филогенетического дерева максимального правдоподобия (ML) с использованием CIPRES Science Gateway v3.3 (http://www.phylo.org/)58 с использованием RAxML и выполнения 1000 управляемых репликаций.
Для параллельной проверки наличия событий рекомбинации используются три различных алгоритма и инструмента биоинформатики: программное обеспечение SplitsTree4, конвейер Gubbins (беспристрастное определение происхождения посредством рекомбинации в последовательностях нуклеотидов) и программное обеспечение RDP4 (программа обнаружения рекомбинации, версия beta 4.101).
Метод расщепления, реализованный в SplitsTree4 v4.15.1 (http://www.splitstree.org/)59, используется для расчёта безкорневой филогенетической сети с использованием критерия Фи для статистической проверки, порог значимости составляет p = 0,05. В качестве входных данных используется основной анализ множественного выравнивания Parsnp, а расщепление используется в качестве стандарта сети.
Конвейер Gubbins v2.3.1 (https://github.com/sanger-pathogens/gubbins60) работает с параметрами по умолчанию как еще один способ оценки влияния рекомбинации на Mycobacterium bovis. Алгоритм, реализованный в конвейере, реконструирует соответствующую линию клонов. Полная сборка генома/черновика нашего набора данных и эталонный геном (бычий коровий AF2122/97, LT708304.1) взаимно; и сканирует положение SNP на каждой ветви дерева, чтобы обнаружить кластер SNP, представляющий событие рекомбинации. Нуль ветви Предположим, что событие рекомбинации отсутствует, что означает, что SNP, которые встречаются на ветви, должны быть равномерно распределены. В качестве входных файлов используются основное множественное выравнивание из Parsnp и лучшее подсчитанное дерево ML из RAxML.
Наконец, для подтверждения события реорганизации, предполагаемого конвейером Gubbins, шесть алгоритмов, реализованных в RDP467 (RDP61, GENECONV62, Bootscan63, Maxchi64, Chimaera65 и SiScan66), применяются к множественному выравниванию ядра Parsnp с настройками по умолчанию. Мы определили, что как минимум три алгоритма, реализованных в RDP4, должны стабильно демонстрировать важный сигнал для проверки каждого события рекомбинации.
Учитывая, что программное обеспечение Gubbins и RDP ищет сигналы рекомбинации, проверяя множественные выравнивания ядра в окне до 500 п.н., и подтверждая, что включение генов PE/PPE во время сборки de novo не повлияет на обнаруженные сигналы рекомбинации, дальнейший анализ проводится путем проверки гомолинейности окрестностей гена, идентифицирующего событие рекомбинации. Синлинейная карта с использованием полного генома была построена с помощью выравнивания MAUVE-multi-genome (http://darlinglab.org/mauve/mauve.html) для исключения локальных транслокаций или инверсий генома. Кроме того, весь геном использовался для проведения анализа гомолинейности аминокислотной последовательности через веб-сервер SyntTax (https://archaea.i2bc.paris-saclay.fr/SyntTax/).
Более глубокий анализ набора геномных данных, полученных из португальской многохозяинной системы туберкулеза, направлен на проверку полиморфизма генов, упомянутых в литературе. Это гены 37, 38 и ген, кодирующий 3R, полученный от предков MTBC через компоненты системы ГПГ (репарация, репликация и рекомбинация ДНК) 39. Для расчета генного разнообразия и нуклеотидного разнообразия (π) и входных параметров теста Тадзимы на D-нейтральность используются ClustalX v2.1 (http://www.clustal.org/clustal2/) и DnaSP v6.12.03 (http://www.ub.edu/dnasp/).
Было получено филогенетическое дерево максимального правдоподобия (ML), основанное на 69 изолятах Mycoplasma bovis и референтных геномах (рисунок 2A). По сравнению с деревьями, основанными на одном гене или на нескольких локусах, эта стратегия позволяет генерировать более мощные деревья, которые не охватывают изменчивость всего генома и, следовательно, демонстрируют более низкую способность различать виды68,69. Топологическая структура дерева ML обычно согласуется со сложной классификацией клонов. Геном Eu2 кластеризован в ветвь, а геном Af1 также кластеризован вместе (рисунок 2A). Результат также согласуется с известными эволюционными отношениями Mycobacterium bovis, то есть существует большое различие между членом Eu1 и группой, состоящей из всех других клональных комплексов и геномов, но клональный комплекс 30 не указан. Небольшое несоответствие между клональным комплексом и взаимосвязью, наблюдаемой на филогенетическом дереве, можно объяснить тем фактом, что клональный комплекс описывается на основе определенных геномных регионов, тогда как филогенетическое дерево основано на множественных выравниваниях основных геномов, представляющих весь геном.
Филогенетическое дерево максимального правдоподобия (GTR) построено на основе выравнивания основного генома Mycobacterium bovis до (A) и после (B) удаления сайта рекомбинации. Цвета ветвей соответствуют комплексу клонов Mycobacterium bovis: Европа 1 – фиолетовый, Европа 2 – красный, Европа 3 – синий, Африка 1 – оранжевый, Африка 2 – зеленый. Дерево укоренено и изображено в масштабе, а длина ветви измеряется как замена для каждого сайта.
Комплекс Mycobacterium tuberculosis описывается как клонально эволюционирующий, и большинство доказательств, накопленных за эти годы, подтверждают идею о том, что текущие события горизонтального переноса генов (ГПГ) и рекомбинации не будут происходить на обнаруживаемом уровне MTBC15,17,18.
Предыдущая работа показала, что между штаммами MTBC может быть ограниченная рекомбинация20,21, в то время как другие не смогли идентифицировать измеримые события рекомбинации70,71. Пересмотреть этот вопрос, сосредоточившись на Mycobacterium bovis, что отличается от предыдущей работы, которая рассматривала только Mycobacterium tuberculosis70,71; или рассматривать MTBC в целом, практически не имея M. bovis, представляющих 20; или рассматривать только рестриктивные фракции крупного рогатого скота. Набор данных по микобактериям в этой работе содержит в общей сложности 70 штаммов, представляющих все клональные комплексы, используемые для скрининга рекомбинации. Набор данных масштабируется в соответствии с четырьмя кумулятивными уровнями: (1) члены Eu2, (2) все члены европейского комплекса клонов (т. е. Европа), (3) европейский и африканский комплекс клонов (Eu + Af) и (4) все коллекции данных (включая геномы, которые не включены ни в один из уже описанных комплексов клонирования).
Для дальнейшего изучения этой гипотезы была проведена работа по сети расщепления-декомпозиции для оценки отсутствия событий рекомбинации между геномами, поскольку этот метод позволяет визуализировать родственные связи между особями и выявлять противоречивые филогенетические сигналы. Все четыре набора данных в анализе подтвердили наличие петель в сети (то есть областей, не сходящихся в единое дерево), однако тест Phi не имеет статистической поддержки (Eu2, p = 0,0956; Европа, p = 0,1637; Eu + Af p = 0,2774; весь набор данных p = 0,2451), что является слабым доказательством наличия событий реорганизации (рис. 3A–D).
В Европе 2 генома (n = 37) (A), европейские геномы (n = 44) (B), европейские и африканские геномы (n = 51) (C) и весь набор данных (n = 70) (D).
После этого анализа и с учетом циклических наблюдений во всех сетях, алгоритм реконструкции, реализованный в конвейере Губбинса, был применен для реконструкции клональной линии и для дополнения оценки эффекта рекомбинации на геном M. bovis. Выведите кумулятивное число событий рекомбинации, большинство из которых произошло в терминальных ветвях (т. е. в одном геноме) (таблица 2). Эти показатели показывают согласованность всего набора данных и указывают, что частота событий рекомбинации в 200-300 раз превышает частоту мутаций. Как только параметр rho/theta, представляющий относительные скорости рекомбинации и точечных мутаций на ветви, оказывается между 0,0037 и 0,0056 (таблица 3). Недавно опубликованная работа по штамму 38 M. bovis продемонстрировала более высокое значение rho/theta (rho/theta = 0,1), чем полученное в этом наборе данных, но работа Патане и коллег использовала основанную на референтных данных сборку для выведения параметров рекомбинации. Процедурная деталь, обусловленная процедурой сборки, была связана с обилием предполагаемых событий рекомбинации в терминальной ветви.
Далее параметр r/m представляет собой отношение разнообразия рекомбинации и введения мутаций, а его среднее значение составляет от 0,025 до 0,037, что указывает на то, что по сравнению с мутациями рекомбинация оказывает меньшее общее влияние на генетическое разнообразие M. bovis (таблица 3). Для обширного сравнения аналогичный метод был использован для оценки параметра r/m для набора данных MTBC, состоящего из 23 геномов, показав среднее значение 0,48620, в то время как для набора данных M. bovis из 38 геномов Патане и его коллег среднее значение составило 0,98. В первом исследовании только два из 23 геномов были включены в работу M. bovis (M. bovis BCG и референтный штамм), поэтому полученное значение может быть смещено из-за сверхэкспрессии генома M. tuberculosis. Во втором отчете проанализированные популяции Mycobacterium bovis были в основном получены из Соединенных Штатов и от домашнего скота. Напротив, в нашем наборе данных представлено больше географических локаций и видов хозяев, а также используются геномы, сгруппированные в различные клональные комплексы с различными популяционно-генетическими характеристиками, что позволяет получить более глубокие и широкие популяционные знания. Разница среднего значения r/m, полученная с помощью нашего набора данных, согласуется с концепцией о том, что степень рекомбинации значительно варьируется между линиями, отнесенными к одному и тому же таксономическому виду, поэтому эти результаты указывают на то, что комплекс клонов M. bovis может демонстрировать различия в рекомбинации. Влияние также соответствует предположениям Дидело и Мейдена72. Тем не менее, значительное расширение этого набора данных за счет включения большего числа геномов M. bovis позволит дополнительно прояснить этот вопрос. Параметры r/m и rho/theta показывают изменчивость между ветвями, и этот результат согласуется с сообщениями о других видах бактерий72,73.
Наконец, для подтверждения событий реорганизации, выявленных конвейером Gubbins, в программном обеспечении RDP4 были использованы шесть различных алгоритмов для независимой проверки различных основных множественных сравнений. В глобальном масштабе менее половины событий, выявленных Gubbins, были подтверждены RDP4 (таблицы 4 и 5). Рассматривая весь набор данных, были подтверждены три события рекомбинации: два с участием внутренних узлов и одно с участием одного генома в терминальной ветви, для которого не удалось назначить клональные комплексы (таблицы 4 и 5). Идентификация событий в терминальных ветвях может указывать на то, что рекомбинация все еще продолжается в современных штаммах M. bovis или результат неверен70. В этой гипотетической области рекомбинации примерно 20% позиций имеют неопределенные нуклеотиды (N), что влияет на сигнал рекомбинации (Дополнительный рисунок 2). Кроме того, этот участок затрагивает ген rrs, кодирующий 16S рибосомную РНК, которая, как ожидается, высококонсервативна, поэтому этот предполагаемый сигнал рекомбинации может быть результатом ошибок секвенирования или несоответствия. Затем было проведено выравнивание всего генома Mb0003 и Mycobacterium bovis AF2122/97, и было подтверждено наличие неопределённых нуклеотидов и однонуклеотидных полиморфизмов (SNP), поэтому возможные проблемы, связанные с несоответствием выравнивания, не связаны с биологической информацией, реализованной в данной работе. Появилось после обучения программы.
Никаких пробелов или неопределенных нуклеотидов не было обнаружено в областях рекомбинации внутренних узлов (рисунки 4 и 5). Что касается этих событий, одно из них содержит только геном Eu2 и затрагивает ген pks12, который кодирует возможную поликетидсинтазу; в то время как другое зарегистрировано в геноме Eu1 и затрагивает ген narX, который кодирует возможную нитратредуктазу (таблица 4). В целом, анализ рекомбинации показывает, что существует ограниченное количество фрагментов рекомбинации со статистической поддержкой, а выведенные индикаторы указывают на то, что рекомбинация оказывает незначительное влияние на линию M. bovis. Ожидается, что сигнал рекомбинации будет низким, но важно отличить истинный сигнал эволюции от фонового шума, что является сложной задачей. Чтобы снизить уровень шума, вызванного проблемами сборки на основе референсных данных и несоответствиями 70, 71, все остальные геномы, за исключением полного, были собраны с нуля, а качество сборки было проверено и подтверждено с помощью анализа конвейера QUAST (Дополнительная таблица 1). Кроме того, был проведен ряд дополнительных анализов для обеспечения надежности и точности всего исследования. Поэтому качество секвенирования генов narX и pks12 было оценено путем картирования прочтений против Mycobacterium bovis AF2122/97. Рекомендуемое положение SNP в области рекомбинации было подтверждено с применением критериев, упомянутых в разделе «Метод» (не менее 20 прочтений и частота изменений 0,9). Полиморфизм гена narX был полностью подтверждён в двух геномах (Mb1792361 и Mb7240415; 2,3%), а также в геномах генома pks12: Mb0891, Mb1711, Mb1789, Mb1870, Mb17046, Mb1756 и Mb12. Однако для генома Mb2043 шесть из восьми позиций не соответствуют критерию глубины прочтений, поскольку однонуклеотидный полиморфизм (SNP) поддерживается максимум 17 прочтениями, что ниже установленного порогового значения 20. Следовательно, можно подтвердить рекомбинацию шести геномов (8,6%) в этом участке генома (рисунки 4 и 5).
Детальная визуализация выравнивания области рекомбинации набора данных Mycobacterium bovis затрагивает ген narX, кодирующий возможную нитратредуктазу. В области рекомбинации внутренних узлов не обнаружено пробелов или неопределенных нуклеотидов. Это событие зарегистрировано в геноме Eu1. Качество секвенирования гена narX оценивалось путем построения графика прочтений Mycobacterium bovis AF2122/97. Подтвердите рекомендуемое расположение SNP в области рекомбинации, применив критерии, указанные в разделе «Метод» (не менее 20 прочтений и частота вариаций 0,9). Полиморфизм гена narX был полностью подтвержден в геномах Mb1792361 и Mb7240415 (2,3%).
Подробная визуализация выравнивания области рекомбинации набора данных Mycoplasma bovis, затрагивающего ген pks12. Пробелов или неопределенных нуклеотидов в области рекомбинации внутренних узлов не обнаружено. Что касается события, затрагивающего ген pks12, кодирующий возможную поликетидсинтазу, он содержит только геном Eu2. Качество секвенирования pks12 оценивалось путем картирования прочтений Mycobacterium bovis AF2122/97. Подтвердите рекомендуемое расположение SNP в области рекомбинации, применив критерии, указанные в разделе «Метод» (не менее 20 прочтений и частота вариаций 0,9). Полиморфизмы геномов Mb0891, Mb1711, Mb1789, Mb1870, Mb1758, Mb2043 и Mb1960 полностью подтверждены.
Гены PE и PPE имеют повторяющиеся области, которые легко неправильно считываются при секвенировании и неправильном картировании Illumina, поэтому они обычно удаляются из рабочего процесса биоинформатики представителей M. tuberculosis только при использовании стратегии картирования в последовательность. Вывод событий рекомбинации, применяемый в этой работе, основан на сборке de novo без фильтрации PE/PPE. Мы считаем, что благодаря реализации трех различных дополнительных методов и алгоритмов через SplitsTree, конвейер Gubbins и программное обеспечение RDP4, применяемые стратегии являются надежными для обработки и фильтрации реорганизованных областей, вызванных сигналами ошибок. Однако, чтобы исключить помехи гена PE/PPE в программном обеспечении Gubbins и RDP4 для идентификации кластеров SNP и, следовательно, идентификации областей рекомбинации, предположительно влияющих на гены narX и pks12, было исследовано соседство этих генов (Дополнительный рисунок 3–5). У M. bovis AF2122/97 ген narX разделён narK2 и Mb1764c, а pks12 окружён Mb2075c и Mb2073c (Дополнительный рисунок 3-5). Карта, созданная с использованием карты синлиний MAUVE полного генома, предоставляет информацию о консервации и перестройках генной последовательности, показывая четыре коллинеарных блока и отсутствие признаков транслокации или инверсии генома. Кроме того, комплементационный анализ с аминокислотной последовательностью подтвердил гомологию во всех полных геномах, и PE/PPE не были обнаружены в соседних областях narX или pks12. Для narX один геном (Mb0030) имеет более низкую оценку синонимии, поскольку ген narX был идентифицирован в виде двух фрагментов (фрагменты 1891 и 1890). Для pks12, благодаря сходству, Mb0030 и Mb003 продемонстрировали более низкие показатели синлинейности, в то время как pks12 был идентифицирован в двух и трёх фрагментах соответственно, представляющих разные домены белка (Дополнительный рисунок 3-5). Учитывая эту информацию и анализ, выполненный программами Gubbins и RDP4, и проверив множественное выравнивание ядра максимальных 500 п.н. в окне, мы подтвердили, что ген PE/PPE не будет препятствовать рекомбинационному сигналу, влияющему на narX и pks12.
Хотя сигналы рекомбинации, обнаруженные в этом наборе данных, можно считать остаточными, рекомбинацию у M. bovis действительно нельзя исключить, поэтому она должна по-прежнему оставаться предметом дальнейшего анализа, в котором целые геномы из разных эпидемиологических сценариев секвенируются до важного.
Сравнение филогенетических деревьев МЛ, полученных до и после коррекции рекомбинации (рисунок 2А, В), не привело к существенным изменениям в предполагаемой филогенетической связи, а штаммы M. bovis были сгруппированы в одну группу.
После сопоставления 42 новых секвенированных прочтений M. bovis с референсным геномом M. bovis AF2122/97 было получено выравнивание SNP, содержащее 1816 полиморфных позиций. Большинство SNP (87,1%) расположены в кодирующей области, а затронутые гены охарактеризованы в соответствии с функциональными категориями, представленными в Bovilist (рис. 6A, B). Учитывая общее количество генов в каждой функциональной категории, наибольшее количество SNP было выявлено в генах категории «липидный метаболизм», за ними следуют гены «клеточной стенки и клеточных процессов» и «промежуточного метаболизма и дыхания», что свидетельствует об их участии в эволюции M. bovis.
Иерархический анализ набора данных M. bovis из Португалии (n = 42). Общее количество зарегистрированных однонуклеотидных полиморфизмов (SNP) и затронутых генов для каждой функциональной категории (A). Общее количество синонимичных и несинонимичных изменений, зарегистрированных по функциональной категории (B).
В глобальном масштабе среднее отношение dN/dS превышает 1,5, что указывает на глобальное эволюционное давление, направленное на избавление от предкового состояния, и представляет собой позитивный (диверсифицированный или направленный) и/или смягченный сценарий выбора очищения. В категориях «вирулентность, детоксикация, адаптация», «инсерционные последовательности и фаги» и «регуляторные белки» более двух третей однонуклеотидных полиморфизмов (SNP) являются несинонимичными (рис. 6B).
Во всех категориях есть гены с несколькими SNP, что приводит к средней частоте мутаций (то есть среднему SNP на ген) больше 1 (Рисунок 6A). Pks12 (Mb2074c) с 15 SNP и fas (Mb2553c) с 8 SNP имеют более высокие значения мутаций. Оба этих гена участвуют в метаболизме жирных кислот. Ген pks кодирует поликетидсинтазу (PKS), которая является многофункциональным ферментом, участвующим в биосинтезе липидов клеточной стенки микобактерий74,75. Этот ген кодирует многофункциональный полипептид, который участвует в синтезе микокетидов74,76. Ген fas участвует в синтезе миколовой кислоты. Оба этих гена играют важную роль в биосинтезе клеточной стенки при контакте с хозяином.
Для дальнейшего изучения эволюции Mycobacterium bovis были проанализированы два набора специфических генов. В ранее опубликованных работах, использующих методы секвенирования и филогенетические методы, были выявлены гены, приобретенные предками MTBC посредством горизонтального переноса генов (ГПГ) до диверсификации37,38. Эти гены перечислены в Дополнительной таблице 2. Было проанализировано распределение однонуклеотидных полиморфизмов (SNP) в общей сложности 77 генов, которые могут быть связаны с ГПГ, и выявлено 26 полиморфных участков, которые в большинстве случаев (78%) приводили к несинонимичным (NS) изменениям (Дополнительная таблица 2). Предыдущие исследования генома MTBC показали, что предполагаемый регион ГПГ демонстрирует более высокую долю SNP с NS по сравнению с остальной частью генома. Если предположить, что эти рекомбинационные регионы были приобретены предками MTBC и, следовательно, представляют собой преобладание древних полиморфизмов, то доля синонимичных изменений должна быть выше, поскольку замены NS, как ожидается, будут элиминироваться негативным отбором из-за аминокислотных изменений, которые могут изменить функцию белка. Таким образом, наши результаты указывают на то, что функциональные последствия могут быть связаны с заменой генов, подобных ГПГ, что отражает их важность для ценного адаптивного генетического разнообразия.
Параллельно с этим анализом, гены, кодирующие компоненты системы 3R (репарация, репликация и рекомбинация ДНК), были тщательно изучены в соответствии со списком, ранее опубликованным Досом Вультосом и соавторами (2008)39. Обмен идентичными фрагментами ДНК невозможно наблюдать напрямую, хотя это может быть частым процессом, когда участвуют близкородственные бактерии, как в случае этого набора данных; кроме того, этот процесс может быть ключом к методам репарации ДНК72, поэтому играют роль в гомологичной рекомбинации. Всего было идентифицировано 26 полиморфных позиций, распределенных по 54 генам (Дополнительная таблица 3). В этом наборе генов изменения NS составляли около 65% последствий, что согласуется с предыдущими сообщениями о штаммах Mycobacterium tuberculosis.
Время публикации: 21 октября 2021 г.





