Nature를 방문해 주셔서 감사합니다. 현재 사용 중인 브라우저 버전은 CSS 지원이 제한적입니다. 최상의 환경을 위해 최신 버전의 브라우저를 사용하거나 Internet Explorer의 호환 모드를 해제하는 것이 좋습니다. 또한, 지속적인 지원을 위해 스타일 및 JavaScript가 없는 사이트도 표시됩니다.
유전체 시퀀싱은 감염병 연구 분야에 활력을 불어넣어 질병 역학, 발병 기전, 숙주-병원체 상호작용, 그리고 병원체에 부과된 진화 과정을 밝혀냈습니다. 결핵균 복합체(MTBC)는 결핵균 우형결핵(Mycobacterium bovis)을 육상 포유류에서 결핵(TB)을 유발하는 동물 적응 구성원 중 하나로 간주하며, 박테리아 진화의 전형적인 모델입니다. 다른 결핵균 복합체 구성원과 마찬가지로, 결핵균 우형결핵은 엄격하게 복제되고 느리게 진화하는 병원체로 추정되며, 재조합이나 수평적 유전자 전이의 징후는 명백히 없습니다. 본 연구에서는 서로 다른 혈통(유럽과 아프리카)에서 유래한 70마리의 소 결핵균으로 구성된 전체 유전체 시퀀싱(WGS) 데이터 세트에 비교 유전체학을 적용하여 소 결핵균의 유전적 다양성에 대한 통찰력을 얻었습니다. 진화적 힘. 세 가지 방법을 사용하여 재편성의 징후를 추정합니다. 전 세계적으로 소수의 재조합 사건이 확인되었으며, 두 가지 독립적인 방법을 통해 확고한 근거를 바탕으로 확인되었습니다. 그럼에도 불구하고 돌연변이와 비교했을 때 재조합은 M. bovis의 다양성에 미치는 영향이 약합니다(전체 r/m = 0.037). 저희 데이터 세트에서 Mycobacterium bovis의 클론 복합체에서 얻은 r/m 평균 차이는 동일한 분류 종에 할당된 계통 간에 재조합 정도가 크게 다를 수 있다는 일반적인 개념과 일치합니다. 이 작업을 기반으로 Mycobacterium bovis의 재조합을 배제할 수 없으므로 전 세계의 다양한 역학 시나리오에서 대규모 데이터 세트의 WGS가 중요한 향후 비교 유전체학 연구에서 추가 노력의 주제가 되어야 합니다. 그런 다음 다중 숙주 결핵 유병률에서 더 작은 Mycobacterium bovis 데이터 세트(n = 42)에 대한 추가 분석을 수행했고 1,800개 이상의 유전자좌가 식별되었으며 그 중 하나 이상의 균주가 단일 뉴클레오티드 다형성(SNP)을 보였습니다. 대부분(87.1%)은 코딩 영역에 위치하며, 동의어 변화의 비동의어 변화 비율(dN/dS)은 1.5를 초과합니다. 이는 양성 선택이 우형 결핵균에 가해진 중요한 진화적 힘임을 시사합니다. "지질 대사", "세포벽 및 세포 과정", "중간 대사 및 호흡"과 같은 기능적 범주가 풍부한 유전자에서 더 높은 비율의 SNP가 검출되었으며, 이는 우형 결핵균의 생물학 및 진화적 중요성에 대한 잠재력을 보여줍니다. 수평적 유전자 전이에 취약하고 3R(DNA 복구, 복제 및 재조합) 시스템에 포함되는 MTBC 조상의 유전자를 자세히 살펴보면 Taijima의 D 중성 검사에서 전반적인 평균 음성 값을 보이는데, 이는 과거 선택적 스캐닝을 시사합니다. 개체군 확장 후 최근 병목 현상은 여전히 필수 병원균인 우형 결핵균이 숙주와 싸우는 주요 진화적 원동력입니다.
결핵균 복합체(MTBC)는 가장 성공적인 세균 병원균 분류군 중 하나이며, 세균 진화의 전형적인 사례입니다. 이 복합체의 구성원들은 유전체 수준에서 놀라울 정도로 높은 뉴클레오타이드 동일성(>99%)을 보입니다.1,2 다양한 MTBC 생태형은 미세포유류부터 인간에 이르기까지 광범위한 숙주 종에서 전염성 육아종성 질환인 결핵(TB)을 유발할 수 있습니다.3,4,5 현재 이 복합체에는 인간[결핵균(M. Tuberculosis (Mtb), Mycobacterium africanum]과 동물 적응 병원균(Mycobacterium bovis, Mycobacterium capitum, Mycobacterium pinnipedum, Mycobacterium microtobacter, Mycobacterium mongee, Mycobacterium miysani, Mycobacterium surika, "Bacillus chimpanzee", "dassie")이 포함됩니다.5,6 M. canettii(Nodobacter glabrata라고도 함) 앞서 언급한 결핵균과의 평균 뉴클레오티드 동일성은 98%이며, 비교 유전체학 연구에 따르면 M. canettii와 나머지 MTBC가 공통 조상으로부터 최근 갈라져 나간 것으로 나타났습니다.7 이 개념을 고려하여 일부 저자는 M. canettii를 MTBC의 구성원이라고 부릅니다.
MTBC는 체계적으로 엄격한 클론 복합체로 기술되며, 그 집단 구조는 감소된 다양성, 병목 현상, 선택적 스캐닝, 그리고 유전자 표류에 의해 명확하게 지배됩니다9,10. 결손된 다형성과 같은 복잡한 엄격한 클론 진화는 재조합으로 복원될 수 없다고 가정합니다. 이러한 전제를 바탕으로, 차등 영역(RD)과 TbD1(Mtb 특이적 결손 1 영역)의 유전체 결손이라는 연속적인 사건이 MTBC 진화의 분자 마커로 제안되었습니다2,5,11. 비교 유전체학 및 전체 유전체 시퀀싱(WGS) 연구는 인간 적응 구성원을 9개 계통(결핵균 L1~L4, L7, L8; 그리고 결핵균 L5, L6, L9)으로 구분하고, L2~L4 계통은 TbD1 공유 결손 영역으로 구분하는 것을 뒷받침합니다2,11,12,13. 또한, 동물에 적응한 구성원은 공통 조상을 공유한다고 제안되었으며, 이는 RD7, RD8, RD9 및 RD102, 5 및 14에서 분기군별 삭제로 정의됩니다.
수평적 유전자 전이(HGT)와 재조합 현상은 드물게 발생하며, MTBC 전체 구성원의 다른 이력보다는 MTBC의 조상에서 발생하는 것으로 여겨진다15,16,17. Hughes와 공동 연구진(2002)과 Gutacker와 공동 연구진(2006)의 두 초기 보고서는 재조합 현상이 결핵균주의 특정 유전자좌를 표시하는 다형성을 형성하는 데 도움이 될 수 있다고 제안했다18,19. MTBC에서 재조합 현상이 명백히 나타나지 않는 이유는 다음과 같다. (1) HGT의 기계적 과정 및 능력 상실, (2) HGT 현상의 희소성, (3) MTBC 니치에서 재조합 현상이 발생할 가능성이 전혀 없음14,17. 최근 MTBC 균주 20과 Mycobacterium bovis 21에 적용된 일부 전체 유전체 시퀀싱(WGS) 연구에서 재조합의 증거가 제공되었습니다. 이는 MTBC 균주가 종종 작은 DNA 조각을 교환하지만 뉴클레오티드 서열 변이가 제한적이기 때문에 이러한 이벤트가 아직 눈에 띄지 않는다는 것을 보여준 최초의 사례입니다.
Mycobacterium bovis는 가축(주로 소)에서 가장 흔하게 분리되는 MTBC 구성원이지만, 방목형 및 울타리가 쳐진 야생 동물에서도 분리될 수 있습니다4,22,23,24. M. bovis는 spoligotyping 프로필, 특정 유전자의 특정 결실 및 단일염기다형성(SNP)25, 26, 27, 28, 29에 따라 5개의 주요 클론 복합체[유럽 1(Eu1), 유럽 2(Eu2), 유럽 3(Eu3), 아프리카 1(Af1) 및 아프리카 2(Af2)]로 진화했습니다. 이러한 클론 복합체는 Mycobacterium bovis 집단의 다양한 구조와 지리적 지역과의 연관성을 보여줍니다. 또한, 짐펠(Zimpel)과 공동 연구진(2020)이 수행한 최근 WGS 연구는 1,900개 이상의 유전체를 포함하는 마이코박테리움 보비스(Mycobacterium bovis)의 단일염기다형성(SNP)을 기반으로 계통발생학을 설계했습니다. 이는 최소 네 개의 서로 다른 계통(Lb1에서 Lb1, Lb4까지)이 존재함을 시사합니다. 이 계통들은 지리적 특이성을 확인할 수 있지만, 이전에 정의된 클론 복합체와 완전히 일치하지는 않습니다. 30. 이 저자들은 계통발생학 및 분자 연대 측정에 대한 감별 분석을 수행했지만, 재조합에 대한 연구는 수행하지 않았습니다. 30.
스폴리고타이핑(spoligotyping), MIRU-VNTR(mycobacterial interspersed repeat unit-variable tandem repeat number), 그리고 최근 SNP 타이핑과 같은 다양한 분자 기법을 사용한 이전 연구들은 M. bovis 균주들 간에 일정 수준의 유전적 다양성을 밝혀냈습니다(31,32,33,34,35). 유전적 변이의 구분은 질병 역학 연구에서 중요한 도구가 되었으며, 이는 발병 기전, 독성 및 질병 전파에 대한 심층적인 이해에 도움이 됩니다. WGS 방법의 등장은 M. bovis 유전체가 다양한 숙주 및 역학적 상황에 적응하고 지속하는 과정에서 부과하는 진화적 동인들을 밝혀낼 가능성을 제공합니다.
이 연구에서는 다양한 클론 복합체의 분리주를 포함한 다양한 마이코플라스마 보비스 데이터 세트(n=70)에 대한 비교 유전체 분석을 사용하여 마이코플라스마 보비스의 진화 과정에 대한 통찰력을 얻고, 특히 계통학적 관계와 재조합 사건을 해결하고자 합니다. 이 분석을 보완하기 위해 포르투갈의 잘 특성화된 다중 숙주 결핵 지역에서 얻은 M. bovis 분리주(n = 42)의 하위 데이터 세트 31,36를 추가로 탐색하여 동일성이 없음을 추론했습니다. 문헌에 언급된 특정 게놈의 진화적 기여뿐만 아니라 의미(dN)와 동의어(dS) 뉴클레오티드 치환의 상대적 비율 간의 균형은 37,38 HGT를 통해 MTBC 조상에서 얻었으며 3R(DNA 복구, 복제 및 재조합) 시스템 유전자 구성 요소를 인코딩합니다 39. HGT를 통해 얻은 유전자를 선택하는 이유는 고대 다형성을 나타낼 수 있기 때문에 동의어 변화의 비율이 더 높을 것으로 예상되기 때문입니다. 3R 시스템에 포함된 유전자들은 결핵균주에 대한 이전 연구에서 이러한 유전자들에 작용하는 일반적인 음성/정제 선택이 나타났고, 이러한 유전자들이 진화에 중요한 역할을 할 가능성이 있음을 시사했기 때문에 선정되었습니다. 39. 이 연구의 또 다른 목표는 재편성 사건의 존재를 추론하는 것입니다. 이러한 이유로, 포르투갈의 데이터 세트에는 유럽 클론 복합체 2와 클론 복합체를 지정하지 않은 균주의 유전체만 포함되어 있다는 점을 고려하여, 모든 클론 복합체를 대표하는 결과를 얻고, 결과의 견고성과 폭을 향상시키기 위해 공개적으로 이용 가능한 유전체 데이터를 포함하기로 결정했습니다.
포르투갈 고유 다숙주 결핵 현장에서 새롭게 시퀀싱된 42개의 마이코플라스마 우비스 유전체(자세한 내용은 아래 참조)는 이전에 역학적 관점에서 특성화되었으며,36 이 연구의 핵심입니다. 포르투갈의 데이터 세트에는 유럽 2개 클론 복합체와 지정 복합체가 없는 균주의 대표만 있다는 점을 고려하여, 공개적으로 이용 가능한 전체 유전체 시퀀싱 데이터를 추가하여 모든 마이코플라스마 우비스 클론 복합체 대표를 포함하는 데이터 세트를 확장했습니다. 따라서 이 연구에는 세 가지 전체 유전체 시퀀싱 데이터 소스를 사용했습니다. 완전/초안 유전체 어셈블리, NCBI(국립생명공학정보센터)에 저장된 최대 10개의 스캐폴드(n = 15개 분리주), SRA(시퀀스 리드 아카이브의 Illumina fastq 파일)에 저장된 마이코플라스마 우비스 클론(n = 12개 분리주)의 복합적 다양성을 나타냅니다.30, 그리고 포르투갈에서 새롭게 시퀀싱된 42개의 유전체입니다. Mycobacterium bovis BCG(Bacille Calmette-Guerin)는 NCBI 검색에서 제외되었습니다. M. bovis AF2122/97은 일반적으로 데이터 세트에 포함될 참조 유전체로 사용됩니다. African 1 클로닝 복합체가 나타내는 전체 유전체 시퀀스를 공개적으로 이용할 수 없고 Af2 및 Eu1의 대표 균주에서 얻은 유전체 수가 적기 때문에 이러한 경우 SRA에서 제공한 원본 시퀀싱 데이터를 사용했습니다. Zimpel과 그의 공동 연구자(2020)의 작업은 앞서 언급한 클로닝 복합체의 유전체를 식별하고 데이터 세트에 포함할 Mycobacterium bovis를 선택하는 데 도움이 되었습니다. Eu3의 경우 한 가지 유형의 유전체만 기술되어 있으므로(Branger et al., 2020), 우리가 포함하는 유전체는 Eu3 복합체를 별도로 대표합니다.
전 세계적으로 이 데이터 세트에는 1985년부터 2016년까지 12개국에 분포한 8종 숙주에서 분리된 소 M. bovis 70마리가 포함됩니다. 36종은 Eu2, 7종은 Eu1, 1종은 Eu3, 3종은 Af1, 4종은 Af2로 지정되었으며, 19종은 어떤 클론 복합체에도 속하지 않았습니다(자세한 내용은 아래 참조). 본 연구에 사용된 Mycobacterium bovis의 자세한 정보(접근 번호 포함)는 표 1과 보충 표 1에 제시되어 있습니다.
포르투갈의 동물 결핵 핫스팟에서 12년 이상 분포되어 온 Mycobacterium bovis의 새롭게 시퀀싱된 42개의 전체 유전체가 이 연구의 중심이며, 잠재적인 야생 동물-가축 질병 시스템이 정기적으로 모니터링되었습니다 31,36 (보충 그림 1). 이후 절차에 따라 이러한 균주는 2003년부터 2015년까지 소(n = 14), 붉은 사슴(n = 16) 및 야생 멧돼지(n = 12)에서 분리되었습니다. 권장 프로토콜 지침에 따라 동물을 수집하고 취급합니다. 조직 샘플은 OIE 육상 동물 핸드북에 있으며 Stonebrink 및 Löwenstein-Jensen 피루브산 고체 배지와 액체 배지에 접종합니다. 배양액은 37°C에서 배양하고 최소 12주 동안 일주일에 한 번씩 성장을 확인합니다. 콜로니는 -80ºC의 글리세롤 용액에 직접 보관합니다. Mycobacterium 선택 배지(Middlebrook 7H9, BD Diagnostics)에서 원래 보관된 샘플을 시험관 내에서 단일 시험관 내 통과를 통해 WGS 프로그램의 DNA를 얻었습니다. 이를 위해 동결된 배양 스톡 용액을 37°C에서 Middlebrook 7H9에서 5% 피루브산나트륨과 10% ADS(1L 물에 50g 알부민, 20g 포도당, 8.5g 염화나트륨)로 강화했습니다. 재훈련. 4주간 성장 후 배지를 교체하고 성장이 관찰될 때까지 배양을 정기적으로 모니터링했습니다. 원심분리로 세포를 수확하고 펠릿을 500µL 인산완충식염수(PBS)에 재현탁하고 99°C에서 30분 동안 가열한 후 원심분리하고 상층액을 WGS까지 -20°C에 보관했습니다. 모든 절차는 레벨 3 생물안전 시설에서 수행됩니다.
WGS 페어드-엔드 게놈 라이브러리는 각 DNA 샘플의 고유 인덱스를 사용하여 제작되었으며, 시퀀싱에는 Illumina MiSeq(2 × 250 pb)(40개 샘플) 및 HiSeq(2 × 150 pb)(2개 분리주) 기술(Eurofins Genomics, 독일)을 사용합니다. 제조업체의 지침에 따라, Illumina Genome Analyzer(양쪽 끝 모듈 부착)를 사용하여 게놈 DNA를 시퀀싱하고, Illumina의 Nextera XT DNA 라이브러리 준비 키트를 사용하여 라이브러리를 구축합니다.
SRA(n = 12)에서 복구된 데이터를 고려할 때, 클론 복합체의 식별은 해당 출판물 30, 41, 43의 메타데이터로 사용될 수 있습니다. Eu1 및 Eu3 클론 복합체 25, 29의 각각 인정된 구성원인 Mycobacterium bovis AF2122/97 및 Mycobacterium bovis 3601을 제외한 전체 유전체를 고려할 때, 이는 Mycobacterium tuberculosis H37Rv(NCBI 접근 번호 NC_000962.3)의 전체 유전체와 동일합니다. 유전체 정렬은 MAFFT(아미노산 또는 뉴클레오티드 서열의 다중 정렬 프로그램, 버전 7.458) 및 매개변수 -addfragments48을 사용하여 수행됩니다. 그런 다음 다른 클론 복합체의 부재 및/또는 SNP 특징의 존재를 검색합니다.
새롭게 시퀀싱된 Mycobacterium bovis(n = 42)와 조립된 게놈 초안의 원래 판독(n = 3)은 vSNP 파이프라인과 다양한 클론의 삭제 및/또는 SNP 특징의 존재를 통해 복합체를 참조 게놈인 Mycobacterium tuberculosis H37Rv와 정렬합니다.
특징 부족 및/또는 SNP 및 스폴리고타이핑 프로파일의 존재/부재로부터 정보를 수집하여 해당 클론 복합체에 유전체 데이터를 할당합니다. 네 개의 초안 어셈블리의 경우, 스폴리고타이핑 프로파일을 추론할 수 없으므로 "복잡성 없음" 그룹에 포함됩니다.
본 연구에서 수행하는 생물정보학 워크플로우는 재조합 사건과 특정 유전체 다형성을 탐색하는 것을 목표로, 참조 전략에 대한 신규 조립 및 매핑부터 시작합니다. 그림 1은 이 단계들의 흐름도를 보여줍니다. 재조합 분석에는 추론 및 관련 지표의 견고성을 높이기 위해 모든 유전체가 사용됩니다.
유전체 컨센서스 시퀀스 생성 시 발생하는 오류를 줄이기 위해, 먼저 드노보 어셈블리(de novo assembly)를 수행한 후, 핵심 다중 정렬(core multiple alignment)을 수행했습니다. Unicycler 파이프라인은 현재 https://github.com/rrwick/Unicycler49에서 이용 가능하며, 시퀀싱된 54개의 유전체(새로 시퀀싱된 42개 파일과 SRA에서 복구된 12개의 fastq 파일)에 대한 드노보 어셈블리를 수행하는 데 사용됩니다. 간단히 말해, 처음부터 조립하기 전에 FastQC 버전 0.11.7(https://github.com/s-andrews/FastQC)과 Trimmomatic 버전 0.36("어댑터 및 기타 조명 관련 시퀀스를 리드에서 잘라내기" 및 "임계 품질 20보다 낮은 경우 리드 끝에서 염기 잘라내기" 옵션 적용)(http://www.usadellab.org/cms/?page=trimmomatic)에서 리드 품질 분석을 수행했습니다. SPAdes optimiser49를 사용하여 유전체 조립을 수행했고, Pilon 버전 1.1851을 사용하여 조립 후 최적화를 수행했습니다. 잘못된 조립을 방지하기 위해 보수적인 브리징 모드를 선택했고, k-mer 크기를 리드 길이의 20%에서 95% 사이에서 검색하여 선택했습니다. SPAdes 가이드라인을 따르고 읽기 크기를 고려하고 300bp보다 작은 콘티그를 삭제하고 20개의 읽기 깊이 적용 범위를 52로 설정합니다. De novo 조립 전략에서 반복성이 높은 프로린-글루타메이트(PE) 및 프로린-프로린 글루타메이트(PPE) 상동 유전자와 같은 게놈 영역은 제거되지 않았습니다.
신규 조립의 품질은 콘티그와 M. bovis AF2122/97 참조 게놈(NCBI 접근 번호 LT708304.1) 매핑의 갱신을 용이하게 하는 QUAST 파이프라인(http://quast.sourceforge.net/quast.html)을 통해 평가됩니다(품질 매개변수에 대한 보충 표 1 참조).
vSNP 파이프라인(https://github.com/USDA-VS/vSNP)의 도움으로 Illumina 시퀀싱에서 새로 시퀀싱된 M. bovis의 FASTQ 파일을 M. bovis AF2122/97 참조 게놈(LT708304.1)과 비교합니다. Genome Analysis Toolkit(GATK) 53, 54, 55의 모범 사례 권장 사항에 따라 재보정을 위해 표준 필터 매개변수 또는 변이체 질량 점수를 적용합니다. 결과는 가장 낮은 SAMtools 질량 점수 150과 AC = 2를 사용하여 필터링합니다. 또한 Kraken(http://ccb.jhu.edu/software/kraken/)을 사용하여 판독값을 확인하여 오염을 배제합니다. 본 연구에서 시퀀싱 전략에 매핑하는 데 사용된 vSNP 파이프라인은 일련의 정의된 SNP와 대상을 검사하고 혼합 감염 시나리오도 제외합니다. 읽기 게놈 커버리지는 99%보다 좋습니다(보충 표 1).
매핑 오류와 잘못된 SNP를 방지하려면 다음과 같은 경우 변형을 필터링합니다.(1) 20개 미만의 판독값으로 지원되는 경우,(2) 0.9 미만의 빈도로 발견되는 경우,(3) 적어도 하나의 균주에 있지만 적어도 다른 균주에 간격이 있는 경우.통합 게놈 뷰어(IGV) 버전 2.4.19(http://software.broadinstitute.org/software/igv/)56을 사용하여 매핑 또는 정렬 문제가 있는 SNP와 위치를 시각적으로 확인했습니다.프로린-글루타메이트(PE) 및 프로린-프로린 글루타메이트(PPE) 유전자는 고도로 중복되고 다중 유전자 계열의 일부이므로 Illumina 시퀀싱 및 오매핑으로 인해 쉽게 오해되므로 이러한 유전자가 선호됩니다.결핵균 생물정보학 워크플로는 SNP를 확인하기 위해 시퀀싱에 매핑하는 전략을 사용할 때 결핵 복합체의 구성원을 제거했습니다. 따라서 우리는 분석에서 PE/PPE 유전자와 인델을 걸러냈습니다.
Bovilist(http://genolist.pasteur.fr/BoviList/)에 따르면 모든 SNP는 기능적 범주로 구분됩니다. SnpEff 파이프라인(https://pcingola.github.io/SnpEff/)은 SNP 결과(동의적 또는 비동의적 변화)를 추론하는 데 사용됩니다. Mycobacterium bovis AF2122/97 유전체(LT708304.1)에 대한 새로운 데이터베이스를 구축했습니다.
핵심 유전체 다중 정렬은 Parsnp v1.2(현재 https://github.com/marbl/parsnp57에서 이용 가능)를 사용하여 수행되었으며, 69개의 완전 유전체/초안 어셈블리(옵션 -c 사용)와 M. bovis AF2122/97(LT708304.1)을 기준으로 사용했습니다. 네 가지 핵심 다중 정렬을 수행했습니다. Eu2 클로닝 복합체 구성원만(n = 37), 유럽 클로닝 복합체 구성원 전체(n = 44), 유럽 및 아프리카 클로닝 복합체의 연결 지점(n = 51)을 포함했으며, 본 연구에 포함된 모든 Mycobacterium bovis(n = 70)를 포함했습니다.
Parsnp가 생성한 코어 정렬은 RAxML을 사용하여 CIPRES Science Gateway v3.3(http://www.phylo.org/)58을 사용하여 최대 가능도(ML) 계통수를 추론하고 1000번의 유도 복제를 수행하는 데 사용됩니다.
재조합 사건의 존재 여부를 병렬로 확인하기 위해 세 가지 서로 다른 알고리즘과 생물정보학 도구가 사용됩니다. SplitsTree4 소프트웨어, Gubbins(뉴클레오티드 서열의 재조합을 통한 비편향 혈통) 파이프라인, RDP4(재조합 감지 프로그램, 베타 버전 4.101) 소프트웨어입니다.
SplitsTree4 v4.15.1(http://www.splitstree.org/)59에 구현된 분할 분해 방법을 사용하여 루트리스 계통발생 네트워크를 계산하고, 통계적 검증을 위해 파이 검정을 사용하며, 유의수준은 p = 0.05입니다. Parsnp의 핵심 다중 정렬 분석을 입력으로 사용하여 네트워크 표준으로 분할 분해를 구현했습니다.
Gubbins 파이프라인 v2.3.1(https://github.com/sanger-pathogens/gubbins60)은 Mycobacterium bovis에 대한 재조합의 영향을 평가하는 또 다른 방법으로 기본 매개변수로 실행됩니다. 파이프라인에 구현된 알고리즘은 관련 클론 계통을 재구성합니다. 데이터 세트의 전체 게놈/초안 어셈블리와 참조 게놈(소 우과 동물 AF2122/97, LT708304.1)은 상호 작용합니다. 그리고 재조합 이벤트를 나타내는 SNP 클러스터를 감지하기 위해 트리의 각 분기에서 SNP의 위치를 스캔합니다. 분기의 0은 재조합 이벤트가 없다고 가정합니다. 즉, 분기에서 발생하는 SNP는 균등하게 분포되어야 합니다. Parsnp의 핵심 다중 정렬과 RAxML의 가장 높은 점수를 받은 ML 트리가 입력 파일로 사용됩니다.
마지막으로, Gubbins 파이프라인에서 제안된 재구성 이벤트를 확인하기 위해 RDP467에 구현된 6가지 알고리즘(RDP61, GENECONV62, Bootscan63, Maxchi64, Chimaera65, SiScan66)을 기본 설정에서 Parsnp의 핵심 다중 정렬에 적용했습니다. RDP4에 구현된 알고리즘 중 최소 3개는 각 재조합 이벤트를 검증하는 데 중요한 신호를 지속적으로 보여야 한다는 것을 확인했습니다.
Gubbins와 RDP 소프트웨어 모두 최대 500bp의 윈도우에서 핵심 다중 정렬을 확인하여 재조합 신호를 찾고, de novo 어셈블리 중 PE/PPE 유전자가 포함되더라도 발견된 재조합 신호에 영향을 미치지 않음을 확인한다는 점을 고려하여, 추가 분석은 상동성 분석을 통해 수행됩니다. 재조합 이벤트를 식별하는 유전자의 인접성을 확인합니다. 전체 유전체를 사용한 상동성 지도는 국소 유전체 전좌 또는 역위를 배제하기 위해 MAUVE-다중 유전체 정렬(http://darlinglab.org/mauve/mauve.html)을 사용하여 구축했습니다. 또한, 전체 유전체를 사용하여 SyntTax 웹 서버(https://archaea.i2bc.paris-saclay.fr/SyntTax/)를 통해 아미노산 서열에 대한 상동성 분석을 수행했습니다.
포르투갈 다중숙주 결핵 시스템에서 얻은 유전체 데이터 세트에 대한 보다 심층적인 분석은 문헌에 언급된 유전자의 다형성을 확인하는 것입니다. 이 유전자들은 37, 38번이며, MTBC 조상에서 HGT(DNA 복구, 복제 및 재조합) 시스템 구성 요소를 통해 얻은 3R을 암호화하는 유전자는 39번입니다. ClustalX v2.1(http://www.clustal.org/clustal2/)과 DnaSP v6.12.03(http://www.ub.edu/dnasp/)을 사용하여 유전자 다양성과 뉴클레오타이드 다양성(π)을 계산하고, 타지마(Tajima)의 D 중성 검정 매개변수 입력을 사용합니다.
69개의 마이코플라스마 보비스(Mycoplasma bovis) 분리주와 참조 유전체를 기반으로 최대 가능도(ML) 계통수를 얻었다(그림 2A). 단일 유전자 기반 계통수 또는 다중 유전자좌 기반 계통수와 비교할 때, 이 전략은 전체 유전체의 가변성을 포착하지 못하여 종 간 구별 능력이 낮은 더욱 강력한 계통수를 생성할 수 있다(68,69). ML 계통수의 위상 구조는 일반적으로 클론의 복잡한 분류와 일치한다. Eu2의 유전체는 가지에 클러스터링되고 Af1의 유전체도 함께 클러스터링된다(그림 2A). 이 결과는 마이코박테리움 보비스(Mycobacterium bovis)의 알려진 진화적 관계와도 일치한다. 즉, Eu1 구성원과 다른 모든 클론 복합체 및 유전체로 구성된 그룹 간에는 큰 차이가 있지만, 클론 복합체는 특정되지 않았다(30). 클론 복합체와 계통수에서 관찰되는 관계 사이의 작은 불일치는 클론 복합체가 특정 유전체 영역을 기반으로 설명되는 반면, 계통수는 전체 유전체를 나타내는 핵심 유전체의 다중 정렬을 기반으로 한다는 사실로 설명할 수 있습니다.
최대 가능도 계통수(GTR)는 재조합 부위 제거 전(A)과 후(B)의 마이코박테리움 보비스(Mycobacterium bovis) 유전체의 핵심 유전체 정렬을 기반으로 구축되었습니다. 가지 색상은 마이코박테리움 보비스 클론 복합체를 나타냅니다. 유럽 1은 보라색, 유럽 2는 빨간색, 유럽 3은 파란색, 아프리카 1은 주황색, 아프리카 2는 녹색입니다. 계통수는 뿌리를 내리고 축척에 맞게 그려졌으며, 가지 길이는 각 부위의 대체 길이로 측정되었습니다.
결핵균 복합체는 클론적으로 진화된 것으로 설명되며, 수년에 걸쳐 축적된 대부분의 증거는 지속적인 HGT 및 재조합 사건이 MTBC의 검출 가능한 수준에서 발생하지 않을 것이라는 생각을 뒷받침합니다.15,17,18
이전 연구에서는 MTBC 균주 간에 재조합이 제한적일 수 있음을 보여주었고,20,21 다른 연구에서는 측정 가능한 재조합 사건을 식별하지 못했습니다70,71. 결핵균만 고려했던 이전 연구와 달리 Mycobacterium bovis에 초점을 맞춰 이 문제를 다시 논의하거나, M. bovis가 20을 나타내는 경우가 거의 없는 MTBC 전체를 고려하거나, 제한적인 소 분획만 고려합니다. 이 연구에서는 결핵균 데이터 세트에 재조합을 스크리닝하는 데 사용되는 모든 클론 복합체를 나타내는 총 70개의 균주가 있습니다. 데이터 세트는 4가지 누적 수준에 따라 크기가 조정됩니다. (1) Eu2 구성원, (2) 모든 유럽 클론 복합체 구성원(즉, 유럽), (3) 유럽 및 아프리카 클론 복합체(Eu + Af) 및 (4) 전체 데이터 컬렉션(이미 설명된 클로닝 복합체에 포함되지 않은 게놈 포함).
이 가설을 더욱 심층적으로 연구하기 위해, 유전체 간 재조합 사건의 부재를 평가하기 위해 분할 분해 네트워크를 수행했습니다. 이 방법은 개체 간의 조상 관계를 시각화하고 상충되는 계통학적 신호를 나타낼 수 있기 때문입니다. 분석에 사용된 네 가지 데이터 세트 모두 네트워크 내 루프(즉, 단일 트리로 수렴하지 않는 영역)의 존재를 확인했지만, 파이 검정은 통계적 근거가 부족했습니다(Eu2, p = 0.0956; 유럽, p = 0.1637; Eu + Af p = 0.2774; 전체 데이터 세트 p = 0.2451). 이는 재조합 사건의 존재에 대한 증거가 부족함을 보여줍니다(그림 3A-D).
유럽 2개 게놈(n = 37)(A), 유럽 게놈(n = 44)(B), 유럽 및 아프리카 게놈(n = 51)(C) 및 전체 데이터 세트(n = 70)(D).
이 분석 후 모든 네트워크의 순환 관찰을 고려하여 Gubbins 파이프라인에 구현된 재구성 알고리즘을 적용하여 클론 계통을 재구성하고 M. bovis 유전체에 대한 재조합 효과 추정을 보완했습니다. 대부분이 말단 가지(즉, 단일 유전체)에서 발생한 재조합 사건의 누적 수를 추론합니다(표 2). 이러한 지표는 전체 데이터 세트의 일관성을 보여주며 재조합 사건의 빈도가 돌연변이의 200~300배임을 나타냅니다. 가지에서 재조합 및 점 돌연변이의 상대적 비율을 나타내는 rho/theta 매개변수가 0.0037~0.0056 사이인 것으로 나타났습니다(표 3). 최근, 38개의 M. bovis 균주에 대한 발표된 연구에서는 이 데이터 세트에서 얻은 것보다 더 높은 rho/theta 값(rho/theta = 0.1)이 입증되었지만, Patané와 동료들의 연구에서는 참조 기반 조립을 사용하여 재조합 매개변수를 추론했습니다. 조립 절차로 인한 절차적 세부 사항은 말단 가지에서 가정되는 재조합 이벤트의 풍부함과 관련이 있습니다.
다음으로, r/m 매개변수는 재조합과 돌연변이 도입의 다양성 비율을 나타내며, 평균값은 0.025와 0.037 사이로, 돌연변이와 비교하여 재조합이 M. bovis의 유전적 다양성에 미치는 전반적인 영향이 낮음을 나타냅니다(표 3)). 광범위한 비교를 위해 유사한 방법을 사용하여 23개 유전체로 구성된 MTBC 데이터 세트에 대한 r/m 매개변수를 추정하여 평균값 0.48620을 보인 반면, Patané와 동료의 38개 M. bovis 데이터 세트의 경우 평균값이 0.98임을 증명했습니다. 첫 번째 연구에서는 M. bovis의 작업에 포함된 23개 유전체 중 2개(M. bovis BCG 및 기준 균주)만 사용했으므로 얻은 값은 M. tuberculosis 유전체의 과발현으로 인해 편향되었을 수 있습니다. 두 번째 보고서에서 분석된 Mycobacterium bovis 집단은 주로 미국과 가축 숙주에서 회수되었습니다. 대조적으로, 우리의 데이터 세트에서는 더 많은 지리적 위치와 숙주 종이 표현되고, 서로 다른 집단 유전적 특성을 가진 서로 다른 클론 복합체로 그룹화된 유전체도 사용되어 더 깊고 광범위한 집단 지식을 얻습니다.우리의 데이터 세트로 얻은 차이 r/m 평균값은 재조합 정도가 동일한 분류 종에 할당된 계통 간에 크게 다르다는 개념과 일치하므로 이러한 결과는 M. bovis 클론 복합체가 재조합 차이를 보일 수 있음을 나타냅니다.영향은 Didelot & Maiden72에서 제안한 것과 같습니다.그럼에도 불구하고, 더 많은 수의 M. bovis 유전체를 포함하여 이 데이터 세트를 크게 확장하면 이 점을 더욱 명확히 할 수 있습니다.r/m 및 rho/theta 매개변수는 모두 가지 간에 변동성을 보이며, 이 결과는 다른 박테리아 종에 대한 보고와 일치합니다72,73.
마지막으로, Gubbins 파이프라인에서 식별된 재구성 이벤트를 확인하기 위해 RDP4 소프트웨어에서 6가지 서로 다른 알고리즘을 사용하여 서로 다른 핵심 다중 비교를 독립적으로 테스트했습니다.전 세계적으로 Gubbins에서 식별된 이벤트의 절반 미만이 RDP4에서 확인되었습니다(표 4 및 5).전체 데이터 세트를 고려할 때 3가지 재조합 이벤트가 확인되었으며, 2가지는 내부 노드와 관련이 있고 다른 하나는 클론 복합체를 지정할 수 없는 말단 가지의 단일 게놈과 관련이 있습니다(표 4 및 5).말단 가지에서 이벤트가 식별된 것은 현대 M. bovis 균주에서 재조합이 아직 진행 중이거나 결과가 잘못 배치되었음을 나타낼 수 있습니다70.이 가상 재조합 영역에서 위치의 약 20%가 정의되지 않은 뉴클레오티드(N)를 가지고 있어 재조합 신호에 영향을 미칩니다(보충 그림 2). 또한, 이 영역은 고도로 보존될 것으로 예상되는 16S 리보솜 RNA를 암호화하는 rrs 유전자에 영향을 미치므로, 이 추정 재조합 신호는 시퀀싱 오류 또는 정렬 오류의 결과일 수 있습니다. 이후 Mb0003과 Mycobacterium bovis AF2122/97 간의 전체 유전체 정렬을 수행하여, 정의되지 않은 뉴클레오타이드와 SNP의 존재를 확인했습니다. 따라서 정렬 오류와 관련된 잠재적인 문제는 본 연구에 구현된 생물학적 정보 때문이 아니었습니다. 프로그램 학습 후 이러한 문제가 나타났습니다.
내부 노드의 재조합 영역에서는 갭이나 정의되지 않은 뉴클레오타이드가 발견되지 않았습니다(그림 4 및 5). 이러한 이벤트와 관련하여 하나는 Eu2 게놈만 포함하고 가능한 폴리케티드 합성효소를 인코딩하는 pks12 유전자에 영향을 미치는 반면, 다른 하나는 Eu1 게놈에 등록되어 가능한 질산 환원효소를 인코딩하는 narX 유전자에 영향을 미칩니다(표 4). 일반적으로 재조합 분석은 통계적으로 뒷받침되는 제한된 수의 재조합 단편이 있음을 보여주고 추론된 지표는 재조합이 M. bovis 계통에 미치는 영향이 낮음을 나타냅니다. 재조합 신호는 낮을 것으로 예상되지만 배경 잡음에서 진정한 진화 신호를 구별하는 것이 중요하며 이는 어려운 작업입니다. 참조 기반 어셈블리 및 불일치 문제70, 71로 인해 발생하는 노이즈 신호를 줄이기 위해 전체 유전체를 제외한 나머지 모든 유전체를 처음부터 조립했으며, QUAST 파이프라인 분석을 통해 어셈블리 품질을 확인하고 보장했습니다(보충 표 1). 또한, 전체 조사의 견고성과 정확성을 제공하기 위해 일련의 보충 분석을 수행했습니다. 따라서 narX 및 pks12 유전자의 시퀀싱 품질은 Mycobacterium bovis AF2122/97에 대한 리드 매핑을 통해 평가했습니다. 재조합 영역에서 권장되는 SNP 위치는 방법 섹션에 언급된 기준(최소 20회 판독 및 0.9회 변경 빈도)을 적용하여 확인했습니다. narX 유전자의 다형성은 두 유전체(Mb1792361과 Mb7240415; 2.3%)와 pks12 유전체(Mb0891, Mb1711, Mb1789, Mb1870, Mb17046, Mb1756, Mb12)에서 완전히 확인되었습니다. 그러나 Mb2043 유전체의 경우, 8개 위치 중 6개가 리드 깊이 기준을 충족하지 못하는데, 이는 SNP가 최대 17개의 리드로 뒷받침되기 때문이며, 이는 확립된 임계값인 20개 미만입니다. 따라서 이 유전체 위치에서 6개 유전체(8.6%)의 재조합이 확인될 수 있습니다(그림 4 및 5).
Mycobacterium bovis 데이터세트의 재조합 영역 정렬에 대한 상세 시각화는 잠재적인 질산 환원효소를 암호화하는 narX 유전자에 영향을 미칩니다. 내부 노드의 재조합 영역에서는 갭이나 정의되지 않은 뉴클레오타이드가 발견되지 않았습니다. 이 특정 이벤트는 Eu1 유전체에 기록되어 있습니다. narX 유전자의 시퀀싱 품질은 Mycobacterium bovis AF2122/97의 리드를 플로팅하여 평가했습니다. 방법 섹션에 언급된 기준(최소 20회 리드 및 0.9 변화 빈도)을 적용하여 재조합 영역에서 권장되는 SNP 위치를 확인합니다. narX 유전자의 다형성은 Mb1792361과 Mb7240415(2.3%)의 유전체에서 완전히 확인되었습니다.
pks12 유전자에 영향을 미치는 Mycoplasma bovis 데이터세트의 재조합 영역 정렬을 자세히 시각화했습니다. 내부 노드의 재조합 영역에서는 갭이나 정의되지 않은 뉴클레오타이드가 발견되지 않았습니다. 폴리케타이드 합성효소를 암호화하는 pks12 유전자에 영향을 미치는 사건과 관련하여, 해당 사건은 Eu2 유전체만을 포함합니다. pks12의 시퀀싱 품질은 Mycobacterium bovis AF2122/97의 리드 매핑을 통해 평가했습니다. 방법 섹션에 언급된 기준(최소 20회 판독 및 0.9 변화 빈도)을 적용하여 재조합 영역에서 권장되는 SNP 위치를 확인합니다. Mb0891, Mb1711, Mb1789, Mb1870, Mb1758, Mb2043, Mb1960 유전체의 다형성은 완전히 확인되었습니다.
PE 및 PPE 유전자는 Illumina 시퀀싱 및 오매핑으로 인해 쉽게 오독되는 반복 영역을 가지므로, 일반적으로 매핑-투-시퀀스 전략을 사용할 때만 결핵균 구성원의 생물정보학 워크플로에서 삭제됩니다. 본 연구에서 적용된 재조합 사건 추론은 PE/PPE를 필터링하지 않고 de novo 어셈블리를 기반으로 합니다. SplitsTree, Gubbins 파이프라인, RDP4 소프트웨어를 통해 세 가지 서로 다른 상호 보완적인 방법과 알고리즘을 구현함으로써, 적용된 전략이 오류 신호로 인해 재구성된 영역의 처리 및 필터링에 강력하다고 생각합니다. 그러나 SNP 클러스터를 식별하기 위해 Gubbins 및 RDP4 소프트웨어에서 PE/PPE 유전자의 간섭을 배제하고, 따라서 narX 및 pks12 유전자에 영향을 미치는 것으로 제안된 재조합 영역을 식별하기 위해, 이러한 유전자의 인접성을 조사했습니다(보충 그림 3-5). M. bovis AF2122/97에서 narX 유전자는 narK2와 Mb1764c에 의해 분리되어 있는 반면, pks12는 Mb2075c와 Mb2073c에 의해 둘러싸여 있습니다(보충 그림 3-5). 완전한 유전체의 MAUVE synline 지도를 사용하여 생성된 지도는 유전자 서열 보존 및 재배열에 대한 정보를 제공하며, 4개의 동일선상 블록을 보여주고 유전체 전좌 또는 역위의 징후는 없습니다. 또한, 아미노산 서열을 이용한 상보성 분석은 모든 완전한 유전체에서 상동성을 입증했으며, narX 또는 pks12의 인접한 영역에서 PE/PPE는 발견되지 않았습니다. narX의 경우, narX 유전자가 두 개의 단편(단편 1891과 1890)으로 확인되었기 때문에 한 유전체(Mb0030)의 동의어 점수가 더 낮습니다. pks12의 경우, 유사성으로 인해 Mb0030과 Mb003은 낮은 공선성 점수를 보인 반면, pks12는 단백질의 서로 다른 도메인을 나타내는 각각 두 개와 세 개의 단편으로 확인되었습니다(보충 그림 3-5). 이러한 정보를 고려하여 Gubbins와 RDP4 소프트웨어 모두 분석을 수행하고, 윈도우에서 최대 500bp의 핵심 다중 정렬을 확인한 결과, PE/PPE 유전자가 narX와 pks12에 영향을 미치는 재조합 신호를 방해하지 않음을 확인했습니다.
이 데이터 세트에서 검출된 재조합 신호는 잔여적인 것으로 간주될 수 있지만, M. bovis에서 재조합이 일어날 가능성을 배제할 수 없으므로, 다양한 역학 시나리오에서 전체 유전체를 시퀀싱하여 중요한 것으로 판단되는 추가 분석이 계속되어야 합니다.
재조합 보정 전후에 얻은 ML 계통수를 비교한 결과(그림 2A, B) 추론된 계통학적 관계에는 큰 변화가 없었고, M. bovis 균주는 동일한 그룹에 클러스터링되었습니다.
새롭게 시퀀싱된 42개의 M. bovis 리드를 M. bovis AF2122/97의 참조 유전체와 매핑한 후, 1,816개의 다형성 위치를 포함하는 SNP 정렬을 얻었습니다. 대부분의 SNP(87.1%)는 코딩 영역에 위치하며, 영향을 받은 유전자는 Bovilist(그림 6A, B)에 표시된 기능적 범주에 따라 특성화되었습니다. 각 기능적 범주에 포함된 유전자의 총 수를 고려할 때, "지질 대사" 범주의 유전자가 더 많은 SNP를 보였고, 그 다음으로 "세포벽 및 세포 과정"과 "중간 대사 및 호흡"이 뒤따랐습니다. 이는 이들이 M. bovis 진화 과정에 속함을 보여줍니다.
포르투갈의 M. bovis 데이터 세트(n = 42)에 대한 계층적 분석. 각 기능 범주별로 등록된 SNP와 영향을 받은 유전자의 총 개수(A). 기능 범주별로 등록된 동의적 및 비동의적 변화의 총 개수(B).
전 세계적으로 평균 dN/dS 비율은 1.5보다 높은데, 이는 전 세계적인 진화적 압력이 조상 상태를 제거하려는 것임을 시사하며, 긍정적(다양화 또는 지향성)이고/이거나 완화된 정화 선택 시나리오를 나타냅니다. "독성, 해독, 적응", "삽입 서열 및 파지", 그리고 "조절 단백질" 범주에서 SNP의 3분의 2 이상이 비동의적입니다(그림 6B).
모든 범주에서 여러 개의 SNP를 가진 유전자가 있으며, 이로 인해 평균 돌연변이율(즉, 유전자당 평균 SNP)이 1보다 큽니다(그림 6A). 15개의 SNP를 가진 Pks12(Mb2074c)와 8개의 SNP를 가진 fas(Mb2553c)는 더 높은 돌연변이 값을 가집니다. 이 두 유전자는 모두 지방산 대사에 관여합니다. pks 유전자는 결핵균 세포벽 지질 생합성에 관여하는 다기능 효소인 폴리케티드 합성효소(PKS)를 암호화합니다74,75. 이 유전자는 미코케티드 합성에 관여하는 다기능 폴리펩티드를 암호화합니다74,76. fas 유전자는 미콜산 합성에 관여합니다. 이 두 유전자는 모두 숙주와 접촉하는 세포벽의 생합성에 중요한 역할을 합니다.
Mycobacterium bovis의 진화를 더 자세히 연구하기 위해 두 세트의 특정 유전자를 분석했습니다. 서열 구성 및 계통 발생학적 방법을 사용한 이전에 발표된 연구에서는 다양화 이전에 HGT를 통해 MTBC 조상이 획득한 유전자를 확인했습니다37,38. 이러한 유전자는 보충 표 2에 나열되어 있습니다. HGT와 관련이 있을 수 있는 총 77개 유전자의 SNP 분포를 분석했고, 26개의 다형성 부위가 확인되었으며, 대부분(78%)에서 비동의적(NS) 변화를 초래했습니다(보충 표 2). MTBC 게놈에 대한 이전 연구에서는 추정 HGT 영역이 게놈의 나머지 부분에 비해 NS SNP 비율이 더 높음을 보여주었습니다. 이러한 재조합 영역이 MTBC 조상에 의해 획득되었고 따라서 고대 다형성을 과대 표현한다고 생각한다면, 아미노산 변화로 인해 음성 선택에 의해 NS 치환이 제거될 것으로 예상되므로 동의적 변화의 비율이 더 높을 것으로 예상됩니다. 단백질의 기능을 변경할 수 있습니다. 따라서 우리의 연구 결과는 기능적 결과가 HGT 유사 유전자의 교체에서 비롯될 수 있음을 보여주는데, 이는 귀중한 적응적 유전적 다양성에 대한 중요성을 반영합니다.
이 분석과 병행하여, 3R(DNA 복구, 복제 및 재조합) 시스템의 구성 요소를 인코딩하는 유전자는 dos Vultos와 공동 연구자(2008)가 이전에 발표한 목록에 따라 철저히 조사되었습니다.39 동일한 DNA 단편의 교환은 직접 관찰할 수 없지만, 이 데이터 세트의 경우처럼 밀접하게 관련된 박테리아가 관련된 경우 빈번한 과정일 수 있습니다.또한 이 과정은 DNA 복구 방법의 핵심일 수 있으므로72 상동 재조합에서 역할을 합니다.54개 유전자에 의해 분포된 총 26개의 다형성 위치가 확인되었습니다(보충 표 3).이 유전자 세트에서 NS 변화는 결과의 약 65%를 차지했으며, 이는 결핵균 균주에 대한 이전 보고와 일치합니다.
게시 시간: 2021년 10월 21일





