Untitled
Apixmed Prism – инновационная платформа генетической аналитики нового поколения
Главная keyboard_arrow_right Блог keyboard_arrow_right
Форматы генетических данных: что такое FASTQ, VCF, PLINK и другие
Технология
Дата публікації:
6 минут чтения

Форматы генетических данных: что такое FASTQ, VCF, PLINK и другие

Прозрачная 3D-спираль ДНК, внутри которой записаны числовые и буквенные последовательности с подсвеченными маркерами, — главное изображение к статье о форматах генетических данных.

Когда ваш образец слюны попадает в лабораторию, он проходит несколько этапов обработки, прежде чем превратиться в отчет с результатами. На каждом этапе данные сохраняются в своем формате: сначала как сырые последовательности, затем как карта выравнивания, затем как таблица выявленных вариантов и, наконец, как структурированный набор для статистического анализа. Например, один показатель в вашем отчете о склонности к повышенному холестерину опирается на данные, которые на разных этапах существовали в форматах FASTQ, BAM, VCF и PLINK, прежде чем превратиться в единый балл. Самая распространенная ошибка — считать, что «генетические данные» — это один файл. На самом деле это конвейер форматов, каждый из которых соответствует своему этапу анализа.

Чтобы понять, что происходит между образцом слюны и вашим отчетом, достаточно разобраться в четырех ключевых форматах: FASTQ, BAM, VCF и PLINK. Именно они образуют стандартную аналитическую цепочку в современной геномике. Рассмотрим каждый по порядку.

FASTQ: сырые данные прямо с секвенатора

FASTQ (произносится «фаст-кью») — формат, в котором сохраняются сырые результаты секвенирования. Название происходит от сокращения FASTA (формат хранения последовательностей ДНК) с добавлением буквы Q от англ. Quality, «качество». Представьте, что секвенатор читает вашу ДНК как текст, но не одинаково уверен в каждой букве: FASTQ хранит и саму последовательность, и оценку уверенности для каждого нуклеотида отдельно.

Каждая запись в FASTQ-файле состоит из четырех строк: идентификатора фрагмента, самой нуклеотидной последовательности, разделителя и строки показателей качества. Например:

@read_001   

ACGTTAGCATGC...

+

IIIIHHGFEDCB...

Строка качества кодирует уверенность секвенатора в каждой «букве»: чем выше символ по шкале ASCII (от англ. American Standard Code for Information Interchange, «американский стандартный код для обмена информацией»), тем надежнее прочитан этот нуклеотид. FASTQ-файлы имеют большой объем, обычно несколько гигабайт на один образец, и служат исходной точкой для всего дальнейшего анализа. Сами по себе они не подходят для интерпретации: это еще не «генетические данные» в смысле конкретных вариантов, а лишь исходный материал.

Сияющая оранжевая сфера в центре, к которой со всех сторон через прозрачные кристаллы сходятся световые волокна данных, — иллюстрация обработки популяционных данных и расчета PRS.

BAM: последовательности, выровненные по геному

Следующий шаг после FASTQ — выравнивание. Программа сравнивает каждый короткий фрагмент с референсным геномом человека и определяет, к какому участку он относится. Результат сохраняется в формате SAM (от англ. Sequence Alignment Map, «карта выравнивания последовательностей») или в его сжатой бинарной версии — BAM (от англ. Binary Alignment Map, «бинарная карта выравнивания»). На практике обычно используют BAM: при тех же данных он занимает значительно меньше места.

BAM-файл можно представить как огромную таблицу: каждая строка описывает один прочитанный фрагмент ДНК, его позицию в геноме, ориентацию, качество выравнивания и дополнительную техническую информацию. Вместе все строки формируют покрытие генома — показывают, сколько раз была прочитана каждая позиция. Чем выше покрытие, тем надежнее выявление вариантов на следующем этапе.

BAM-файлы еще больше FASTQ и требуют специального индексного файла — BAI (от англ. BAM Index, «индекс BAM»), чтобы быстро находить нужные участки без чтения всего файла целиком. Для большинства людей, получающих генетический отчет, BAM остается «за кулисами»: лаборатория обрабатывает его автоматически и не передает конечному пользователю.

VCF: таблица выявленных вариантов

После выравнивания алгоритм сравнивает покрытые позиции с референсным геномом и фиксирует места, где ваша ДНК отличается. Эти отличия записываются в формате VCF (от англ. Variant Call Format, «формат записи вариантов»). Именно VCF — первый формат, в котором появляются конкретные генетические варианты: SNP (однонуклеотидные полиморфизмы), небольшие вставки и делеции.

Каждая строка VCF-файла описывает один вариант: хромосому и позицию, референсный нуклеотид, альтернативный нуклеотид в вашем геноме, качество определения варианта и генотип. Например, строка может показывать, что в хромосоме 11 в позиции 5246696 у вас находится G вместо референсного A — то есть вы являетесь носителем определенного варианта в гене HBB. Именно из VCF-файлов берутся rs-номера, которые вы видите в таблице маркеров своего отчета.

VCF — стандартный формат обмена между лабораториями, исследователями и программами анализа. Если вы хотите загрузить собственные генетические данные в открытую базу, например ClinVar или dbSNP, именно VCF является самым распространенным входным форматом для таких операций.

Световой поток цифрового кода и данных, проходящий через рельефный геометрический каньон из светлых блоков, — иллюстрация конвейера конвертации форматов генетических данных.

PLINK: формат для популяционного и полигенного анализа

VCF удобен для хранения вариантов одного человека, но неудобен для одновременного анализа тысяч людей. Для популяционной генетики и расчета полигенных профилей риска (PRS, от англ. Polygenic Risk Score, «полигенный показатель риска») используется формат PLINK, разработанный одноименной программой для статистического анализа данных GWAS (от англ. Genome-Wide Association Study, «полногеномное ассоциативное исследование»).

PLINK хранит данные в трех связанных файлах. Файл .bed содержит генотипы в сжатом бинарном формате. Файл .bim описывает каждый SNP: хромосому, позицию, rs-номер и оба аллеля. Файл .fam содержит информацию о людях: их идентификаторы, пол и, если есть, фенотипические данные. Вместе эти три файла образуют единый набор, с которым работают алгоритмы расчета PRS.

Представьте PLINK как большую электронную таблицу: строки — это люди, столбцы — позиции SNP, а значения в ячейках — генотипы. Именно в таком виде крупные популяционные когорты, например UK Biobank с почти 500 тысячами участников, передают данные для GWAS-исследований, результаты которых затем ложатся в основу полигенных профилей в вашем отчете.

Другие форматы: FASTA, BED и GFF

Помимо четырех основных форматов конвейера, в геномике регулярно встречаются еще несколько:

  • FASTA (от англ. Fast Alignment, хотя название сложилось исторически) — базовый формат для хранения самих последовательностей ДНК или белков без информации о качестве. Именно в FASTA хранится референсный геном человека GRCh38 (от англ. Genome Reference Consortium Human Build 38, «сборка 38 референсного генома человека»), с которым выравниваются ваши данные.

  • BED (от англ. Browser Extensible Data, «расширяемые данные для браузера») — формат для описания геномных координат: где именно на хромосоме начинается и заканчивается определенный участок. Используется для определения интересующих регионов, например экзомов при WES (от англ. Whole Exome Sequencing, «секвенирование всего экзома»).

  • GFF / GTF (от англ. General Feature Format / Gene Transfer Format, «общий формат признаков / формат передачи генов») — форматы для аннотации генома: где находятся гены, экзоны и регуляторные элементы. Когда в вашем отчете указано, что SNP находится в гене BRCA1 или рядом с ним, эта информация получена именно из GFF-аннотации.

Как эти форматы связаны с вашим отчетом Apixmed Prism

Ни один из описанных форматов не попадает к вам напрямую, и это правильно. Аналитический конвейер от образца слюны до отчета выглядит так:

Конкретный набор форматов зависит от метода анализа. При полногеномном секвенировании (WGS, от англ. Whole Genome Sequencing) конвейер проходит через все четыре формата: FASTQ → BAM → VCF → PLINK. При генотипировании на микрочипе FASTQ и BAM отсутствуют: микрочип сразу выдает таблицу интенсивностей, которая напрямую конвертируется в VCF, после чего анализ идет по тому же пути. Именно поэтому генотипирование быстрее и дешевле, но не выявляет варианты за пределами чипа.

  • Секвенирование или генотипирование — на выходе FASTQ и VCF или только VCF соответственно

  • Выравнивание по референсному геному — результат в формате BAM

  • Выявление вариантов — таблица SNP в формате VCF

  • Расчет полигенных профилей — конвертация в PLINK и применение весовых коэффициентов из GWAS-исследований

  • Интерпретация и отчет — числовой балл и позиция на шкале, которые вы видите на странице каждого показателя

 Rs-номера, которые вы видите в таблице маркеров своего отчета, — это идентификаторы конкретных строк из VCF-файла вашего анализа. Если вы загружаете собственные сырые данные, чтобы изучить их самостоятельно или передать другому сервису, наиболее удобный формат для этого — VCF, поскольку он стандартизирован и совместим с большинством аналитических платформ.

О том, что означают числовые результаты в вашем отчете, как читать шкалу и где проходит граница между склонностью и диагнозом, читайте в статье Как читать отчет Apixmed Prism: что означают результаты.

Формат определяет, что можно сделать с данными

FASTQ фиксирует исходный материал: последовательности и их качество. BAM показывает, где эти последовательности находятся в геноме. VCF описывает конкретные отличия от референса. PLINK позволяет анализировать эти отличия одновременно в больших группах людей и рассчитывать полигенные профили. Каждый формат — это один шаг от образца слюны до результата в вашем отчете.

Понимание этого конвейера меняет восприятие отчета: результат — не «мнение» алгоритма, а конечная точка стандартизированного аналитического процесса, в котором каждый шаг задокументирован и воспроизводим. Rs-номера в таблице маркеров, референсный геном, весовой коэффициент SNP — все это конкретные артефакты из конкретных файлов.

Если вы еще не делали тест или хотите расширить свою генетическую картину, ознакомьтесь с направлениями генетического тестирования Apixmed Prism. 

Результаты генетического теста — это не диагноз и не замена консультации врача. Отчет Apixmed Prism дает генетический контекст, который дополняет результаты обследований и помогает принимать решения вместе с врачом.

Использованные источники

1. Cock, P. J. A., Fields, C. J., Goto, N., et al. (2010). The Sanger FASTQ file format for sequences with quality scores, and the Solexa/Illumina FASTQ variants. Nucleic Acids Research, 38(6), 1767–1771. https://doi.org/10.1093/nar/gkp1137

2. Danecek, P., Auton, A., Abecasis, G., et al. (2011). The variant call format and VCFtools. Bioinformatics, 27(15), 2156–2158. https://doi.org/10.1093/bioinformatics/btr330

3. Purcell, S., Neale, B., Todd-Brown, K., et al. (2007). PLINK: A tool set for whole-genome association and population-based linkage analyses. American Journal of Human Genetics, 81(3), 559–575. https://doi.org/10.1086/519795

4. Li, H., Handsaker, B., Wysoker, A., et al. (2009). The Sequence Alignment/Map format and SAMtools. Bioinformatics, 25(16), 2078–2079. https://doi.org/10.1093/bioinformatics/btp352

Читайте наступні статті

Остались вопросы?

Оставьте свои контактные данные — наши специалисты свяжутся с вами в ближайшее время. Мы поможем разобраться в предложениях, подобрать тест в соответствии с вашим запросом и ответим на любые вопросы о продукте и процессе.