Форматы генетических данных: что такое FASTQ, VCF, PLINK и другие

Когда ваш образец слюны попадает в лабораторию, он проходит несколько этапов обработки, прежде чем превратиться в отчет с результатами. На каждом этапе данные сохраняются в своем формате: сначала как сырые последовательности, затем как карта выравнивания, затем как таблица выявленных вариантов и, наконец, как структурированный набор для статистического анализа. Например, один показатель в вашем отчете о склонности к повышенному холестерину опирается на данные, которые на разных этапах существовали в форматах FASTQ, BAM, VCF и PLINK, прежде чем превратиться в единый балл. Самая распространенная ошибка — считать, что «генетические данные» — это один файл. На самом деле это конвейер форматов, каждый из которых соответствует своему этапу анализа.
Чтобы понять, что происходит между образцом слюны и вашим отчетом, достаточно разобраться в четырех ключевых форматах: FASTQ, BAM, VCF и PLINK. Именно они образуют стандартную аналитическую цепочку в современной геномике. Рассмотрим каждый по порядку.
FASTQ: сырые данные прямо с секвенатора
FASTQ (произносится «фаст-кью») — формат, в котором сохраняются сырые результаты секвенирования. Название происходит от сокращения FASTA (формат хранения последовательностей ДНК) с добавлением буквы Q от англ. Quality, «качество». Представьте, что секвенатор читает вашу ДНК как текст, но не одинаково уверен в каждой букве: FASTQ хранит и саму последовательность, и оценку уверенности для каждого нуклеотида отдельно.
Каждая запись в FASTQ-файле состоит из четырех строк: идентификатора фрагмента, самой нуклеотидной последовательности, разделителя и строки показателей качества. Например:
@read_001
ACGTTAGCATGC...
+
IIIIHHGFEDCB...
Строка качества кодирует уверенность секвенатора в каждой «букве»: чем выше символ по шкале ASCII (от англ. American Standard Code for Information Interchange, «американский стандартный код для обмена информацией»), тем надежнее прочитан этот нуклеотид. FASTQ-файлы имеют большой объем, обычно несколько гигабайт на один образец, и служат исходной точкой для всего дальнейшего анализа. Сами по себе они не подходят для интерпретации: это еще не «генетические данные» в смысле конкретных вариантов, а лишь исходный материал.

BAM: последовательности, выровненные по геному
Следующий шаг после FASTQ — выравнивание. Программа сравнивает каждый короткий фрагмент с референсным геномом человека и определяет, к какому участку он относится. Результат сохраняется в формате SAM (от англ. Sequence Alignment Map, «карта выравнивания последовательностей») или в его сжатой бинарной версии — BAM (от англ. Binary Alignment Map, «бинарная карта выравнивания»). На практике обычно используют BAM: при тех же данных он занимает значительно меньше места.
BAM-файл можно представить как огромную таблицу: каждая строка описывает один прочитанный фрагмент ДНК, его позицию в геноме, ориентацию, качество выравнивания и дополнительную техническую информацию. Вместе все строки формируют покрытие генома — показывают, сколько раз была прочитана каждая позиция. Чем выше покрытие, тем надежнее выявление вариантов на следующем этапе.
BAM-файлы еще больше FASTQ и требуют специального индексного файла — BAI (от англ. BAM Index, «индекс BAM»), чтобы быстро находить нужные участки без чтения всего файла целиком. Для большинства людей, получающих генетический отчет, BAM остается «за кулисами»: лаборатория обрабатывает его автоматически и не передает конечному пользователю.
VCF: таблица выявленных вариантов
После выравнивания алгоритм сравнивает покрытые позиции с референсным геномом и фиксирует места, где ваша ДНК отличается. Эти отличия записываются в формате VCF (от англ. Variant Call Format, «формат записи вариантов»). Именно VCF — первый формат, в котором появляются конкретные генетические варианты: SNP (однонуклеотидные полиморфизмы), небольшие вставки и делеции.
Каждая строка VCF-файла описывает один вариант: хромосому и позицию, референсный нуклеотид, альтернативный нуклеотид в вашем геноме, качество определения варианта и генотип. Например, строка может показывать, что в хромосоме 11 в позиции 5246696 у вас находится G вместо референсного A — то есть вы являетесь носителем определенного варианта в гене HBB. Именно из VCF-файлов берутся rs-номера, которые вы видите в таблице маркеров своего отчета.
VCF — стандартный формат обмена между лабораториями, исследователями и программами анализа. Если вы хотите загрузить собственные генетические данные в открытую базу, например ClinVar или dbSNP, именно VCF является самым распространенным входным форматом для таких операций.

PLINK: формат для популяционного и полигенного анализа
VCF удобен для хранения вариантов одного человека, но неудобен для одновременного анализа тысяч людей. Для популяционной генетики и расчета полигенных профилей риска (PRS, от англ. Polygenic Risk Score, «полигенный показатель риска») используется формат PLINK, разработанный одноименной программой для статистического анализа данных GWAS (от англ. Genome-Wide Association Study, «полногеномное ассоциативное исследование»).
PLINK хранит данные в трех связанных файлах. Файл .bed содержит генотипы в сжатом бинарном формате. Файл .bim описывает каждый SNP: хромосому, позицию, rs-номер и оба аллеля. Файл .fam содержит информацию о людях: их идентификаторы, пол и, если есть, фенотипические данные. Вместе эти три файла образуют единый набор, с которым работают алгоритмы расчета PRS.
Представьте PLINK как большую электронную таблицу: строки — это люди, столбцы — позиции SNP, а значения в ячейках — генотипы. Именно в таком виде крупные популяционные когорты, например UK Biobank с почти 500 тысячами участников, передают данные для GWAS-исследований, результаты которых затем ложатся в основу полигенных профилей в вашем отчете.
Другие форматы: FASTA, BED и GFF
Помимо четырех основных форматов конвейера, в геномике регулярно встречаются еще несколько:
-
FASTA (от англ. Fast Alignment, хотя название сложилось исторически) — базовый формат для хранения самих последовательностей ДНК или белков без информации о качестве. Именно в FASTA хранится референсный геном человека GRCh38 (от англ. Genome Reference Consortium Human Build 38, «сборка 38 референсного генома человека»), с которым выравниваются ваши данные.
-
BED (от англ. Browser Extensible Data, «расширяемые данные для браузера») — формат для описания геномных координат: где именно на хромосоме начинается и заканчивается определенный участок. Используется для определения интересующих регионов, например экзомов при WES (от англ. Whole Exome Sequencing, «секвенирование всего экзома»).
-
GFF / GTF (от англ. General Feature Format / Gene Transfer Format, «общий формат признаков / формат передачи генов») — форматы для аннотации генома: где находятся гены, экзоны и регуляторные элементы. Когда в вашем отчете указано, что SNP находится в гене BRCA1 или рядом с ним, эта информация получена именно из GFF-аннотации.
Как эти форматы связаны с вашим отчетом Apixmed Prism
Ни один из описанных форматов не попадает к вам напрямую, и это правильно. Аналитический конвейер от образца слюны до отчета выглядит так:
Конкретный набор форматов зависит от метода анализа. При полногеномном секвенировании (WGS, от англ. Whole Genome Sequencing) конвейер проходит через все четыре формата: FASTQ → BAM → VCF → PLINK. При генотипировании на микрочипе FASTQ и BAM отсутствуют: микрочип сразу выдает таблицу интенсивностей, которая напрямую конвертируется в VCF, после чего анализ идет по тому же пути. Именно поэтому генотипирование быстрее и дешевле, но не выявляет варианты за пределами чипа.
-
Секвенирование или генотипирование — на выходе FASTQ и VCF или только VCF соответственно
-
Выравнивание по референсному геному — результат в формате BAM
-
Выявление вариантов — таблица SNP в формате VCF
-
Расчет полигенных профилей — конвертация в PLINK и применение весовых коэффициентов из GWAS-исследований
-
Интерпретация и отчет — числовой балл и позиция на шкале, которые вы видите на странице каждого показателя
Rs-номера, которые вы видите в таблице маркеров своего отчета, — это идентификаторы конкретных строк из VCF-файла вашего анализа. Если вы загружаете собственные сырые данные, чтобы изучить их самостоятельно или передать другому сервису, наиболее удобный формат для этого — VCF, поскольку он стандартизирован и совместим с большинством аналитических платформ.
О том, что означают числовые результаты в вашем отчете, как читать шкалу и где проходит граница между склонностью и диагнозом, читайте в статье Как читать отчет Apixmed Prism: что означают результаты.
Формат определяет, что можно сделать с данными
FASTQ фиксирует исходный материал: последовательности и их качество. BAM показывает, где эти последовательности находятся в геноме. VCF описывает конкретные отличия от референса. PLINK позволяет анализировать эти отличия одновременно в больших группах людей и рассчитывать полигенные профили. Каждый формат — это один шаг от образца слюны до результата в вашем отчете.
Понимание этого конвейера меняет восприятие отчета: результат — не «мнение» алгоритма, а конечная точка стандартизированного аналитического процесса, в котором каждый шаг задокументирован и воспроизводим. Rs-номера в таблице маркеров, референсный геном, весовой коэффициент SNP — все это конкретные артефакты из конкретных файлов.
Если вы еще не делали тест или хотите расширить свою генетическую картину, ознакомьтесь с направлениями генетического тестирования Apixmed Prism.
Результаты генетического теста — это не диагноз и не замена консультации врача. Отчет Apixmed Prism дает генетический контекст, который дополняет результаты обследований и помогает принимать решения вместе с врачом.
Использованные источники
1. Cock, P. J. A., Fields, C. J., Goto, N., et al. (2010). The Sanger FASTQ file format for sequences with quality scores, and the Solexa/Illumina FASTQ variants. Nucleic Acids Research, 38(6), 1767–1771. https://doi.org/10.1093/nar/gkp1137
2. Danecek, P., Auton, A., Abecasis, G., et al. (2011). The variant call format and VCFtools. Bioinformatics, 27(15), 2156–2158. https://doi.org/10.1093/bioinformatics/btr330
3. Purcell, S., Neale, B., Todd-Brown, K., et al. (2007). PLINK: A tool set for whole-genome association and population-based linkage analyses. American Journal of Human Genetics, 81(3), 559–575. https://doi.org/10.1086/519795
4. Li, H., Handsaker, B., Wysoker, A., et al. (2009). The Sequence Alignment/Map format and SAMtools. Bioinformatics, 25(16), 2078–2079. https://doi.org/10.1093/bioinformatics/btp352












