Реаналіз генетичних даних: що змінюється, коли оновлюється наукова база

Генетичні дані, отримані під час тестування, не змінюються з часом. Чи означає це, що інтерпретація результатів лишається сталою, а отже застаріває і за кілька років стає непридатною до використання?
З моменту тестування можуть з'явитися нові дослідження, більші вибірки та точніші методи статистичного аналізу. Вони змінюють спосіб, у який інтерпретують уже отримані генетичні дані. Тому результат генетичного аналізу не обов'язково залишається незмінним лише тому, що сама ДНК не змінилася.
Це стосується полігенних показників ризику (polygenic risk score, PRS). Їх розраховують на основі великої кількості генетичних варіантів, використовуючи статистичні ваги, отримані з досліджень асоціацій. Коли наукова база для такої моделі розширюється або змінюється, можуть змінитися й параметри розрахунку. У такому разі вже наявні генетичні дані можна проаналізувати повторно, без нового збору зразка слини та без повторного генотипування.
Це і є основою генетичного реаналізу: оновлюється інтерпретація генетичних даних, а сам генетичний профіль людини лишається незмінним.
Генотип незмінний — модель PRS оновлювана
Генотип людини — набір варіантів у конкретних позиціях геному. Його визначають один раз, під час генотипування зразка, і ці дані з часом не змінюються.
Змінюється спосіб, яким їх перетворюють на підсумкову оцінку: цей розрахунок виконує модель PRS, яку переглядають, коли результати нових досліджень включають до її побудови та подальшої валідації. Результат такого перегляду залежить від того, на якій вибірці модель розроблена, яким методом побудована і як валідована — ці параметри належать до обов'язкових елементів опису будь-якого полігенного показника (Wand et al., Nature, 2021).
Про те, чому генетичні дані не застарівають з часом, — у статті Генетичні дані не застарівають: чому до звіту варто повертатися.
Вага варіанта: результат статистичного аналізу GWAS
Вагу кожного варіанта визначають зі статистичного аналізу асоціації між ним і ознакою в межах великої когорти учасників повногеномного дослідження асоціацій (genome-wide association study, GWAS). Саме ці ваги — один із параметрів, які визначають результат моделі.
Великі вибірки підвищують статистичну потужність GWAS: зі збільшенням обсягу вибірки дослідження може виявляти більше генетичних асоціацій і точніше оцінювати ефекти варіантів (Uffelmann et al., Nat. Rev. Methods Primers, 2021). Джерелом таких вибірок слугують масштабні біобанки — зокрема UK Biobank, ресурс, що об'єднує генетичні дані та детальне фенотипування сотень тисяч учасників (Bycroft et al., Nature, 2018).
Для однієї ознаки може існувати кілька різних моделей PRS, побудованих на різних вибірках і різними обчислювальними методами. Відкриті каталоги, зокрема Polygenic Score Catalog та GWAS Catalogue, збирають опубліковані моделі разом з їхніми варіантами, вагами та метаданими і дають змогу порівнювати їх між собою (Lambert et al., Nature Genetics, 2021).

Три компоненти оновлення моделі PRS
Оновлення моделі PRS охоплює три незалежні типи змін: нові ваги існуючих ефектів, зміну набору ефектів (додавання або виключення певних варіантів), зміну референтної панелі. Ці зміни стосуються різних компонентів розрахунку, тому їхні наслідки відрізняються:
-
уточнення оцінок ефектів варіантів — коли результати нового GWAS використовують для оцінювання ефектів задля більшої статистичної точності
-
зміна складу моделі PRS — коли нові асоційовані варіанти включають до нової версії моделі
-
зміна референтної вибірки — коли результат стандартизують відносно іншої популяції чи когорти.
Уточнення оцінок ефектів і зміна складу моделі стосуються самої моделі: вони змінюють те, як генетичні дані перетворюються на підсумковий показник, якщо нові оцінки або варіанти включають до її оновленої версії. Зміна референтної вибірки стосується того, з чим порівнюють результат: вона змінює перцентиль або стандартизоване значення, обчислені відносно нової вибірки, тоді як сам розрахунок ваг лишається незмінним.
Масштаб, якого може сягати розширення набору асоційованих варіантів, видно на прикладі зросту — ознаки з великим обсягом накопичених даних. GWAS на вибірці 5,4 млн учасників виявило 12 111 незалежних варіантів, асоційованих зі зростом. Разом вони пояснюють майже всю успадковуваність ознаки, зумовлену поширеними варіантами (Yengo et al., Nature, 2022).
Оновлення моделі уточнює попередній результат
Сам факт оновлення моделі не означає, що попередній результат був помилковим. Він був розрахований відповідно до методології та даних, доступних на конкретний момент часу. Після оновлення для тієї самої генетичної інформації може використовуватися інший набір даних або методологічних параметрів.
Водночас PRS у будь-якій версії моделі залишається показником генетичної схильності, не діагнозом. Його стандартизоване значення або перцентиль дає змогу оцінити позицію людини відносно референтної вибірки. Він не встановлює, що конкретний стан обов'язково розвинеться (Slunecka et al., Hum. Genom., 2021). Оновлюється розрахунок і спосіб інтерпретації результату, не генетичні дані, на яких він базується.
Окремо варто відділяти генетичну схильність від поточного фізіологічного стану. Полігенна оцінка описує вихідну схильність, розраховану на основі варіантів ДНК, і доповнює клінічні та лабораторні дані, які відображають стан організму в конкретний момент.

Частота оновлення залежить від ознаки
Темп оновлення відрізняється для різних ознак. Для ознак з активними дослідженнями та зростаючими вибірками підстав для перегляду моделі більше. Сам перегляд, однак, залежить від методології та практики розроблення моделі.
Масштаб зміни також залежить від того, що саме було оновлено: ваги, склад варіантів або параметри нормалізації. Така зміна відображає залежність PRS від даних і методології, на яких побудована модель.
Генетичний тест Apixmed Prism дає змогу дослідити індивідуальні особливості на основі ДНК — детальніше на сторінці каталогу ДНК-тестів.
Оновлення інтерпретації не означає нового тестування
Оновлення інтерпретації не є приводом сумніватися в первинному результаті тесту. Наука про полігенні ознаки працює з імовірностями, які уточнюються в міру накопичення доказів. Генетичні дані, отримані під час тестування, залишаються основою для подальшої інтерпретації. У Apixmed Prism можливий реаналіз показників без повторного збору зразка. Для цього можна використати вже наявний генетичний файл (VCF), зокрема отриманий від іншої компанії.
Детальніше про те, як працювати зі звітом далі — читати показники, розставляти пріоритети, розуміти, коли звертатися до лікаря — у статті Що робити зі звітом далі: від даних до рішень.
Поширені запитання
Що саме може оновлюватися в генетичному звіті?
Оцінки ефектів окремих варіантів, склад моделі, за якою розраховується полігенний показник, і референтна вибірка, відносно якої результат стандартизується. Набір генетичних варіантів людини при цьому залишається тим самим.
Звідки беруться дані, на основі яких розраховується PRS?
З результатів повногеномних досліджень асоціацій, які проводять незалежні наукові консорціуми на великих когортах учасників, а також з відкритих каталогів, що збирають опубліковані моделі та їхні параметри.
Чи можна порівнювати свій показник із показником людини, яка здавала тест в інший час?
Пряме порівняння двох чисел, розрахованих за різними версіями моделі, некоректне. Показник має сенс у контексті моделі та референтної вибірки, за якими його розраховано.
Результати генетичного тесту — це не діагноз і не заміна консультації лікаря. Звіт Apixmed Prism дає генетичний контекст, який доповнює результати обстежень і допомагає приймати рішення разом із лікарем.
Джерела
-
Wand, H., Lambert, S. A., Tamburro, C. та ін. (2021). Improving reporting standards for polygenic scores in risk prediction studies. Nature, 591(7849), 211–219. https://doi.org/10.1038/s41586-021-03243-6
-
Uffelmann, E., Huang, Q. Q., Munung, N. S., de Vries, J., Okada, Y., Martin, A. R., Martin, H. C., Lappalainen, T., & Posthuma, D. (2021). Genome-wide association studies. Nature Reviews Methods Primers, 1(1), 59. https://doi.org/10.1038/s43586-021-00056-9
-
Bycroft, C., Freeman, C., Petkova, D. та ін. (2018). The UK Biobank resource with deep phenotyping and genomic data. Nature, 562(7726), 203–209. https://doi.org/10.1038/s41586-018-0579-y
-
Lambert, S. A., Gil, L., Jupp, S. та ін. (2021). The Polygenic Score Catalog as an open database for reproducibility and systematic evaluation. Nature Genetics, 53(4), 420–425. https://doi.org/10.1038/s41588-021-00783-5ʼ
-
Yengo, L., Vedantam, S., Marouli, E. та ін. (2022). A saturated map of common genetic variants associated with human height. Nature, 610(7933), 704–712. https://doi.org/10.1038/s41586-022-05275-y
-
Slunecka, J. L., van der Zee, M. D., Beck, J. J. та ін. (2021). Implementation and implications for polygenic risk scores in healthcare. Human Genomics, 15, 46. https://doi.org/10.1186/s40246-021-00339-y













