Неидеальный человек: Почему эволюция оставила нам болезни, ошибки ДНК и уязвимости - Лоуренс Херст - Страница 7


К оглавлению

7
около 48 Мб. Если сложить все вместе, то в одном полном наборе из 23 хромосом окажется примерно 3,2 миллиарда спаренных оснований, или 3200 Мб. Кстати, у вас наверняка возник вопрос: если хромосомы пронумерованы по размеру, почему же 22-я не самая маленькая? Ответ кроется в истории их изучения. Когда хромосомы нумеровали впервые, их рассматривали под микроскопом в компактной форме и определяли размер буквально на глаз. Тогда 22-я хромосома показалась меньше 21-й. Но позже, когда провели точное секвенирование, выяснилась забавная деталь: 22-я хромосома на самом деле чуть длиннее — примерно 49 Мб против 48 Мб у 21-й.

Когда ученые впервые расшифровывают геном вида, у которого, как и у нас, каждая хромосома представлена в двух копиях, они обычно читают последовательность только одного набора. Второй набор, как и варианты тех же хромосом у других представителей вида, как правило, мало отличается от первого. Другое дело, если нужно изучить разнообразие ДНК внутри вида, — тогда приходится секвенировать геномы множества разных особей.

Добро пожаловать в эру больших данных

Всю последовательность ДНК можно записать в обычный текстовый файл — что-то вроде очень длинной электронной книги. Такие файлы находятся в свободном доступе: любой желающий может скачать их из международных баз данных, например из американского Национального центра биотехнологической информации (NCBI). Поскольку хранить генетические данные просто, нам удалось совершить грандиозный прорыв в изучении ДНК. Сейчас мы наблюдаем настоящий информационный шторм: объем расшифрованных последовательностей удваивается каждые восемь месяцев.

Этот прорыв был бы невозможен без двух научных достижений. Первое из них — появление продуманных химических методов секвенирования, и именно в этой области сейчас происходят самые впечатляющие перемены. Чтобы оценить масштаб произошедших изменений, давайте вспомним: когда геном человека расшифровывали впервые, на прочтение 3,2 миллиарда спаренных оснований ушло больше 10 лет и 2,7 миллиарда долларов — получается, каждая прочитанная пара обходилась примерно в доллар. Над проектом трудились лаборатории по всему миру, и в 2003 году было торжественно объявлено, что расшифровка генома завершена. Правда, слово «завершена» требует важной оговорки. Дело в том, что в геноме часто встречаются особо упрямые участки ДНК, которые крайне трудно прочитать. Поэтому по-настоящему расшифровка завершилась только в 2022 году, когда ученым наконец удалось разобраться и с этими непокорными фрагментами. А сегодня благодаря стремительному развитию технологий секвенирования мы можем получить полную последовательность генома человека всего за 100–1000 долларов, причем прямо в режиме реального времени.

Это значит, что теперь, по крайней мере теоретически, пациент может прийти к врачу и, пока он находится в клинике, получить полный анализ своего генома, диагноз и план лечения. Настоящий рекорд скорости в этой области принадлежит детской больнице Рэди в Сан-Диего. К ним поступил пятинедельный малыш с энцефалопатией — отеком мозга. Поскольку в семье уже были похожие случаи, врачи заподозрили генетическое заболевание и назначили секвенирование генома. На его расшифровку ушло всего 11 с небольшим часов — не 10 лет, как раньше! Уже через 17 часов после забора крови и спустя 13 часов после начала секвенирования врачи выявили конкретное нарушение обмена веществ. А через 37,5 часа после поступления малыша в больницу медики начали лечение.

Появление быстрых, точных и недорогих методов расшифровки ДНК обещает совершить переворот во многих областях науки. Взять хотя бы проект «Биогеном Земли» — его создатели называют его биологическим проектом века, сравнимым с высадкой на Луну, и планируют за 10 лет расшифровать геномы всех сложных форм жизни (т.е. кроме бактерий и вирусов). Не менее важно изучать и генетические различия внутри одного вида. Благодаря технологиям быстрого секвенирования мы смогли в реальном времени отслеживать мутации в вирусе SARS-CoV-2, вызывающем COVID-19, и узнавать о появлении новых штаммов практически сразу после их возникновения. Пожалуй, этот вирус стал самым подробно изученным с генетической точки зрения существом — если его так можно назвать — за всю историю науки. Еще один вид живых существ, о котором мы хотим узнать побольше, — это мы, люди. Например, Национальные институты здравоохранения США (NIH) запустили исследовательскую программу «Мы» (All of us), цель которой — сопоставить ДНК более миллиона людей с историями их болезней.

Второе достижение связано с нашей способностью обрабатывать и понимать эти горы данных. Учитывая, что объем генетической информации удваивается каждые восемь месяцев, нам требуются мощные компьютеры и серьезные навыки программирования. Но главное — нужны специалисты, умеющие со всем этим работать. И здесь небольшой совет для тех, кто выбирает профессию: если вам нравятся компьютеры, сейчас самое время стать биоинформатиком — специалистом, который с помощью вычислительных методов анализирует эти массивы данных. Работа хорошо оплачивается, а спрос на таких профессионалов только растет.

Расшифровка данных

Работа с большими данными — это не просто вопрос хранения бесконечных цепочек нуклеотидов. Загрузить в компьютер последовательность букв А, C, Т и G — это только начало. Главное — научиться извлекать из этих последовательностей смысл, а для этого нужно понять, как устроена и работает сама ДНК.

Главное предназначение ДНК — записывать последовательности аминокислот, из которых состоят белки. Именно белки выполняют в клетках всю основную работу: одни, в виде ферментов, помогают получать энергию из пищи, другие формируют структуры, позволяющие мышцам сокращаться, третьи обеспечивают копирование самой ДНК. По сути, без белков не обходится ни один процесс в клетке. Длина белковых молекул может достигать нескольких тысяч аминокислот, хотя в среднем они состоят из 500–1000 звеньев. Поэтому для понимания ДНК нам нужно прежде всего разобраться, какие именно белки она кодирует.

ДНК и белки похожи тем, что они представляют собой линейные цепочки: ДНК состоит из пар нуклеотидных оснований, а белки — из аминокислот. Правда, белковая цепочка не остается прямой, а сворачивается, принимая самые разные формы. Можно представить белки как клубки нитей: одни получаются длинными и тонкими, другие больше похожи на шарики. То, что и ДНК, и белки построены как линейные последовательности, а не как ветвящиеся химические структуры (вроде резервных сахаров типа гликогена), подсказывает нам, как устроен процесс создания белков по инструкциям ДНК. Первый этап этого процесса называется транскрипцией, и он немного напоминает репликацию. Участок ДНК временно «раскручивается», и по одной из цепей, как по шаблону, собирается комплементарная однонитевая молекула. Затем эта новая молекула отделяется, а ДНК «скручивается» обратно. Так информация — последовательность оснований — физически переносится из ДНК в новую, однонитевую нуклеиновую кислоту, которую называют РНК (рибонуклеиновая кислота).

Самое интересное происходит на втором этапе. РНК отправляется к особому органоиду клетки — рибосоме, где записанная в ней

7