Ученые исследовали паттерны связывания ДНК для белков-регуляторов

AI Сгенерировано ИИ
Исследование, проведенное учеными из России, Канады, Швейцарии, США и Германии, значительно расширяет понимание управления генами человека и поможет более точно оценивать, как генетические мутации могут приводить к заболеваниям. Результаты работы опубликованы в журнале Nature. Данную информацию сообщает портал Научная Россия.
Участники международного проекта Codebook/GRECO-BIT в области вычислительной и статистической геномики выяснили, какие последовательности ДНК распознают недостаточно изученные регуляторные белки человека. Специфичность 332 таких белков была определена с помощью пяти независимых методов, которые использовались как в лабораторных условиях, так и в живых клетках. Каждая модель связывания была проверена на данных, полученных другими методами для того же белка. Ученым удалось описать надежные мотивы для 177 белков, причем для большинства из них эти мотивы ранее не были известны. Общее количество транскрипционных факторов человека с охарактеризованной специфичностью превысило 1400. Созданный каталог позволяет предсказывать, с какими участками генома связывается тот или иной регуляторный белок и как на это связывание влияют отдельные мутации.
Проект Codebook/GRECO-BIT представляет собой крупную международную коллаборацию в области биоинформатики и молекулярной биологии, сосредоточенную на изучении специфичности связывания транскрипционных факторов (TF) с ДНК. Команда собирает экспериментальные данные и разрабатывает компьютерные методы, чтобы понять, какие участки ДНК распознает каждый белок. Это исследование помогает лучше понять работу генов, изучать причины наследственных заболеваний и разрабатывать новые методы диагностики и лечения.
Четверть регуляторных белков ранее не имела описанного мотива связывания. ДНК человека содержит огромную «инструкцию» по функционированию организма, но не все гены активны одновременно. За их активацию и деактивацию отвечают специальные белки – транскрипционные факторы, которые находят определенные участки ДНК и запускают или останавливают работу соседних генов. Эти участки называются мотивами связывания.
Согласно каталогу транскрипционных факторов человека, составленному в 2018 году, около четверти из примерно 1600 предполагаемых регуляторных белков не имели надежно установленного мотива связывания. Большинство таких факторов не имеют родства с хорошо изученными белками, что делает невозможным восстановление их специфичности по гомологии. Неизвестным оставалось и то, обладают ли эти белки мотивами связывания в принципе.
Консорциум Codebook поставил перед собой задачу восполнить этот пробел. Специфичность была определена для 393 белков: 332 из них – это недостаточно изученные предполагаемые транскрипционные факторы человека, а 61 вошел в контрольную выборку. Каждый белок исследовали пятью экспериментальными методами, как полностью лабораторными, так и позволяющими наблюдать за работой белка в живой клетке. Работа заняла почти восемь лет и потребовала более 4000 экспериментов.
Полученные данные позволят лучше понять, как функционируют гены, а в будущем – объяснять, почему некоторые изменения в ДНК могут влиять на здоровье человека. Например, если в геноме возникает мутация, можно будет оценить, мешает ли она белку правильно находить свой участок ДНК и выполнять свою функцию.
«Ценность проведенных опытов заключается не только в охвате множества малоизученных факторов транскрипции, но и в их систематичности. Геномные паттерны связывания регуляторного белка могут значительно отличаться от связывания с искусственными последовательностями. Эти данные – один из немногих наборов, которые позволяют создавать универсальные модели связывания, включая модели искусственного интеллекта, способные к качественному переносу знаний между различными модальностями», – рассказывает Арсений Зинкевич, куратор магистерской программы «Применение машинного обучения в биологии».
Перед применением модели связывания необходимо решить, какую именно из множества возможных считать правильной. Для каждого эксперимента разные алгоритмы поиска мотивов строят различные модели, а для белка, специфичность которого никогда не описывали, сверить результат не с чем. Главным критерием становится переносимость: модель, выведенная из одного эксперимента, должна предсказывать данные другого эксперимента, проведенного другим методом.
Модели, построенные десятью разными программами, тестировались на всех остальных экспериментах для того же белка, а результаты сопоставления были собраны в открытый каталог Codebook Motif Explorer. Каждый эксперимент дополнительно оценивался не менее чем тремя независимыми экспертами из числа членов консорциума. Побочным результатом сравнения стало наблюдение, расходящееся с распространенными ожиданиями: «четкость» мотива, формально измеряемая его информационным содержанием по Шеннону, не связана с точностью предсказания участков связывания. Многие «нечеткие» модели, в которых ни одна позиция не требует строго определенного нуклеотида, описывали связывание не хуже прочих и воспроизводились на нескольких экспериментальных платформах.
«Codebook Motif Explorer – это наглядный пример важности и ценности данной работы, – уточняет Иван Козин, соавтор работы. – Эта работа ценна не только тем, что закрывает множество пробелов в наших знаниях о специфичности связывания транскрипционных факторов. Полученные данные и результаты уже становятся основой для новых исследований и инструментов».
Проверенные модели связывания позволяют перейти к практической задаче: понять, как однобуквенные замены влияют на работу генов. Оценить это удалось по экспериментальным данным проекта. Клетки, на которых проводились опыты, содержат по две копии каждой хромосомы, и в некоторых участках генома эти копии различаются: в одной находится исходный вариант, в другой – вариант с заменой. Эксперимент показывает, какие именно фрагменты ДНК связал белок, поэтому достаточно посмотреть, какие фрагменты с каким вариантом встречаются чаще. Если замена не влияет на связывание, оба варианта будут встречаться примерно поровну; заметный перекос указывает на то, что она мешает или, наоборот, помогает связыванию. Такое неравенство называется аллель-специфичным связыванием.
Перекос был обнаружен в 10 тысячах участков генома, а всего набралось 12 тысяч случаев, поскольку одно и то же положение может влиять на связывание сразу нескольких проверенных белков. В трех случаях из четырех тот же эффект успешно предсказывался: модель связывания указывала на тот вариант, который белок действительно предпочитал.
«Про многие замены в некодирующей части генома до сих пор известно только то, что они статистически связаны с каким-то признаком или заболеванием, но непонятны причины этой связи, – говорит Владимир Ноздрин, соавтор работы. – Теперь мы можем объяснить их механизм для тех белков, по которым ранее не было таких данных».
Анализ мотивов осуществляла большая команда под руководством Ивана Кулаковского и Всеволода Макеева, а платформу для анализа геномных данных предоставила группа Федора Колпакова. В работе с российской стороны также участвовали сотрудники Института биохимии и генетики УФИЦ РАН и компании «Биософт». На российской стороне был выполнен поиск мотивов по первичным данным, их кросс-платформенное сопоставление, создание сервиса для экспертной оценки экспериментов и каталога Codebook Motif Explorer, анализ аллель-специфичного связывания и активности мотивов в тканях и клеточных линиях, а также организация соревнования IBIS Challenge, которое успешно завершилось в 2025 году. Статья по его результатам готовится к публикации.
«Все модели связывания, исходные данные и результаты сопоставлений выложены в открытый доступ, поэтому их уже сейчас можно применять для аннотации регуляторных участков и оценки эффекта генетических вариантов. Консорциум провел предварительный анализ белков, которые не дали мотива: часть из них, вероятно, требует партнеров по связыванию или модифицированной ДНК, а часть, скорее всего, вовсе не связывает ДНК специфично», – рассказывает Иван Кулаковский, доктор биологических наук, профессор учебного центра молекулярной биологии ИБ РАН.
Библиотека полученных и проверенных мотивов доступна в каталоге Codebook Motif Explorer, репозитории Zenodo, в сборке 3.1 базы данных CisBP, и в составе 14-й версии коллекции HOCOMOCO. Подготовленные наборы данных и протоколы проверки моделей выложены на площадке соревнования IBIS. Сведения по каждому изученному белку собраны на портале проекта Codebook, первичные данные секвенирования депонированы в базах SRA, ArrayExpress и GEO, а программы для анализа аллель-специфичного связывания и активности мотивов доступны на GitHub.



