Разработка моделей, алгоритмов и программных средств для исследования процессов регуляции транскрипции у бактерий
При расшифровке геномных последовательностей сложные вычислительные задачи связаны с двумя стадиями геномных проектов: сборкой полной последовательности из секвенированных фрагментов и ее аннотацией.
Аннотация геномных последовательностей предполагает идентификацию кодирующих последовательностей (открытых рамок считывания) с определением их возможных функций, а также идентификацию регуляторных последовательностей, контролирующих экспрессию кодирующих последовательностей: промоторов, терминаторов и сайтов связывания транскрипционных факторов.
Наиболее сложна идентификация самых вариабельных из регуляторных последовательностей – сайтов связывания транскрипционных факторов (операторов). Задачу можно разделить на две части: (1) нахождение регуляторного мотива (что фактически сводится к построению математической модели сайта связывания конкретного транскрипционного фактора) и (2) сканирование геномных последовательностей для нахождения координат операторов, соответствующих мотиву (модели).
Особую актуальность идентификация регуляторных последовательностей имеет для фундаментальных исследований внутри- и межклеточной регуляции, а также как фундаментальных, так и прикладных исследований, связанных с конструированием организмов с заданными свойствами. Дизайн таких организмов, будь то нокаут-линия, предназначенная для исследования какого-либо физиологического процесса или бактериальный штамм-продуцент, существенно выигрывает от моделирования регуляции целевого признака. Наличие корректной схемы регуляции позволяет направленно получить желаемые количественные изменения путем целенаправленных манипуляций с уровнями экспрессии регуляторных генов и(или) с регуляторными последовательностями распознаваемыми продуктами этих генов.
Целью работы является разработка моделей, алгоритмов и программных модулей для анализа сайтов связывания бактериальных транскрипционных факторов (операторов) и создание web-портала, интегрирующего процесс анализа. Для достижения поставленной цели требуется решение следующих задач:
- Разработка базы данных операторных и промоторных мотивов и веб-интерфейса к ней.
- Разработка и верификация алгоритма автоматической калибровки пороговых значений моделей регуляторных мотивов;
- Создание калиброванных моделей регуляторных мотивов и наполнение базы данных;
- Разработка алгоритма идентификации транскрипционных единиц в бактериальных геномах на основании анализа промоторов, операторов, терминаторов и транскриптомных данных;
- Создание информационно-аналитического web-портала, для анализа регуляторных последовательностей в бактериальных геномах.