BGRS/SB-2026: как большие данные меняют биоинформатику

В Новосибирске проходит международная мультиконференция BGRS/SB-2026, посвященная биоинформатике и системной биологии. Ученые из 22 стран обсуждают анализ больших генетических данных, моделирование процессов в клетке и нехватку экспериментальных данных. Мы поговорили с экспертами о высоком уровне геномной изменчивости и перспективах использования искусственного интеллекта в биоинформатике.

BGRS/SB-2026 каждые два года объединяет биоинформатиков и экспериментаторов, которые работают в области генетики и селекции, молекулярной и клеточной биологии, биотехнологии, медицине, агробиотехнологии, фармакологии и биобезопасности.

Эксперты: 
— председатель программного комитета BGRS/SB-2026, научный руководитель ФИЦ «Институт цитологии и генетики СО РАН» академик Николай Александрович Колчанов;

— ученый секретарь конференции Евгения Александровна Антропова;

— заместитель директора по научной работе ФИЦ ИЦиГ СО РАН доктор биологических наук Дмитрий Аркадьевич Афонников;

— главный научный сотрудник сектора биоинформатики и информационных технологий в генетике ФИЦ ИЦиГ СО РАН доктор биологических наук Сергей Александрович Лашин;

— ведущий научный сотрудник лаборатории компьютерной протеомики ФИЦ ИЦИГ СО РАН кандидат биологических наук Владимир Александрович Иванисенко.

— Какую роль играют большие данные в современной генетике?

Николай Колчанов: «В настоящее время в генетике продолжается информационный взрыв, обусловленный стремительным развитием омиксных технологий (геномики, транскриптомики, протеомики, метаболомики) и других высокопроизводительных методов экспериментального исследования молекулярно-генетических систем и процессов. Темпы накопления экспериментальных генетических данных, получаемых в науках о жизни, составляют до 40 петабайт в год. Науки о жизни стали главным источником больших данных в мировой науке и технологиях, намного опередив все другие науки по темпам роста и объёмам накапливаемой информации.

Анализ больших генетических данных привел к трансформации базовой парадигмы современной генетики. Центральным объектом становятся генные сети — группы координированно функционирующих генов, которые взаимодействуют друг с другом через продукты (РНК, белки, метаболиты), обеспечивая на основе информации, закодированной в геномах, формирование фенотипических характеристик организмов (молекулярных, биохимических, клеточных, физиологических, морфологических, поведенческих и так далее).

Николай Колчанов и Андрей Тулупов

Выявлена огромная сложность регуляции генных сетей, проявляющаяся в том, что функционирование любого отдельного элемента генной сети может контролироваться десятками и сотнями элементарных регуляторных процессов. Это относится как к регуляции транскрипции генов, которую контролируют десятки транскрипционных факторов, взаимодействующих с сайтами связывания в промоторах генов, функционированию белков, активность которых модулируется взаимодействием с большим количеством лигандов — аллостерических регуляторов, так и к метаболическим путям, в которых количество элементарных управляющих процессов может быть на порядок больше, чем число биохимических реакций.

Еще одна фундаментальная особенность живых систем, выявленная при анализе больших генетических данных, — исключительно высокий уровень геномной изменчивости в популяциях человека, животных, растений и микроорганизмов. Для биоинформатики, решающей задачи реконструкции, анализа и моделирования структурной организации и молекулярно-генетических механизмов функционирования геномов, генов, РНК, белков и супрамолекулярных комплексов, большие генетические данные — это грандиозный вызов.

Это еще бо́льший вызов для системной компьютерной биологии, решающей задачи реконструкции, анализа и моделирования структурно-функциональной организации и динамики молекулярно-генетических систем и генных сетей — ансамблей скоординированно функционирующих генов, обеспечивающих формирование фенотипических характеристик клеток, тканей, органов и организмов на основе информации, закодированной в геномах.

Ответ на эти вызовы, поставленные большими генетическими данными, состоит в разработке информационно-программных систем нового поколения, интегрирующих классические методы биоинформатики и системной компьютерной биологии с методами искусственного интеллекта и глубокого машинного обучения, что обеспечивает многократное повышение глубины, точности и скорости анализа больших генетических данных».

— Мультиконференция объединяет специалистов из разных стран и областей науки. Как изменилась ее география по сравнению с предыдущими годами? 

Евгения Антропова: «Конференция по праву считается одной из крупнейших в Евразии и определенно ведущим российским форумом в области биоинформатики и Big Data в науках о жизни. Она сохраняла эти позиции и в 2020 году, когда из-за пандемии почти все конференции, симпозиумы и другие подобные мероприятия, запланированные на весну и лето, отменялись или переносились на неопределенный срок. BGRS/SB стала первой большой конференцией в новосибирском Академгородке, которая прошла полностью в онлайн-формате. Многие сомневались, говорили, что у нас ничего не получится, не выйдет обеспечить полноценное общение между участниками конференции “на удаленке”. Но оказалось, что это вполне решаемая задача, и наш опыт затем использовали при проведении других мероприятий.

Евгения Антропова

После 2022 года международное научное сотрудничество было сокращено: уменьшилось число академических обменов, прекратились совместные проекты. Российские ученые столкнулись с ограничением доступа к международным базам данных и оборудованию для научной работы. 

Следующим вызовом для BGRS/SB стала СВО, обрушившая многие научные связи между Россией и другими странами. Но оказалось, что заработанный авторитет одного из ведущих мировых форумов в области биоинформатики и системной биологии сильнее политических мотивов: в 2022 году мультиконференция собрала более 900 ученых из 35 стран. Ничуть не уступала ей в масштабах и следующая, которая прошла в 2024 году.

В этом году в конференции принимают участие более 800 человек, в том числе 89 исследователей-иностранцев. На конференции представлено более 600 докладов, из которых устных около 400.

География участников сильно не меняется. В последние годы несколько снизилось количество представителей Евросоюза, стало больше ученых из стран Азии. Но, как и раньше, с нами исследователи из США, Японии, ряда европейских государств. Конечно, на каждой конференции появляются дебютанты, но связано это прежде всего не с намерением организаторов расширить собственно географию, а с тем, что в соответствии с развитием мировой науки меняется программа мультиконференции, появляются новые темы и симпозиумы, которые, естественно, и привлекают новых участников».

— Конференция проводится с 1998 года. Какие проблемы биоинформатики выходят на первый план сейчас?

Дмитрий Афонников: «Действительно, конференция проводится уже почти тридцать лет, причем я отлично помню первую, на которой тоже присутствовал. Она называлась “Биоинформатика и регуляция структуры генома”, что и было тогда главной темой — изучение структуры генома, структуры и функции белков.

Очень много было задач, связанных с поиском регуляторных районов генома, что было очень важно, поскольку на этой основе реконструировались генные сети.

Биоинформатика стремительно развивалась, за считанные годы пройдя путь от исключительно фундаментальной дисциплины к экспериментальной и прикладной научной деятельности. Эти изменения нашли отражение и в программе конференции, которая с 2004 года стала включать и экспериментальную часть в виде раздела, посвященного системной биологии.

В программу конференции стали входить симпозиумы по разным направлениям: по системной биологии, математические, посвященные каким-то молекулярным аспектам, медицинские, по генетике старения и так далее. Эти разнородные темы объединяло то, что в основу был положен системный биологический взгляд на эти явления.

В биологии сейчас невозможно обойтись без больших данных, практически любая молекулярная задача решается либо с помощью методов секвенирования генома или транскриптома, либо это какие-то метаболомные профили, то есть это массовый эксперимент. Если эксперименты не массовые, работы высокого уровня не будет. Обработка таких массивов данных без математики, без информационных технологий, подходов, связанных с машинным обучением, невозможна, а это и есть основные инструменты биоинформатики.

— Каких фундаментальных знаний о клетке не хватает ученым, и как здесь могут помочь биоинформатика и системная биология?

Сергей Лашин: — В настоящее время хорошо обстоит дело с in silico реконструкцией генных сетей микроорганизмов, контролирующих метаболические процессы, и их компьютерным моделированием. На основе этих подходов успешно осуществляется дизайн экспериментов по конструированию штаммов-продуцентов с целевыми (заданными) свойствами. Однако по-прежнему имеется острый недостаток экспериментальных данных для надежного предсказания и моделирования процессов в клетках человека, животных и растений, в настоящее время он восполняется с помощью экспериментально-компьютерных мега-проектов. Конкретный пример: генетический гигант Illumina объявил о запуске первого этапа проекта «Illumina Billion Cell Atlas», целью которого является экспериментально-компьютерная реконструкция детальной карты процессов, протекающих в клетках человека.

Сергей Лашин

Масштаб работы звучит как научная фантастика. За несколько лет планируется получить информацию о пяти миллиардах клеток человека, суммарный объем информации, получаемой в течение года, будет составлять до 20 петабайт. Это сопоставимо с архивом всех книг, когда-либо написанных человечеством на всех языках, умноженным в десятки раз. Это замечательный пример больших генетических данных, обработка и анализ которых с помощью методов биоинформатики и искусственного интеллекта позволит приблизиться к пониманию того, что происходит в живых клетках.

Что же касается классической проблемы генетики — предсказания по информации, закодированной в геноме конкретного организма, совокупности всех его фенотипических признаков (внешних и внутренних характеристик), — она до сих пор не решена. Науке еще предстоит это сделать, и существенную роль в этом, конечно, сыграют биоинформатика и системная биология».

— Какие процессы в биологии уже поддаются точному моделированию, а какие — нет?

Дмитрий Афонников: «Там, где данных много, и они хорошо структурированы и аннотированы, математические модели работают очень точно и хорошо. Например, если взять структуру белка, то современные информационные технологии позволяют предсказать структуру с очень высокой точностью.

Там, где такой высокий уровень накопления и структурирования данных не достигнут, компьютерные методы работают не так эффективно. Это касается, например, физиологических процессов. Здесь очень мало реальных экспериментальных данных. Гены мы знаем хорошо, а вот кинетические параметры, которые описывают динамику, их взаимодействие, функцию, — весьма слабо, потому что измерить эти параметры в живой клетке, ткани, организме очень сложно.

Само структурирование этих процессов тоже является проблемой. Нет четкого определения, что такое функция гена. Известно, что нередко белки бывают мультифункциональны, то есть один и тот же белок может выполнять несколько различных функций в разных клетках и тканях и генных сетях. И в этой ситуации методы машинного обучения, модели работают не очень хорошо. Поэтому моделирование физиологических процессов, моделирование динамики процессов в клетке — это задача, решение которой займет еще очень много времени».

Сергей Лашин: «Отдельные процессы, связанные с реконструкцией структурно-функциональной организации белков, их взаимодействиями с ДНК, РНК и лигандами, сейчас моделируется с неплохой точностью. Например, последние версии комплекса программ AlphaFold на основе искусственного интеллекта и глубокого машинного обучения хорошо предсказывает 3D-структуру глобулярных белков по их аминокислотным последовательностям. А вот предсказать, какие молекулярно-генетические и биохимические процессы, контролируемые информацией, закодированной в геномах, протекают в процессе индивидуального развития в организме, обеспечивая формирование множества его фенотипических характеристик, на уровне отдельных клеток, тканей и органов — это задача биоинформатики и системной компьютерной биологии будущего».

— Как искусственный интеллект изменил системную биологию сегодня и какие перспективы его использования откроются в будущем?

Владимир Иванисенко: «Сам искусственный интеллект, область и способы его применения — всё это меняется очень быстро, равно как и отношение к ИИ. Еще пять лет тому назад мы много говорили о генеративных моделях. Большие языковые модели рассматривались как некая панацея, которая позволит решать те задачи, где в принципе не было даже подходов к решению. С другой стороны, надеялись, что искусственный интеллект нам поможет сформулировать эти задачи, что тоже очень важно.

Сейчас же, работая с ИИ, исследователи, и не только они, столкнулись с двумя проблемами. Первая — искусственный интеллект подстраивается под вас, пытается угодить вам, это для него становится приоритетнее точности и достоверности ответа. Вторая проблема, чрезвычайно важная — ИИ придумывает несуществующие вещи, их еще называют галлюцинациями. И, конечно, обе эти проблемы очень затрудняют более широкое его использование для исследований. Но, с другой стороны, и обойтись без него нельзя: у нас нет другого сопоставимого по возможностям инструмента для обработки того огромного массива данных, который накапливается в современной биологии. На мой взгляд, самое перспективное направление развития искусственного интеллекта связано с так называемыми гибридными моделями, которые включают в себя генеративные нейронные сети и онтологическую модель предметной области. И тогда эти негативные моменты значительно снизятся, поскольку ИИ будет ограничен в своей работе правилами, заложенными в этой онтологии.

Владимир Иванисенко

Если говорить о биоинформатике, что мы подразумеваем под онтологической моделью? Это понятие сущностей и взаимоотношения между ними. Онтология определяет типы взаимоотношений, и это снижает всевозможные ошибки со стороны искусственного интеллекта, связанные с тем, что некоторым сущностям он может приписывать взаимоотношения, которые в принципе им не свойственны. Он уже не будет этого делать. На самом деле, задаче создания онтологии, в которую можно было погрузить генеративные модели искусственного интеллекта, сейчас уделяют огромное внимание в больших компаниях, занимающихся разработкой и применением искусственного интеллекта на практике.

В ИЦиГ мы достаточно давно, с 2003 года, занялись этой задачей, причем начали решать ее без больших языковых моделей, поскольку в то время их еще не было. Так появилась система, которая объединяет методы анализа генетических последовательностей и технологии обработки естественного языка. ANDSystem (Associative Network Discovery System) автоматически анализирует тексты научных публикаций, патентов и баз данных, извлекая из них факты о взаимодействии генов, белков, заболеваний и лекарств. Все найденные связи представляются в виде наглядных семантических сетей, которые можно визуализировать и анализировать. При этом она ограничена внутренней онтологической моделью и поэтому не выдумывает ответы, если не располагает нужными данными.

На базе этой системы мы уже создали некоторые программные продукты для медицины, которые решают прикладные задачи, такие как эффективный подбор лекарств для конкретного пациента. Сейчас мы работаем как раз над тем, чтобы совместить нашу онтологию с большими языковыми моделям. Этот проект вызывает большой интерес у крупных IT-компаний по причинам, которые я обозначил выше. Что касается биоинформатики и системной биологии, то в перспективе это позволит нам дальше продвинуться в тех направлениях, о которых говорили мои коллеги».

В рамках конференции проводятся 13 симпозиумов, объединенных в два направления: биоинформатика, системная и структурная компьютерная биология, искусственный интеллект, а также экспериментальные и информационно-компьютерные подходы. Мероприятие ориентировано на развитие устойчивого и эффективного взаимодействия специалистов из разных сфер для решения актуальных задач системной биологии и биоинформатики.

Алёна Матвеева, студентка 3 курса отделения журналистики Гуманитарного института НГУ

Фото Инессы Бахаревой (НГУ), Василия Коваля, пресс-центр ФИЦ ИЦиГ СО РАН