В медицине отдельные пептиды служат основой для таргетных лекарств, доставляющих действующее вещество точно в больные клетки, не задевая здоровые. Также некоторые из этих коротких органических соединений из-за их антимикробной и противовоспалительной активности рассматривают как перспективную основу для разработки терапевтических агентов.

Биологическая активность пептида зависит от набора аминокислот и от их расположения в цепочке. Чтобы понять, будет ли конкретный пептид работать как потенциальное лекарство, исследователям нужно сначала преобразовать соединение в формат, с которым могут работать алгоритмы машинного обучения, — например, в набор чисел, описывающих молекулу.

Для получения такого цифрового описания исследователи часто используют большие белковые языковые модели. Это специализированные нейросети, которые обучаются на десятках миллионов аминокислотных последовательностей, представляя их как текст, и используются для прогнозирования свойств белков и пептидов. Модели выдают высокую точность прогнозов по многим свойствам пептидов — от антимикробной активности до растворимости. Однако у такого подхода есть серьезные ограничения. Во-первых, из-за миллиардов параметров модели требуют больших вычислительных ресурсов. Во-вторых, для исследователей они остаются «черными ящиками», так как выдают прогноз, но не объясняют, как именно пришли к тому или иному результату. Понять это можно только с помощью дополнительных методов анализа, которые нередко дают разрозненные результаты.

Ученые ИТМО пошли другим путем и создали компактный автокодировщик dcBiLSTM‑AE, внутренние представления пептида в котором изначально привязаны к его конкретным физико-химическим характеристикам и не требуют дообучения для объяснения. Поэтому с помощью модели можно не только получить результат, но и отследить, какое именно свойство пептида повлияло на результат.

В новой модели пептид описывают не как текст, а как таблицу физико-химических свойств. В строках таблицы — 46 характеристик аминокислот (заряд, гидрофобность, молекулярная масса и другие), в столбцах — позиции аминокислот в цепочке. Каждая ячейка, в отличие от абстрактных токенов больших белковых моделей, имеет понятный физический смысл. Дальше к таблице подключается автокодировщик — он сжимает ее в компактное описание пептида. При сжатии свойства из разных строк могут перемешаться, и тогда станет непонятно, что на что повлияло. Чтобы этого не произошло, в модель встроили ограничение: она вынуждена учитывать вклад каждой характеристики по отдельности.

«Наша модель содержит около 90 тысяч параметров, тогда как популярные белковые языковые модели оперируют сотнями миллионов и миллиардами. Для предварительного обучения dcBiLSTM-AE мы использовали около 155 тысяч пептидов, что значительно меньше, чем используется при обучении крупных белковых языковых моделей. Компактность архитектуры и использование физико-химических характеристик аминокислот позволяют получать информативные представления пептидов при существенно меньшем масштабе модели и обучающих данных. При этом, как показало наше сравнение, для ряда практических задач такие представления по качеству сопоставимы с представлениями значительно более крупных моделей», — объяснил первый автор статьи, аспирант Передовой инженерной школы интердисциплинарного инжиниринга ИТМО Евгений Нам.

Евгений Нам. Фото: Дмитрий Григорьев / ITMO NEWS

Евгений Нам. Фото: Дмитрий Григорьев / ITMO NEWS

Модель уже протестировали на восьми задачах. Семь из них относились к классификации — это прогнозирование антимикробной, противовоспалительной, антидиабетической, антиоксидантной, гемолитической активности пептидов (то есть способности разрушать эритроциты), устойчивости к биообрастанию (образованию биопленок на поверхностях) и растворимости в воде. Восьмая задача была регрессионной — модель предсказывала минимальную концентрацию пептида, при которой подавляется рост кишечной палочки в лабораторных условиях. Подобные расчеты применяют при разработке новых препаратов, чтобы понять, насколько рабочим будет потенциальное лекарство и какую дозировку веществ в нем нужно использовать.

По всем восьми задачам новая модель показала оценки, сопоставимые с большими белковыми и специализированными пептидными языковыми моделями, а в двух из них — прогнозирование противовоспалительной активности и минимальной ингибирующей концентрации — заняла второе место среди шести аналогов.

Модель создает компактное описание пептида, к которому можно подключать другие алгоритмы и решать с их помощью разные задачи — от поиска новых лекарств до фундаментальных исследований. На практике это позволяет отбирать перспективные молекулы для лабораторных испытаний, не проверяя вслепую тысячи кандидатов для потенциальных лекарств. А для научных задач — глубже изучать строение и функции биомолекул и находить закономерности в том, как их структура связана со свойствами.

В дальнейшем исследователи планируют масштабировать подход на более длинные цепочки и редкие аминокислоты, которые не входят в стандартный набор из двадцати природных соединений. Кроме того, модель адаптируют для работы с пептидами необычной формы — когда цепочка аминокислот замкнута в кольцо или имеет боковые ответвления. Такие формы могут усиливать биоактивность молекулы или помогать ей дольше оставаться в кровотоке.

Разработка ориентирована на научные группы и фармкомпании, которые занимаются поиском новых лекарств. Модель не привязана к одной узкой задаче и подходит для разных исследований. После дообучения на более сложных формах пептидов ее можно будет встроить в программные комплексы компаний — это может ускорить первичный отбор кандидатов и снизить затраты на лабораторные испытания.

Исследование выполнено в рамках программы «Приоритет 2030».