Как устроена работа исследовательских групп, какие задачи они решают и как попасть в команду, — разбираемся в интервью с руководителем лаборатории Сергеем Колюбиным.
Чем занимается: профессор, главный научный сотрудник факультета систем управления и робототехники, руководитель лаборатории «Воплощенного интеллекта и робототехники» (ранее «Биомехатроники и энергоэффективной робототехники»).
Команда: более 30 человек. Среди них научные сотрудники, аспиранты, магистранты и бакалавры ИТМО.
Проекты: алгоритмы и системы воплощенного и пространственного интеллекта, системы управления движением, методы генеративного дизайна роботов ― от формул и архитектур до интегрированных программно-аппаратных решений.
Путь в робототехнику
— Я поступил в ИТМО в 2004 году на специалитет «Автоматизация и управление», но на третьем курсе перевелся на двухуровневую систему: бакалавриат + магистратура. Так за шесть лет написал и защитил два диплома. На третьем курсе меня привлек к исследованиям Алексей Алексеевич Бобцов ― тогда молодой кандидат наук, который как раз собирал команду для совместной научной работы. У меня появились первые статьи по системам управления. Но в те годы зарабатывать наукой было сложно — платили скромно, поэтому основная работа была за пределами университета.
Сразу после окончания магистратуры в 2010 году я в ущерб финансам принял решение попробовать себя полноценно в науке и попал в совместный проект ИТМО с General Motors ― он был посвящен адаптивному управлению впрыском топлива для автомобильных двигателей. Часть работы шла в главном исследовательском центре GM в США, куда я ездил как приглашенный исследователь. После первого года работы я, будучи аспирантом, «притащил» с собой в ИТМО новый проект по набравшей темп робототехнической тематике. И с 2011 года подключился к совместным исследованиям компании с агентством NASA по комплексированию сенсорной информации и компьютерному зрению для человекоподобного робота Robonaut 2.
Сергей Колюбин. Фото: Дмитрий Григорьев / ITMO NEWS
В 2012 году меня пригласили в норвежский технологический университет NTNU, где с нуля запускалась лаборатория промышленной робототехники. Там три с половиной года я занимался исследованиями в области планирования и управления движением, калибровкой и силомоментным управлением манипуляторов. Когда пришлось выбирать, остаться в найме на новом срочном контракте или вернуться домой, чтобы запустить собственную лабораторию и самому определять задачи, собирать команду, искать партнеров и заказчиков на первом в ИТМО мегафакультете Компьютерных технологий и управления — выбор был очевиден. Поэтому в 2016 году я приехал в Петербург, а в начале 2017‑го мы защитили заявку и в составе центра «Нелинейных и адаптивных систем» открыли в рамках Программы «5―100» международную лабораторию. В следующем году ей исполняется десять лет.
Прочитайте также:
Как устроена работа в лаборатории
— Лаборатория «Воплощенного интеллекта и робототехники» состоит из нескольких исследовательских групп, которые работают в общем пространстве с профессиональным оборудованием и роботами. У нас есть промышленные манипуляторы, мобильные платформы, квадрокоптеры, испытательные полигоны, сервера и доступ к опытному производству на факультете, где можно быстро изготовить прототипы мехатронных модулей. В лаборатории трудятся алгоритмисты, прикладные программисты, инженеры компьютерного зрения и ML‑инженеры, конструкторы и электронщики. Каждая группа ведет работы по своей тематике. Сотрудники сосредоточены на задачах, где нужно объединить компьютерное моделирование, дизайн механизмов, зрение, планирование и управление движением. Мы учим роботов разных типов (от манипуляторов до подводных) понимать, что они видят, планировать действия, принимать решения и воплощать их, устойчиво автономно работая в динамических средах без специальных сенсоров на борту.
Когда бизнес не находит готовых решений на рынке (причем не только российском), и приходит к нам за опытными разработками, мы собираем под задачу людей из разных групп и с разными профилями компетенций. Таким образом, мы способны браться за комплексные проекты и обеспечивать результат более высокого уровня технологической готовности, зачастую даже для себя открывая новые полезные применения на пересечении научных заделов лаборатории.
Сейчас основной запрос на прикладные опытно-конструкторские разработки, они обеспечивают финансовую устойчивость. Но мы не забываем, что мы прежде всего научная лаборатория и должны решать проблемы не только сегодня, но и завтра ― чтобы не проспать значимый прорыв и оставаться актуальными. Мы сочетаем технологические прикладные работы и фронтирные исследования, это подчеркивается и нашей структурой: лаборатория имеет привязку к двум подразделениям ― факультету систем управления и робототехники и Институту математики, который недавно был основан на мегафакультете.
Основной фокус наших фронтирных исследований — воплощенный интеллект. Мы создаем алгоритмы, которые сразу привязываем к «железу» и учитываем специфику работы робота в реальной, а не идеальной среде и в реальном времени. Поэтому мы закрываем всю цепочку — от проектирования «умного тела» робота до когнитивного слоя, то его есть «мозгов».
Ключевые слова, определяющие наши разработки — робастность, физическая согласованность, мультимодальность, семантика, адаптивность и энергоэффективность. В робототехнике важно, чтобы нейросеть учитывала ограничения робота и не противоречила глобальному физическому контексту ― законам природы, а не просто выдавала статистически правдоподобные результаты. Для реализации таких проектов к команде нашей лаборатории в этом году присоединился ученый с мировым именем Сергей Загоруйко.
Работа с манипулятором с оригинальным спроектированным захватом для фруктов и овощей. Фото: Дмитрий Григорьев / ITMO NEWS
Артефактами таких исследований становятся публикации на главных в роботическом сообществе конференциях ― ICRA, IROS, а недавно мы поставили себе задачу штурмовать A* по более широкому фронту и пробиваться на главные международные научные конференции ― CVPR, AAAI, ICML и ECCV. В ИТМО поддерживают эти амбиции и вкладывают средства в программу научных проектов в сфере ИИ. На мой взгляд, это не ярмарка тщеславия и не просто работа на репутацию, а грамотная инвестиция. Публикация работ такого уровня позволяет подтверждать высокие компетенции наших научных команд: демонстрировать, что идея была доведена до эксперимента и получен результат, что была широкая апробация, сравнение решения с топовыми аналогами. Такие статьи в том числе помогают искать индустриальных заказчиков. Сейчас надо уметь показывать уровень, не просто рисуя красочные слайды.
Также мы вносим активный вклад в развитие разработок с открытым исходным кодом. ИТМО ― активный участник подобных инициатив, у нас есть сообщество ITMO OpenSource, и практически все результаты, права на которые мы не должны передавать заказчикам, попадают в домен общедоступных знаний на гитхаб-страницу.
Темы работ появляются по-разному: что-то предлагают сами ребята, изучив научные статьи, что-то приходит от индустрии, а что-то направлено на попытку найти решение фундаментальных «вечных» задач на новом математическом базисе. Главное, чтобы идея была связана с актуальными задачами и понятным ожидаемым эффектом.
Как научить робота видеть и понимать
— Одна из задач, которую мы решаем, — научить робота понимать, что он видит, ориентироваться в пространстве и выполнять команды, подаваемые на естественном языке. Несколько наших проектов закрывают эту проблему с разных сторон.
Например, наш свежий фреймворк AgentGrounder позволяет роботу находить предметы по текстовому запросу. Представьте: робот первый раз заходит в незнакомое помещение, и ему говорят: «Найди синюю кружку на столе у окна». Чтобы справиться, он осматривается и составляет список всех объектов вокруг. Когда поступает команда, система раскладывает запрос на смысловые части, сопоставляет его с этим списком и указывает на нужный предмет. Главное преимущество — все происходит без дополнительной настройки под конкретную комнату или объект. Мы используем большие визуальные языковые модели, которые понимают связь между словами и картинкой, и добавляем к ним геометрические рассуждения, чтобы робот точно определял, куда смотреть и как далеко находится предмет. Вся система объединяется через агентные конвейеры, позволяющие гибко конфигурировать цепочку преобразований информации, вызывать различные инструменты и проводить промежуточную валидацию качества результата. Такие алгоритмы пригодятся в робототехнике, в дополненной реальности, виртуальной реальности и программах для работы с 3D-графикой.
Сотрудники лаборатории «Воплощенного интеллекта и робототехники» на полигоне для испытания систем управления шагающими роботами. Фото: Дмитрий Григорьев / ITMO NEWS
Еще одна наша недавняя разработка — R5DGS, система четырехмерной реконструкции динамического окружения. К трехмерной картинке, которую строит обычная камера, она добавляет временную ось — алгоритм просчитывает, куда движущиеся предметы переместятся в следующий момент. При этом он не дробит изображение на тысячи мелких кусочков, а работает с объектом как с единым целым: отслеживает его движение и предсказывает, куда он направится дальше. Подход ускоряет расчеты примерно на 11 кадров в секунду — для подобных систем это большой результат, позволяющий работать в реальном времени, без тормозов и рывков. Движение остается естественным и без ошибок. Дополнительно система умеет находить нужный предмет по текстовому запросу и показывать его с того ракурса, который задали. Эти алгоритмы полезны для точных компьютерных симуляций, например, в беспилотном транспорте или дополненной реальности.
Проекты для бизнеса
— Мы работаем с индустриальными партнерами по двум направлениям.
Первое ― инициативные проекты.
Часть из них реализуется со Сбером ― компания поддерживает исследования, над которыми прежде всего работают магистранты нашей совместной программы «Робототехника и искусственный интеллект». При этом Сбер не забирает права на результат. Мы публикуем результаты исследований в открытых научных журналах, и такие работы часто попадают на ведущие мировые конференции уровня А*.
Второе — проекты, где заказчик ставит перед исследователями бизнес-задачу. Из недавнего можно привести примеры нескольких таких заказных проектов:
В 2025 году для Сбера мы делали «робота-химика» — прототип ячейки для автономной лаборатории на примере целевого сценария автоматизированной сборки для литиевых батареек типа CR2032. Это плоские круглые элементы питания, которые используются в материнских платах, пультах и часах. Задача станции — чтобы робот сам, без участия человека, захватывал миниатюрные детали, отмерял нужный объем электролита (токопроводящей жидкости внутри батарейки) и герметично запаивал корпус. Здесь важно добиться от робота высокой точности, так как малейшая неточность при захвате деталей или дозировании электролита приведет к тому, что батарейка не заработает. Но важно было не просто решить частный случай, а получить масштабируемую на другие сценарии систему, которая сможет решать широкий спектр подобных задач. Разработка велась совместно с коллегами из AIRI и была представлена на конференции «Путешествие в мир искусственного интеллекта» (AI Journey 2025).
Также мы разрабатываем для Центра робототехники Сбера систему, которая учит роботов управляться с объектами, используя одновременно зрение и осязание. Это развитие их известной модели, в создании которой участвовали в том числе наши выпускники и аспиранты, сейчас работающие в Сбере. Кроме практической пользы, проект важен и для науки: он помогает ответить на фундаментальные вопросы о том, как модели связывают сигналы от разных типов сенсоров с действиями, воспроизводя достаточно сложные навыки манипуляции.
Для ВкусВилла мы совместно с другими командами ИТМО создаем роботизированную кухню — систему, которая заменяет поваров на «последней миле» работы с полуфабрикатами и готовой едой до доставки их клиенту. Наша зона ответственности ― модуль компьютерного зрения, то есть «глаза» и пространственная память робота. Также мы делаем интегрированную роботизированную ячейку, которая автономно собирает заказы из фруктов и овощей заданной массы, аккуратно манипулируя деликатными объектами. Это требует комбинации конструкторских решений, системы обработки сенсорной информации и компьютерного зрения и системы планирования и управления движением.
Часть команды компьютерного зрения одного из проектов по заказу ВкусВилла. Фото: Дмитрий Григорьев / ITMO NEWS
Сколько можно заработать на науке
— Каждый, кто приходит в команду, получает конкретную задачу и сразу включается в разработку. Всех участников мы официально трудоустраиваем, договоры заключаем на время конкретного проекта с последующим продлением. Ядро команды устойчиво, многие со временем начинают комбинировать работу по нескольким проектам. Начинающие сотрудники-магистранты получают 40–50 тысяч рублей в месяц, занимаясь поисковыми исследованиями. Когда сотрудник вырастает до уровня, на котором он вовлекается в технологические проекты, эта сумма утраивается, а когда человек начинает самостоятельно вести направление или отвечать за ключевой модуль, зарплата поднимается до 200–250 тысяч рублей в месяц.
Также работа в лаборатории дает возможность заниматься действительно актуальными задачами на переднем крае науки, профессионально расти в коллективе и в свободной атмосфере. В качестве бонуса: магистранты и аспиранты используют работу в лаборатории при подготовке диссертаций ― при этом им не нужно «выгрызать» времени на учебу, как это часто происходит при внешних совмещениях. Плюс проектная работа помогает закрывать университетские практики, дает готовый материал для курсовых, а также возможность попасть на стажировки к партнерам ― например, в Центр робототехники Сбера.
Если по окончании обучения ребята принимают решение «выйти в рынок», с этим мы тоже помогаем — тот же Сбер делает специальные офферы нашим выпускникам, а портфолио успешно реализованных проектов и топовые публикации в резюме помогают на любом собеседовании.
Сергей Колюбин у стенда для тестирования визуально-тактильных моделей управления, разрабатываемых совместно с Центром робототехники Сбера. Фото: Дмитрий Григорьев / ITMO NEWS
Как попасть в лабораторию
— Для тех, кто хочет к нам присоединиться, дважды в год (в сентябре–октябре и январе–феврале) мы открываем набор и публикуем объявления в нашем канале и группе ВКонтакте, где заодно рассказываем о новостях и ходе работ. Чтобы стать частью команды, присылайте мне на почту s.kolyubin@itmo.ru резюме и небольшое сопроводительное письмо. Опыт проектной работы будет плюсом, но важнее желание разбираться и расти.
Следующий шаг — тестовое задание, которое не только проверяет нужные навыки и знания, но и синхронизирует нас и кандидатов по ожиданиям. Например, в предыдущий раз мы специально составили тестовые задания так, чтобы кандидат мог решить их, только грамотно используя инструменты генеративного искусственного интеллекта. Нам важно увидеть, как человек мыслит, какими методами решает задачу и насколько осознанно пользуется технологиями. В действительности при правильно составленном задании чат-боты не маскируют незнание и отсутствие опыта, а наоборот ― очень хорошо его проявляют. Точно так же происходит и с отсутствием системного и критического мышления.
После успешного прохождения тестового задания мы приглашаем кандидатов на собеседование, где общаемся с глазу на глаз и принимаем окончательное решение, в какую исследовательскую группу в лаборатории и под какие задачи приглашать прошедших все ступени отбора.
Мы ждем и аспирантов, и магистрантов, и даже студентов бакалавриата. Для бакалавров работа в лаборатории ― хороший шанс уже с младших курсов поработать с настоящим оборудованием и начать участвовать в серьезных проектах, магистранты могут вести собственные исследования и публиковаться ― в том числе вместе с опытными сотрудниками, а наши аспиранты выходят на уровень статей A* и параллельно готовят диссертации. Многие после выпуска остаются у нас руководить группами.
