В больницах и поликлиниках медицинские сведения о пациенте — анализы, таблицы с результатами обследований, рукописные заключения врачей и выписки из разных учреждений — редко формируются и хранятся в едином формате. Чтобы использовать эти данные для обучения искусственного интеллекта, например, для создания инструментов, помогающих врачам ставить диагнозы или предсказывать развитие болезней, нужна долгая подготовка. Разработчикам зачастую приходится вручную собирать данные для дальнейшей работы с ИИ. В клиниках похожая ситуация: врачу нужно пересмотреть десятки документов из разных источников, прежде чем восстановить полную картину болезни. Решить эти рутинные процессы может автоматизация сбора медицинских данных из разных источников.
«Основная сложность работы с медицинскими данными — их разнообразие и разрозненность. Сложность не в том, чтобы обработать один конкретный документ, а в том, что их много и они очень разные. Когда разработчик получает от врачей большой объем данных, 60–70% времени, отведенного на обучение модели, уходит только на подготовку материала. Нужно очистить документы от персональных данных и технических пометок, привести все записи к единому формату и разметить ключевые медицинские сведения — диагнозы, симптомы, назначения, результаты анализов. MAS-EHR как раз нужен для того, чтобы этот этап ускорить и упростить», — рассказал один из разработчиков платформы, студент Института прикладных компьютерных наук, программы «Глубокое обучение и генеративный искусственный интеллект» ИТМО Иван Золин.
Примеры интерпретируемых результатов работы на реальных данных отдельных агентов системы MAS-EHR. Схема предоставлена Иваном Золиным
Платформа MAS-EHR (Multi-Agent System for Electronic Health Records — мультиагентная система для обработки электронных медицинских записей) состоит из независимых модулей, и обработка данных в ней выстроена в несколько шагов. Один модуль отвечает за оптическое распознавание: он считывает текст из сканов и таблиц и переводит его в машиночитаемый вид. Второй находит и скрывает персональные данные пациента. Третий подключает языковые модели — они вытаскивают из текста ключевые медицинские сведения: диагнозы, симптомы, назначения, результаты анализов — и связывают их между собой по смыслу. На этом же шаге термины приводятся к международным стандартам вроде классификаторов болезней (МКБ-10) и SNOMED CT — единым справочникам болезней и клинических понятий. На последнем шаге специальный проверочный модуль на базе LLM (агент-валидатор) сверяет получившуюся структуру с исходным документом.
Если часть данных потерялась или модель что-то домыслила, система сигнализирует об этом и возвращает фрагмент на повторную обработку. Такая сборка позволяет менять или дообучать отдельные компоненты платформы, не трогая остальную систему, и легко встраивать ее в существующие ИТ-решения клиник — например, в электронные медицинские карты.
Пример работы системы выглядит так: в нее загружают результаты анализов пациента за несколько месяцев. MAS-EHR извлекает оттуда конкретные показатели, сопоставляет их с диагнозами и симптомами из других документов и связывает их в общую схему. В итоге получается целостная картина: видно, как менялось состояние пациента, какие рекомендации давал врач и как на них реагировал организм. Такое представление данных удобно и самому врачу для быстрого понимания истории болезни, и разработчикам медицинских AI-сервисов для обучения моделей.
«Крупные технологические корпорации разрабатывают собственные облачные медицинские сервисы по обработке документов, но в них пользователь получает готовый ответ и не знает, как он получен и не ошиблась ли модель. В MAS-EHR иначе: врач или разработчик может на каждом этапе проследить, что происходит с данными. Сначала проверяется, как считался текст, потом — как прошла анонимизация, затем — что именно извлекли и как связали сущности. На финальном этапе валидатор сравнивает исходный документ с результатом. При этом за счет компактных дообученных моделей система работает быстрее и потребляет меньше ресурсов, чем тяжелые универсальные решения», — пояснил Иван Золин.
Иван Золин на награждении. Фото из личного архива автора
Разработка системы велась в лаборатории «Цифровые технологии в общественном здоровье» ИТМО. Вместе с Иваном над проектом работали студент магистратуры ИТМО «Управление ИИ-продуктами» Владимир Скворцов, разработчик лаборатории Артур Файзрахманов, а также научный руководитель Ивана Вячеслав Чуканов. Лаборатория обеспечила доступ к обезличенным медицинским данным и дала экспертизу со стороны практикующих врачей из Клиники Фомина и НМИЦ онкологии им. Н.Н. Петрова. Их обратная связь помогла понять, как платформа должна работать в реальных клинических условиях и какие данные важны врачам в первую очередь.
Иван Золин представил платформу на международной университетской премии в области искусственного интеллекта и больших данных «Гравитация». Проект победил в молодежном треке и привлек внимание нескольких крупных московских клиник — с ними сейчас ведутся переговоры о пилотном внедрении.
«Основная задача нашей платформы — это наводить порядок там, где сейчас хаос. Мы превращаем разрозненную медицинскую документацию в единый структурированный источник данных о здоровье человека, согласованный с общепринятыми в сфере здравоохранения онтологиями, номенклатурами и справочниками, чтобы эти данные можно было затем эффективно использовать в исследованиях, аналитике и медицинских ИИ‑системах», — поделилась кандидат физико-математических наук, руководитель лаборатории «Цифровые технологии в общественном здоровье» ИТМО Анна Андрейченко.
Анна Андрейченко. Фото: Дмитрий Григорьев / ITMO NEWS
В дальнейшем научная группа лаборатории планирует доработать проект и научить платформу не только собирать историю болезни, но и прогнозировать возможное развитие заболеваний.
