Тульские ученые создают алгоритмы машинного обучения, объясняющие свои решения

Фото: ИА «Регион71»
В Тульской области исследователи Тульского государственного университета разрабатывают методы машинного обучения, которые обрабатывают большие массивы данных и объясняют, почему принято то или иное решение. Как сообщает пресс-служба ТулГУ, проект доцента кафедры информационной безопасности Института прикладной математики и компьютерных наук ТулГУ Валентины Сулимовой в 2026 году поддержал Российский научный фонд.
Данные накапливаются в больницах, лабораториях, банках и на производстве. Для их анализа нужны алгоритмы машинного обучения, которые находят закономерности и помогают принимать решения. Одна из распространенных задач — двухклассовое распознавание, когда объект нужно отнести к одной из двух групп: болен пациент или здоров, бракованная деталь или годная, мошенническая транзакция или легальная. Самый популярный инструмент для этого — нейронные сети.
Однако нейронные сети выдают результат, но не объясняют, на каком основании сделан вывод. Это важно в медицине. Ученые ТулГУ используют метод опорных векторов (SVM). Эта математическая модель прозрачна: можно понять, какие признаки объектов стали решающими, какие конкретно объекты повлияли на вывод системы и почему. У SVM есть и другие достоинства: он гибко настраивается под разные задачи, дает высокое качество решений и требует небольшого числа параметров. Но при больших объемах данных обучение модели идет слишком долго и требует больших вычислительных ресурсов.
По словам Валентины Сулимовой, в настоящее время не существует методов, которые, сохраняя все преимущества SVM, полностью решали бы проблему обучения на больших наборах данных, и проект направлен на восполнение этого пробела.
Исследователи ТулГУ предложили свою концепцию. Вместо загрузки всех данных сразу они разбивают большую задачу на множество небольших подзадач. Каждую решают независимо, а затем частные решения объединяют в единый результат, который полностью совпадает по структуре и свойствам с решением классического SVM. Это отличает подход от многих других, где точностью жертвуют ради скорости.
Такой подход дает два преимущества. Во-первых, задача любого размера решается на обычном компьютере, даже если данные не помещаются в оперативную память. Во-вторых, подзадачи можно решать параллельно, задействуя мощности многоядерных процессоров и распределенных вычислительных систем, что повышает производительность. В разрабатываемые алгоритмы встроен механизм автоматического отбора наиболее важных признаков. Он отсеивает шум и оставляет только те характеристики, которые влияют на результат. Это повышает точность и обобщающую способность системы.
Проект имеет практическую направленность. Разработанные методы планируют применять как минимум в двух сферах. В медицине новые алгоритмы помогут ставить диагнозы быстрее и надежнее: врач получит не просто ответ «болен или здоров», а объяснение, какие симптомы и показатели привели к такому заключению. В химической промышленности, в частности при производстве катализаторов, технология позволит прогнозировать свойства новых материалов, отсеивать неудачные варианты еще на этапе расчетов и тем самым экономить ресурсы и ускорять разработку.
В рамках проекта предстоит разработать комплекс новых методов, алгоритмов и высокопроизводительных программных средств. Работа рассчитана на несколько лет, и первые практические результаты уже могут появиться в ближайшее время.