Создан инструмент для диагностики данных перед обучением ИИ-моделей

Служба новостей Автор статьи
Разработан новый инструмент для диагностики дан...

AI Сгенерировано ИИ

MaxДзенTelegram

Специалисты Центра практического искусственного интеллекта Сбербанка и Института AIRI разработали новый открытый инструмент, который помогает выявлять недостатки в данных до начала обучения рекомендательных моделей, а также оценивать, насколько результаты экспериментов применимы в реальных условиях. Об этом сообщается в пресс-релизе Сбера. Об этом сообщает издание ТАСС.

Научные сотрудники Центра практического искусственного интеллекта и Института AIRI представили SplitLight — инструмент для диагностики данных перед обучением и сравнением рекомендательных моделей.

Этот инструмент способен обнаруживать ошибки в логировании, смещенные временные метки и дублирующиеся события, которые могут негативно сказаться на итоговых метриках. Кроме того, с его помощью можно фиксировать важные статистические характеристики подхода к подготовке выборки, что способствует повышению воспроизводимости исследований и упрощает сопоставление результатов различных команд.

Еще одной важной функцией инструмента является оценка соответствия эксперимента реальным условиям эксплуатации. Система помогает выявить, не попали ли в обучающую выборку данные из будущего, учитываются ли новые пользователи и объекты, а также насколько различаются тренировочная и валидационная выборки.

По словам Сергея Рябова, старшего управляющего директора и директора по AI-трансформации Сбербанка, для продуктовых команд в маркетплейсах, стримингах и медиа этот инструмент представляет собой надежную защиту перед проведением дорогостоящих экспериментов: быстрая проверка данных, выбор корректного сплита и подтверждение того, что тест приближен к реальности. Это снижает риск внедрения моделей, которые могут быть эффективны только на бумаге. Для исследовательских групп SplitLight упрощает документирование, воспроизводимость и сравнение с публикациями, а также позволяет анализировать сторонние датасеты для адекватной оценки своих решений.

Команда проекта, возглавляемая Алексеем Васильевым, исполнительным директором по исследованию данных Центра практического искусственного интеллекта Сбербанка, протестировала SplitLight на шести популярных открытых наборах данных. Результаты тестирования показали, что даже небольшие изменения в разбиении данных могут существенно повлиять на метрики и оценку качества модели.

MaxДзенTelegramВКонтактеОдноклассники