Яндекс обучил системы распознавания голосовых команд не забывать старые запросы
Компания Яндекс представила новый метод, который позволяет обновлять список ключевых слов-триггеров в умных устройствах, сохраняя при этом способность распознавать уже известные команды. Описание исследования было представлено на международной конференции Interspeech 2026, проходящей с 27 сентября по 1 октября в Сиднее, как сообщает Telegram-канал «Яндекс». Об этом сообщает Togliatti24.
Специалисты Яндекса подчеркнули, что производителям умных колонок и других устройств с голосовым управлением необходимо регулярно расширять набор фраз, которые устройства могут распознавать без подключения к интернету. Обычно для этого требуется дообучение модели распознавания речи, что может привести к ухудшению распознавания уже знакомых команд, известному как «катастрофическое забывание».
Существующие методы непрерывного обучения, такие как эластичное закрепление весов (EWC), помогают уменьшить этот эффект, но не устраняют его полностью. Яндекс предложил альтернативный подход — модульное расширение модели, который решает проблему «катастрофического забывания» и требует меньше вычислительных ресурсов по сравнению с другими методами, такими как низкоранговая адаптация (LoRA) и адаптеры.
Суть метода заключается в добавлении небольшого нового модуля к нейросети, который отвечает за распознавание новых команд, используя промежуточные признаки основной модели, но имея свой собственный классификатор. Параметры базовой модели остаются неизменными, что позволяет сохранить результаты работы для старых команд. Новые команды добавляются за счет обучения дополнительного модуля.
Метод требует лишь небольшого увеличения размера нейросети — итоговый рост составляет менее 10%. Эффективность подхода была проверена на открытом датасете Google Speech Commands. В экспериментах модель научилась новым парам команд, сохранив при этом работу с уже поддерживаемыми словами. Новый метод снизил среднюю долю пропущенных новых команд с 6,46% до 4,37% по сравнению с отдельной моделью аналогичного размера и превзошел методы адаптеров и LoRA. При полном дообучении всей модели она хорошо усваивала новые команды, но значительно хуже распознавала старые: доля пропущенных команд из уже известных увеличивалась с 2,71% до 69,08%.
Исследователи считают, что данный подход может быть применен в умных колонках, бытовой технике, автомобильных голосовых помощниках и других устройствах с ограниченными вычислительными ресурсами.




