Нейросеть опознала джазовых пианистов по «почерку»

Служба новостей Автор статьи
Британские исследователи обучили нейросети расп...

Фото с сайта pixabay.com

MaxДзенTelegram

Исследователи из Великобритании обучили алгоритмы машинного обучения для распознавания джазовых пианистов по их индивидуальному стилю исполнения. Наилучшие результаты продемонстрировала сверточная нейросеть, которая определяла исполнителя на ранее не встречавшихся записях с точностью свыше 94 процентов. Кроме того, была разработана модель, анализирующая мелодию, гармонию, ритм и динамику произведения, что позволяет оценить вклад этих компонентов в уникальный стиль музыкантов. Статья опубликована в журнале Nature Machine Intelligence. Также создано веб-приложение, позволяющее прослушать характерные особенности игры каждого из 20 пианистов. Об этом сообщает N + 1.

Каждый художник, писатель или композитор обладает набором приемов, позволяющих идентифицировать его работы. В живописи это может быть выбор сюжета и цветовая палитра, а в литературе — синтаксические конструкции и любимые слова. В музыке «почерк» проявляется в гармонических последовательностях, ритмических структурах и мелодических оборотах. Эти элементы образуют уникальный отпечаток, по которому специалисты могут определить автора произведения. Однако ручные исследования занимают много времени, и некоторые детали, такие как микроскопические отклонения в ритме, могут ускользать от внимания.

Исследователи под руководством Питера Харрисона из Кембриджского университета решили использовать методы машинного обучения для выявления творческих отпечатков в джазе. В качестве исходных данных был использован набор из 84 часов записей 20 исполнителей, включая Билла Эванса, Оскара Питерсона, Телониуса Монка и Кита Джарретта. Данные включали как сольные выступления, так и записи в составе трио. Аудиофайлы были конвертированы в формат MIDI, что позволяет сохранить мелодические, гармонические, ритмические и динамические особенности исполнения, исключая несущественные данные, такие как условия звукозаписи или особенности звучания инструмента.

Для извлечения информации о творческом «почерке» пианистов были применены два подхода. Первый использовал классические алгоритмы машинного обучения, такие как случайный лес и логистическая регрессия, для поиска характерных мелодических фрагментов и аккордов. Из каждой записи выделялись короткие мелодические обороты, которые затем сравнивались по частоте использования у разных пианистов, исключая общие элементы. Второй подход основывался на сверточных нейронных сетях, обученных на 30-секундных фрагментах, представленных в виде двумерного аналога перфорированного рулона для механического пианино. Для предотвращения переобучения авторы изменяли высоту нот, время их начала и другие параметры. Вычисления проводились на видеокарте NVIDIA A100.

Среди классических методов наилучшие результаты показала логистическая регрессия, позволяющая определить исполнителя в 77 процентах случаев. Хотя этот показатель сравнительно низкий, метод позволил выявить, какие приемы используют конкретные музыканты. Например, в игре Билла Эванса алгоритм выделил нисходящие арпеджио септаккордов, встречающиеся в записях 128 раз, тогда как у других пианистов — реже. У Оскара Питерсона модель отметила прием опевания целевых нот, при котором музыкант подходит к нужной ноте через соседние звуки. Эти наблюдения совпадают с мнением экспертов о стиле этих исполнителей.

Среди нейросетевых моделей лучшей оказалась сверточная нейросеть ResNet с 50 слоями. Она оценивала вероятность того, что каждый 30-секундный фрагмент сыграл один из 20 пианистов, усредняя результаты. Эта модель правильно угадывала исполнителя в ранее не встречавшихся записях в 94,4 процента случаев, а для отдельных фрагментов точность составила 80,5 процента. Однако интерпретация работы такой нейросети оказалась сложной — трудно понять, какие приемы в игре пианиста влияют на результаты. Поэтому исследователи разработали более интерпретируемую архитектуру, выделив четыре представления, отвечающие за мелодию, гармонию, ритм и динамику исполнения. Каждое из них обрабатывала отдельная подсеть, а затем результаты объединялись.

Лучшая версия этой модели достигла точности 91,3 процента. Отключая подсети по очереди, исследователи оценили вклад различных компонентов исполнения. Выяснилось, что только по гармонии можно распознать пианиста в 74 процентах случаев. Наибольшую дополнительную информацию дает ритм, а наименьшую — динамика. В будущем разработчики алгоритма планируют расширить набор анализируемых инструментов и применить этот подход к изучению творчества других исполнителей.

Нейросети также могут быть использованы для воссоздания звука по беззвучному видео игры на фортепиано. Американские разработчики представили такой алгоритм в 2020 году.

MaxДзенTelegramВКонтактеОдноклассники