Искусственный интеллект раскрывает музыкальные «отпечатки пальцев» и распознаёт джазовых музыкантов
Исследование показывает, что модель машинного обучения способна с точностью 94,4% распознавать джазовых пианистов по аудиозаписям и выявлять их уникальные музыкальные особенности.
Short Summary
Издательство Springer Nature опубликовало в научном журнале «Nature Machine Intelligence» исследование, которое показывает, что модели машинного обучения способны идентифицировать исполнение 20 известных джазовых пианистов по аудиозаписям с точностью до 94,4 %. Исследование было проведено сотрудниками Кембриджского университета в Великобритании — Хувом Честоном, Рубеном Бэнсом и Питером М. С. Харрисоном, которые проанализировали набор данных, включающий 1629 исполнений и в общей сложности 84 часа аудиозаписей.
В рамках исследования аудиозаписи были преобразованы в формат MIDI «piano roll», чтобы в цифровом виде представить время исполнения и высоту звука нот. Лучшая модель продемонстрировала точность распознавания в 94,4 %, а более интерпретируемая модель, способная разделять мелодию, гармонию, ритм и динамику, достигла точности в 91,3 %. В отдельных тестах наиболее высокой оказалась точность предсказания гармонии, за ней следовали ритм и мелодия, а наименьшая точность была у предсказания динамики. Исследователи отмечают, что джаз, объединяющий композицию, импровизацию и стиль исполнения, является идеальным объектом для изучения «отпечатков пальцев» в музыке.
Исследование может предложить новые подходы к определению принадлежности артистов, анализу стилей, культурных традиций и музыкальному образованию. Исследовательская группа также опубликовала открытые модели и веб-приложения для интерпретации результатов исследования. Однако авторы статьи предупреждают, что музыкальные параметры, такие как мелодия и гармония, могут перекрываться, а формат MIDI не способен охватить такие аспекты, как вибрато и изгибы высоты звука. Будущие исследования могут быть распространены на другие музыкальные жанры, инструменты, исторический контекст и недостаточно представленных музыкантов.
Высокая точность распознавания
Лучшая модель машинного обучения способна идентифицировать 20 джазовых пианистов по аудиозаписям с точностью 94,4 %
Доминирующие характеристики
Среди параметров — гармония, ритм, мелодия и динамика — наивысшая точность предсказания наблюдается у гармонии, а наименьшая — у динамики
Методы исследования
Аудиозаписи были преобразованы в формат MIDI «piano roll», что позволило моделям анализировать время исполнения и высоту звука нот
Открытые ресурсы
Исследовательская группа опубликовала открытые модели и веб-приложения, чтобы другие исследователи могли интерпретировать и воспроизвести результаты
Text generated using AI

