Когда песня перестаёт усиливать стихотворение

Ещё несколько лет назад музыкальная версия стихотворения могла сама по себе быть событием. Текст переставал существовать только на странице: появлялись голос, гармония, аранжировка, возможность услышать произведение во времени.
 
Генеративные музыкальные сервисы резко снизили стоимость такого преобразования. Теперь для того, чтобы превратить стихотворение в законченную песню, необязательно искать композитора, исполнителя, записывать вокал или самостоятельно осваивать музыкальное производство.
 
На первый взгляд всё выглядит почти идеально: у текста появляется ещё один канал — его можно не только читать, но и слушать.
 
Важно сразу сделать оговорку: исследований именно о SUNO-подобных песнях на литературных сайтах почти нет. Поэтому дальше речь скорее о нескольких возможных механизмах, а не о доказанной причинно-следственной связи.
 
Ниже — несколько факторов, которые могут объяснить, почему ожидаемый эффект усиления может довольно быстро ослабевать.

Эффект новизны закончился.

Первый механизм довольно простой: ценность дополнительного формата зависит не только от его качества, но и от его редкости.
 
Когда музыкальное сопровождение делают единицы, наличие песни отличает одну публикацию от десятков соседних. Когда то же самое начинают делать многие, признак перестаёт работать как признак. По моему довольно субъективному наблюдению, на литературных сайтах аудиосопровождение от SUNO-подобных сервисов сейчас встречается уже примерно у каждого третьего-четвёртого автора. Точных данных по этому поводу у меня, конечно, нет.
 
Насколько массовой вообще стала генеративная музыка, хорошо видно уже по стриминговым сервисам. В апреле 2026 года Deezer сообщал примерно о 75 тысячах полностью AI-сгенерированных треков в сутки — около 44% всех новых загрузок. Уже в июне их число приблизилось к 90 тысячам в сутки, а в пиковые дни такие композиции впервые составили более половины всей новой музыки, поступавшей на платформу. Для сравнения: в начале 2025 года Deezer фиксировал около 10 тысяч AI-треков ежедневно. Таким образом, менее чем за полтора года ежедневный поток вырос примерно в девять раз.
 
Deezer остаётся одним из немногих сервисов, регулярно публикующих прямую статистику по доле полностью AI-сгенерированной музыки, поэтому механически переносить его 50% на Spotify, Apple Music или другие платформы нельзя. У других сервисов нет такой удобной прямой статистики, но косвенные признаки того же процесса есть.
 
Например, Spotify сообщил, что за двенадцать месяцев, пришедшихся на период быстрого распространения генеративных инструментов, удалил более 75 миллионов спам-треков. Это не статистика AI-музыки — значительная часть такого спама могла иметь и другое происхождение. Но сам Spotify, однако, отдельно связывает усиление массовых загрузок с тем, что генеративные инструменты резко упростили производство больших объёмов музыки. В ответ сервис ввёл отдельную систему фильтрации массовых загрузок и низкокачественного контента.
 
И другие платформы уже начали на этот поток реагировать. Tidal летом 2026 года начал маркировать полностью AI-сгенерированные записи и отказался начислять им роялти; среди причин сервис прямо называет приток генеративного контента и высокообъёмные загрузки. Bandcamp пошёл ещё дальше: с января 2026 года музыка, созданная полностью или в значительной степени генеративным ИИ, на площадке вообще не допускается. Эти меры сами по себе ничего не говорят о художественном качестве такой музыки, но показывают, что её массовое производство уже стало для платформ самостоятельным инфраструктурным вопросом.
 
Статистика не доказывает, что песня, сделанная в SUNO, сама по себе ухудшает показатели стихотворения. Она показывает другое: сам факт существования ещё одной законченной песни быстро перестаёт быть дефицитным событием. Объём музыкального контента растёт очень быстро, тогда как внимание аудитории остаётся ограниченным. Поэтому простая логика «к стихотворению прикреплена ещё и песня — значит, его заметят сильнее» по мере насыщения среды, скорее всего, работает всё хуже.
 
Иными словами, дополнительный аудиоформат сохраняет потенциальную ценность, но всё хуже работает просто как маркер необычности. Чтобы музыкальная версия действительно усиливала текст, всё важнее становится уже не сам факт её наличия, а то, даёт ли она слушателю что-то, чего не давало исходное стихотворение.
Высокая правдоподобность — не то же самое, что высокая выразительность
Со звуком у современных генераторов как раз всё стало довольно хорошо. SUNO уже вполне способен выдать связный, жанрово узнаваемый и технически убедительный трек. Поэтому списать проблему на «нейросеть просто плохо делает музыку» не получится. Если проблема здесь и есть, то она тоньше: генеративная модель решает несколько иную задачу, чем композитор, работающий непосредственно с конкретным стихотворением.
 
Если говорить языком машинного обучения, модель получает conditioning — набор условий, которые задаёт пользователь: жанр, настроение, темп, инструменты, текст песни и другие параметры. Но одного conditioning недостаточно: запрос почти всегда оставляет огромное количество вещей недоопределёнными. Их модель достраивает, опираясь на собственный model prior — статистические предпочтения, усвоенные в ходе обучения. То есть пользователь может указать жанр, настроение и текст, но не сказать, каким будет конкретный переход, насколько плотной окажется аранжировка или как поведёт себя вокал через двадцать секунд. Всё это всё равно кто-то должен решить. В данном случае — модель.
 
Кроме правдоподобности есть ещё один параметр — индивидуальность.
 
В августе 2026 года исследователи Стэнфорда сравнили Suno и Google Lyria 3 с человеческой музыкой в четырёх жанрах: Afrobeats, K-pop, dance pop и heavy metal. Для каждого жанра и каждой системы было сгенерировано по сто треков, после чего музыку анализировали с помощью 72 MIR-признаков — вычисляемых характеристик ритма, тайминга, спектра, тембра, динамики и других свойств.
 
Результат оказался не совсем таким, какого можно ожидать от популярного тезиса «нейросети всё усредняют». Внутри каждого жанра у Suno разнообразие не схлопнулось: отдельные треки действительно отличались. Зато сами жанры оказались слабее отделены друг от друга, чем в человеческой выборке. Иначе говоря, модель сохраняла вариативность, но часть жанровой специфики сглаживалась. Причём отдельный классификатор, обученный на акустических признаках, почти безошибочно отличал AI-треки от человеческих.
 
В рамках этой выборки результаты указывают на собственный статистический почерк модели, сохраняющийся поверх разных запросов. На языке deep learning это удобно описывать через learned prior: модель не только исполняет запрос, но и достраивает недостающие решения тем способом, которому научилась на данных.
 
Отсюда ещё нельзя сделать вывод, что слушателю такая музыка нравится меньше. Здесь начинается уже гипотеза. Если эти устойчивые предпочтения снова и снова проступают в разных генерациях, они могут действовать не как явное «всё одинаковое», а опять же тоньше — снижать элемент неожиданности.
 
Отдельная песня при этом вполне может понравиться — быть мелодичной, хорошо звучать, запоминаться. Если такой эффект действительно существует, логично ожидать, что заметнее всего он проявится на дистанции: после десятков подобных генераций какие-то ходы начинают быстрее узнаваться. Не настолько, чтобы раздражать. Скорее настолько, чтобы очередной трек чуть раньше перестал быть любопытным.
 
Важно подчеркнуть: это не прямой вывод из приведённого исследования, а возможная интерпретация его результатов. Работа показывает устойчивые различия в акустических признаках, но не измеряет интерес слушателя во времени. Тем не менее такая гипотеза хорошо согласуется с самим устройством генеративной системы: модель должна не только следовать запросу, но и постоянно заполнять огромный объём недоопределённых решений собственными наиболее вероятными вариантами.
 
Возможно, поэтому проблема генеративного аудиосопровождения лежит не столько в эффекте «это плохо», сколько в куда менее заметном эффекте «это не удержало внимание». Такой трек не обязательно хочется выключить. Просто он может дать меньше причин дослушать его до конца, переслушать или вернуться после него к самому стихотворению.

Что из этого может следовать?

Всё это не позволяет сделать однозначный вывод о том, что генеративное музыкальное сопровождение «работает» или «не работает» для стихотворения. Тем более из этого не следует, что музыка, созданная человеком, автоматически окажется эффективнее. Речь идёт о двух изменениях, которые происходят одновременно.
 
Во-первых, сама музыкальная версия текста становится значительно менее редким явлением. Поэтому наличие песни постепенно теряет способность привлекать внимание просто за счёт необычности формата.
 
Во-вторых, современные генеративные модели обладают собственными статистическими предпочтениями, которые могут проявляться даже при достаточно разнообразных результатах. Можно предположить, что при массовом прослушивании это иногда уменьшает ощущение неожиданности и быстрее снижает интерес, хотя прямых исследований такого эффекта пока нет.
 
В итоге я бы говорил не о «неэффективности» SUNO-сопровождений вообще, а о снижении их прежнего преимущества. Музыкальная версия всё ещё может удачно дополнить стихотворение и привлечь к нему внимание. Просто самого факта её наличия теперь, похоже, недостаточно, чтобы заметно выделить публикацию среди остальных. А что здесь играет большую роль — особенности генеративной музыки, насыщение аудитории, конкретное качество трека или всё сразу, — пока остаётся открытым вопросом.

------------------------------------------
Изображение сгенерировано AI (ChatGPT)


Рецензии
Хорошая тема! Своевременная!
Но спешу успокоить, всё равно люди рано или поздно от всех искусственных новшеств в быту и искусстве возвращаются к "ручной работе" и всему натуральному. В 70-е нейлон, кримплен и трикотин стали вытеснять натуральные ткани, все радостно ринулись их носить, в итоге всё равно вернулись к хлопку и шерсти, бегут от синтетики, если хотят улучшить жизнь. То же самое - когда пришёл компьютор, все радостно кинулись фотошопить картиночки. Но покупают дороже картины, написанные белыми ручками маслом по холсту или акварели. Скоро и акрил выйдет из моды, вот увидите) И мебель, и пол снова больше ценят из натурального дерева, а не МДФ или ЛДСП.
То же самое было с ИИ-картинками - не прошло и трёх лет, как они всем надоели. И нейро-тексты ещё не успели опериться, как они уже надоели людям. Люди чувствуют искусственность, в итоге генеративность воспринимается как дегенеративность)

Маргарита Беломыцкая   28.09.2026 19:27   •   Заявить о нарушении
Ну да. Того же мнения. Оно, конечно, хорошо. Но человеческое собранное лучше и ценнее.

Александр Трошин 2   28.09.2026 20:56   Заявить о нарушении