Создал виртуального исполнителя в нейросети и загрузил его в Apple Music: что получилось за месяц

Я Дмитрий, 30 лет, фронтендер из московского ИТ-офиса. К музыке отношения никакого: гитару пытался освоить в универе три месяца, бросил, в школе пел в хоре до момента, когда учительница попросила «петь тише, пожалуйста». Месяц назад я создал виртуального исполнителя с нуля, написал ему 12 песен через нейросеть и загрузил их в Apple Music, Spotify и ВК.Музыку. Зовут его Виталий Зимин. У него уже 4700 прослушиваний и три живых отзыва в комментариях.

Сейчас расскажу, как это получилось, сколько стоило, и почему один человек написал мне в Telegram «вы из Калуги?».

Почему вообще решил

Сидел читал на vc.ru статью про то, как кто-то запустил виртуальную инди-исполнительницу в Корее, и её треки крутятся в кофейнях. Подумал: «а у нас в России можно так же?». Полез разбираться.

Старт мастера клонирования голоса
Старт мастера клонирования голоса
Запись минуты речи с микрофона
Запись минуты речи с микрофона

Выяснил две вещи. Первая: технология есть. Российские платформы позволяют генерировать треки с собственным текстом, выбирать жанр, клонировать голос. Вторая: дистрибьюторов в Apple Music / Spotify куча, цены адекватные, никаких звукорежиссёров и студий не надо. То есть весь путь от «придумал артиста» до «появился в Apple Music» можно пройти за выходные.

Подумал: «а почему бы не попробовать на личном эксперименте?». Бюджет ограничил тремя тысячами рублей. Срок — месяц. Цель — не миллион прослушиваний, а понять, как это всё работает на маленьком масштабе. И посмотреть, как алгоритмы реагируют на «нового артиста» без истории.

Скриншот блокнота с заметками: имя, биография, концепция артиста
Скриншот блокнота с заметками: имя, биография, концепция артиста

Как придумал персонажа

Это оказалось самым сложным. Я думал, что это будет час работы. Потратил неделю.

Сначала пытался сделать «универсального» исполнителя — без географии, без возраста, без узнаваемых черт. Получилось плохо. Когда ты слушаешь песни от человека, ты автоматически достраиваешь его в голове. Если он никакой — песни никакие.

Переделал. Сел и написал биографию. Звать его Виталий Зимин. 28 лет. Родился в Архангельске, в 19 переехал в Питер, через пять лет уехал в Калугу — там жил у бабушки, бабушка умерла, остался в её квартире. Работает курьером в Самокат, по вечерам пишет песни на акустической гитаре. Инди-фолк с лёгким лоу-фай налётом. Темы — переезды, маленькие города, плохая погода, ощущение «между прошлой жизнью и будущей».

Ключевая фишка концепции — каждая песня про реальный город. Не Москва, не Питер. Калуга, Архангельск, Тверь, Кострома, Череповец, Тула, Псков, Великий Новгород. У каждой песни — конкретная локация в названии: «Калуга, минус 18», «Архангельск, зима», «Тверь, последний автобус».

Эта концепция оказалась той самой штукой, ради которой всё сработало. Об этом ниже.

Голос

Свой голос я в проект пихать не хотел. Я для своих фейспалмов в видосиках слишком узнаваем (у меня есть скромный канал на 1800 человек, не хотел смешивать).

Договорился с другом Виталиком (отсюда, кстати, имя артиста). Виталик работает менеджером в B2B, у него спокойный, чуть приглушённый голос, без явных особенностей. Идеально для инди-фолка. Заплатил ему за «час работы» 1500 рублей и пиццу.

Поехал к нему. Записали его минуту речи на ноутбучный микрофон. Платформа предложила контрольную фразу — что-то про «я разрешаю использовать мой голос». Виталик прочитал, при мне же. Это важно: никаких mp3 чужих людей туда нельзя загружать, только живая запись. Если кто-то пытается украсть голос знаменитости — система не пропустит.

Через две минуты у меня был voiceId Виталика. Дальше — этот голос можно ставить в любую песню, и он будет петь моим текстом.

Скриншот окна записи голоса с микрофоном и таймером 0:48 / 1:00
Скриншот окна записи голоса с микрофоном и таймером 0:48 / 1:00

Как писал тексты

За четыре вечера написал 12 текстов. Половина — почти полностью моя, половина — основа от нейросети, мной отредактированная.

Сценарий обычно такой: открываю на платформе генератор текста, описываю «грустная песня про парня, который уехал в Калугу к бабушке, бабушка умерла, он остался один в её квартире, на улице минус 18». Нейросеть выдаёт стихи в нужной длине, под куплеты-припев. Дальше я сижу и переписываю строчки, которые звучат «как из песни» (а не «как у живого человека»). Убираю штампы «холодный ветер», «одиночества цепь». Вставляю конкретику: «второй этаж, дверь скрипит как раньше», «синий халат на батарее».

Один трюк, который реально помог: в платформе есть функция маркировки ударений. Можно прямо в тексте написать «КалУга» (выделить нужный слог заглавной), и нейросеть прочитает правильно. Без этого она читала «КалугА», и это бесило.

12 текстов получилось так: 1. Калуга, минус 18 2. Архангельск, зима 3. Тверь, последний автобус 4. Кострома, серое утро 5. Череповец, дождь идёт неделю 6. Тула, пустой вокзал 7. Псков, поезд в 6 утра 8. Великий Новгород, снег 9. Бабушкина кухня (без города в названии, лирическая) 10. Письмо себе в 23 11. Ничего не изменилось 12. Возвращаюсь

Темы все в одной вселенной — переезды, провинция, осенне-зимняя меланхолия, чувство «между».

Генерация треков

Дальше — пошло быстро. Я заходил на платформу, описывал нужный жанр («инди-фолк, акустическая гитара, лёгкое пианино, лоу-фай налёт, спокойный темп, голос задумчивый»), вставлял свой текст, указывал voiceId Виталика. Нажимал. Через три минуты приходили два варианта.

Один трек = два алмаза = два варианта на одну попытку. Это удобно. Из двух всегда выбираешь лучший. Иногда оба норм, иногда один откровенно хуже (плохая гитара, странный голос).

Из 12 песен 8 я взял с первой генерации. 3 пришлось перегенерить один раз (где-то аранжировка не зашла). Одну — три раза, это была «Возвращаюсь», там я долго мучился с темпом.

Итого по алмазам: 12 песен × 2 алмаза + 5 перегенераций × 2 алмаза = 34 алмаза. Купил пакет 990 за 50, осталось 16 на запас.

Скриншот плеера на ноутбуке с 12 треками Виталия Зимина
Скриншот плеера на ноутбуке с 12 треками Виталия Зимина

Обложки

Здесь я мудрить не стал. На той же платформе есть генерация картинок. Я задал общий стиль: «зимний городской пейзаж, тёмные тона, кинематографичный кадр, кодак портра 400, без людей или редко человек со спины». Для каждого трека — свой кадр: вокзал, окно автобуса, заснеженный двор, бабушкина кухня с лампой.

Обложки получились в общей стилистике, что важно для альбома. У человека, который слушает плейлист, складывается ощущение «это один артист, у него своя визуальная подача».

Каждая обложка стоила 1 алмаз. 12 обложек — 12 алмазов. У меня в пакете уже был запас.

Главную обложку (для аватара артиста) сделал отдельную — Виталий со спины в зимней куртке, на фоне многоэтажки в спальном районе. Без лица. Это специально, чтобы не палиться: лицо у меня не было, и нанимать модель я не собирался.

Дистрибьютор

Этот шаг занял часа три. Выбрал одного из российских дистрибьюторов, который умеет заливать в Apple Music, Spotify, ВК.Музыку, Яндекс.Музыку и Boom. Имена не буду называть — у каждого свои условия, выбирайте по комиссиям.

Зарегистрировался, заполнил карточку артиста (имя Виталий Зимин, страна Россия, жанр Инди-фолк), загрузил 12 треков с обложками. Заполнил для каждого: ISRC, метаданные, копирайт (правда — «© Виталий Зимин, 2025», моё имя нигде не фигурирует, у меня с Виталиком устный договор).

Заплатил годовую подписку дистрибьютору — около 500 рублей. Это разовая трата, потом ничего платить не надо, проценты с прослушиваний остаются у меня (точнее у Виталика, но мы договорились пополам).

Через 7 дней треки появились в Apple Music. Через 9 — в Spotify. Через 11 — в Яндекс.Музыке. В Звуке — через 14 (там модерация злее).

Что произошло за месяц

Первые две недели — глухо. Прослушиваний по 20-30 в день. В основном я сам слушал из разных аккаунтов, чтобы убедиться, что всё работает.

На третьей неделе случилось то, ради чего я и затевал. Включились алгоритмы.

«Калуга, минус 18» попала в чью-то фолк-плейлист в Spotify. Не редакторскую, обычную пользовательскую, но на 2400 подписчиков. С этой плейлисты пошёл органический трафик: за 4 дня — 800 прослушиваний.

«Бабушкина кухня» поймала аналог в Apple Music — Apple Music Discover (там у них есть такие персональные плейлисты «вам может понравиться»). Прирост за неделю — 600 прослушиваний.

К концу месяца: - Apple Music: 1900 прослушиваний, 47 «сохранений» - Spotify: 1800 прослушиваний, 28 «follow» - Звук: 600 - Яндекс.Музыка: 400

Итого 4700 прослушиваний. Самый главный трек — «Калуга, минус 18», 1200 проигрываний.

Денег это пока принесло — около 600 рублей с дистрибьютора (ещё не пришли, придут в следующем платежном цикле). Окупится не скоро. Это не история про деньги.

Скриншот статистики из приложения дистрибьютора: цифры прослушиваний по платформам
Скриншот статистики из приложения дистрибьютора: цифры прослушиваний по платформам

Самое странное

На четвёртой неделе мне пришло сообщение в Telegram от незнакомого человека. Зовут Иван, написал: «Здравствуйте, я слушаю Виталия Зимина в Spotify. У меня знакомая работает в Калуге, на ул. Кирова, и ваш трек про минус 18, это прямо она. Вы из Калуги?»

Я завис. У меня была пауза в полторы минуты, прежде чем я понял, как отвечать. Сказал правду: «Виталий — собирательный образ, я не из Калуги, но писал с реальных историй друзей оттуда». Иван написал «всё равно круто, спасибо за треки».

Это был самый сильный момент эксперимента. Человек реально вложился в персонажа, считал его настоящим, посчитал нужным написать. Это сильнее, чем 4700 прослушиваний.

Два других отзыва в комментариях ВК.Музыки были такие: «Хорошо, надо ещё» и «Голос будто из 2000-х, спасибо». Никто не написал «фигня, ИИ». Никто не узнал, что это AI-музыка с клонированным голосом.

Сколько всего стоило

Считаю по статьям: - Голос Виталика — 1500 рублей + пицца - Алмазы (треки + перегенерации + обложки) — 990 рублей - Дистрибьютор годовая подписка — 500 рублей - Главная обложка артиста — уже в пакете алмазов

Итого: около 3000 рублей. На месяц работы (с задержками, потому что я работаю и спать иногда тоже надо), 12 треков в стримингах, 4700 прослушиваний и одно сообщение в Telegram от живого человека.

Время — точно не посчитал. По ощущениям 30-40 часов суммарно. Из них половина — на придумывание персонажа и тексты, остальное — на технические шаги.

Что я понял

Несколько мыслей по итогам.

Первое: персонаж важнее звука. Если бы я делал «треки без артиста» — никто бы не слушал. Биография, города, концепция «инди-фолк про переезды» — это то, что цепляет алгоритмы и людей. AI-треки без обвязки = информационный шум.

Второе: AI-музыка не даёт никаких преимуществ в качестве звука. Современный продакшн что у меня, что у любого живого инди-исполнителя на Soundcloud примерно одинаков. Преимущество — в скорости и стоимости. То, на что у живого артиста уходит полгода и 200 000 рублей (запись, мастеринг, обложки), у меня заняло месяц и 3 тысячи.

Третье: монетизация работает только при объёме. С 4700 прослушиваний я получу 600 рублей. Чтобы выйти на тысячу в месяц на одном артисте, нужно делать второго, третьего, пятого. Это превращается в небольшой издательский бизнес, и я не уверен, что готов так залипать.

Четвёртое: эмоциональная отдача от живой реакции человека, это то, ради чего, в принципе, всё. Если бы Иван не написал — эксперимент был бы интересным, но пустым. С его сообщением — стал имеющим смысл.

Что дальше

Эксперимент продолжаю. Виталий Зимин уже наработал минимальную аудиторию, и я собираюсь к лету выпустить ему второй EP — на четыре трека, в той же концепции, но смещённой летнюю сторону: «Череповец, июль», «Тверь, тёплый август». Посмотрим, как зайдёт другой сезон.

Параллельно думаю, стоит ли заводить второго артиста — в другом жанре, с другим голосом. Если да, это уже становится мини-лейблом. Стрёмно, но любопытно.

Если кому захочется попробовать — это вот этот сервис: Сонграйтер, российская платформа. Без VPN, оплата российскими картами. Две демо-песни новым дают бесплатно, чтобы пощупать. Голосовое клонирование там бесплатно, треки — от 12 рублей за штуку на максимальном пакете.

Главное — придумайте артиста. Не делайте «треки в воздух». Тогда что-нибудь да получится.