Suno запустила генерацию речи в публичной бете
Suno запустила функцию Speech в публичной бете на веб- и мобильных платформах. Она генерирует речь и фоновую музыку одновременно в одном треке. Максимальная длительность — около восьми минут.
- Suno открыла функцию Speech в публичной бете на веб- и мобильных платформах.
- Speech генерирует голос и музыку одновременно как единый трек.
- Максимальная длительность генерации речи — около восьми минут.

Suno, известная генератором музыки, выпустила функцию Speech в публичной бете. Она доступна на веб- и мобильных платформах и позволяет генерировать речь и фоновую музыку одновременно в одном треке.
«Музыка всегда будет в основе Suno и того, что мы создаём. При этом наше видение всегда охватывало и другие формы человеческого самовыражения, — сказал директор по продукту Suno Джек Броуди в анонсе. — Сегодня мы расширяем возможности Suno с помощью Speech: первой аудиомодели, которая генерирует голос и музыку вместе как один цельный трек».
Генерация речи с помощью ИИ не нова: DeepMind экспериментирует с синтезом речи на основе глубокого обучения уже десять лет, у Adobe есть инструмент текст-в-речь, а ElevenLabs стала одной из самых узнаваемых платформ в этой области с момента запуска в 2023 году. Suno выходит на этот рынок, вероятно, чтобы диверсифицировать платформу, поскольку её музыкальный генератор привлёк множество судебных исков.
Сочетание ИИ-музыки с генерируемыми голосами — это подход Suno к инструментам текст-в-речь. Фоновую музыку можно отключить переключателем, если нужна только чистая речь, но идея в том, что она дополнит определённые сценарии использования генеративной spoken word — например, спокойный саундтрек для стихов или более энергичный для драматичных озвучек и воодушевляющих речей.
Чтобы воспользоваться функцией, выберите вкладку «Create» и перейдите к опции Speech. Есть два режима: Simple, который позволяет описать желаемое в поле промпта (например, «пиратский капитан, воодушевляющий команду»), и Advanced, где можно добавить собственный сценарий, если вы точно знаете, что должно быть сказано. В расширенных настройках также можно настроить пол ИИ-голоса, стиль речи и степень вариативности каждой генерации. Максимальная длительность Speech — около восьми минут.
Suno признаёт, что функция далека от идеала, но обещает улучшать её с учётом отзывов пользователей. «Бета действительно означает бету, — сказал Броуди. — Иногда британские акценты могут уйти в Австралию и обратно. Драматические паузы могут быть очень драматичными. Вы почти наверняка найдёте применение этому, которое нам и в голову не приходило».
Вопросы и ответы
- Что такое Suno Speech?
- Функция генерации речи, которая создаёт голос и фоновую музыку одновременно в одном треке. Доступна в публичной бете на веб- и мобильных платформах Suno.
- Какие режимы есть в Speech?
- Simple — описание промпта, Advanced — собственный сценарий с настройками пола голоса, стиля речи и вариативности.
- Какова максимальная длительность генерации?
- Около восьми минут.



