POST Audio Speech
Синтез речи из текста (Text-to-Speech)
/v1/audio/speech: здесь доступен полный диапазон speed (0.25–4.0) и согласованный набор параметров под каждое семейство моделей.
Те же возможности доступны и через общий Media API, но там часть параметров (speed, instructions, ElevenLabs-only поля) ведёт себя иначе или ограничена.Доступные модели
Разрешение голоса по семействам
Параметрvoice интерпретируется Polza в зависимости от семейства модели. Передача голоса «не из своего» семейства не приводит к ошибке тихо — голос приводится к дефолту семейства:
В релизе 1.6.7 на каталоге доступны OpenAI и ElevenLabs. Семейства Gemini TTS / Kokoro / MAI Voice поддержаны на уровне разрешения голоса, но включаются отдельно.
Параметры запроса
Параметры ElevenLabs
Примеры
Пример с ElevenLabs + timestamps
Ответ (200)
Полеusage.charactersприсутствует для посимвольных моделей (tts-1/tts-1-hd); для токенных (gpt-4o-mini-tts) составusageиной.
Пример ответа ElevenLabs с alignment
Генерация звуковых эффектов
Также доступна генерация звуков по текстовому описанию через тот же эндпоинт.Параметры
Форматы вывода
mp3_22050_32— MP3 22050Hz 32kbpsmp3_44100_32— MP3 22050Hz 32kbpsmp3_44100_64— MP3 44100Hz 64kbpsmp3_44100_128— MP3 44100Hz 128kbps (рекомендуется)mp3_44100_192— MP3 44100Hz 192kbps
Пример
Авторизации
API ключ передаётся в заголовке: Authorization: Bearer <POLZA_AI_API_KEY>
Тело
Текст для озвучивания (максимум 5000 символов)
5000"Привет! Это тестовое сообщение."
Голос для генерации речи. Допустимые значения зависят от модели: OpenAI (alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer, verse), ElevenLabs (Rachel, Aria, Roger, Sarah и др.)
"alloy"
ID модели для генерации речи
"tts-1"
Инструкции для управления характеристиками голоса. Поддерживается только для gpt-4o-mini-tts, не работает с tts-1 и tts-1-hd
4096"Говори медленно и выразительно"
Формат выходного аудио
mp3, opus, aac, flac, wav, pcm Скорость генерации речи (0.25 - 4.0)
0.25 <= x <= 41
Формат потоковой передачи аудио. Не поддерживается для tts-1 и tts-1-hd
sse, audio Уникальный идентификатор конечного пользователя для отслеживания и предотвращения злоупотреблений
"user-123"
Стабильность голоса (0-1). Только для ElevenLabs
0 <= x <= 10.5
Усиление схожести голоса (0-1). Только для ElevenLabs
0 <= x <= 10.75
Экспрессия стиля (0-1). Только для ElevenLabs
0 <= x <= 10
Возвращать временные метки для каждого слова. Только для ElevenLabs
false
Предшествующий текст для улучшения непрерывности речи при конкатенации. Только для ElevenLabs
5000Последующий текст для улучшения непрерывности речи при конкатенации. Только для ElevenLabs
5000Код языка ISO 639-1. Только для ElevenLabs Turbo v2.5
10"ru"
Ответ
Base64-encoded аудио данные
"SUQzBAAAAAAAI1RTU0UAAA..."
Content-Type аудио
"audio/mpeg"
ID использованной модели
"tts-1"
Длительность аудио в секундах (если известна)
5.2
Информация об использовании
Временные метки символов (при timestamps: true, ElevenLabs)