Skip to main content
Российский провайдер расшифровки речи с разбивкой по спикерам (диаризацией). В отличие от Whisper, работает асинхронно: запрос ставит задачу в очередь и сразу возвращает id, а готовый текст вы забираете отдельным запросом.
Статус задачи опрашивайте на GET /api/v1/audio/transcriptions/{id}не на /api/v1/media/{id}. Media API обслуживает картинки, видео и музыку; для транскрипции он вернёт ошибку RESULT_EXPIRED, хотя текст на самом деле готов.

Обзор

Какую модель выбрать

Тарификация — по целым минутам с округлением вверх, минимум одна минута. Запись на 15 секунд стоит как минута.

Возможности

Диаризация

Разбивка расшифровки по спикерам с таймкодами

Длинные записи

Совещания и интервью целиком, без нарезки на куски

LLM-анализ

Саммари и выводы по готовой расшифровке одним запросом

Хранение результата

Текст доступен по id и через неделю, и через месяц

Как это работает

1

Отправка аудио

POST /api/v1/audio/transcriptions возвращает id задачи и статус processing
2

Опрос статуса

GET /api/v1/audio/transcriptions/{id} — раз в 5–10 секунд, пока статус processing
3

Результат

При статусе completed в ответе появляются text, duration и segments со спикерами

Полный пример

Параметры запроса

Параметр response_format на асинхронных моделях не применяется: ответ всегда приходит в собственном формате с полем segments. Значения вроде diarized_json игнорируются — диаризация включена по умолчанию.

Ссылка или base64

Передать file можно двумя способами, и выбор влияет на ограничения:
  • base64 — файл идёт телом запроса, потолок 50 МБ. Подходит для файлов с диска.
  • прямая ссылка — провайдер скачивает аудио сам, лимит платформы на размер не действует. Подходит для длинных записей. Ссылка должна быть доступна извне без авторизации: приватные адреса и ссылки из внутренней сети провайдер скачать не сможет, и задача завершится ошибкой.

Ответ на создание задачи

Сохраните id — это единственный способ забрать результат.

Ответ при опросе статуса

Поля ответа

Метки спикеров (SPEAKER_01, SPEAKER_02) назначаются автоматически и не сопоставляются с именами людей. Сопоставить их с реальными участниками — задача вашего приложения.

LLM-анализ расшифровки

По готовой транскрипции можно сразу получить саммари, список решений или любой другой разбор — отдельный запрос, без пересылки текста туда-обратно.
Ответ:
Анализ доступен только для расшифровок в статусе completed и тарифицируется отдельно, по цене выбранной модели.

Текстовые модели Aiesa

Те же модели доступны и в обычном чате через Chat Completions:

Частые вопросы

Нет. Эта ошибка означает, что вы опрашиваете /api/v1/media/{id} — эндпоинт для картинок и видео. Расшифровка хранится отдельно: запросите /api/v1/audio/transcriptions/{id}, и текст будет на месте. Упоминание про «7 дней» в этом сообщении к расшифровке не относится.
Задача принадлежит той организации, из-под которой была создана. Убедитесь, что опрашиваете статус тем же API-ключом, которым отправляли аудио.
Текст и сегменты хранятся на нашей стороне вместе с записью о генерации и остаются доступны по id после того, как исходные файлы у провайдера будут удалены. Ограничение в 7 дней, о котором говорит Media API, к расшифровке не относится.
Обычно — от десятков секунд до нескольких минут, в зависимости от длины записи и загрузки очереди. Если результат не пришёл примерно за 13 минут, задача переходит в failed, а зарезервированные средства возвращаются на баланс.
Чаще всего причина — недоступная ссылка на аудио либо повреждённый файл. Проверьте, что ссылка открывается из внешней сети без авторизации, а файл проигрывается. Списания за неудачную задачу не происходит.

Следующие шаги

Транскрипция аудио

Полное описание эндпоинта и синхронные модели

Каталог моделей

Все доступные модели и актуальные цены