# Z.ai: GLM 5V Turbo

> Мультимодальная модель анализирует изображения и видео, помогает разрабатывать интерфейсы по визуальным примерам и решать задачи через агентные сценарии.

- **ID для API:** `z-ai/glm-5v-turbo`
- **Тип Модели:** Чат-модель
- **Контекст:** 202 752 токенов
- **Максимум на ответ:** 131 072 токенов
- **Вход:** изображение, текст, видео → **Выход:** текст

## Описание

#### Суть
GLM-5V-Turbo — мультимодальная модель Z.ai для задач, где программирование опирается на визуальное восприятие. Она принимает текст, изображения и видео, а также предназначена для планирования последовательности действий и работы в агентных сценариях. На выходе модель формирует текст, в том числе объяснения и код.

#### Сильные стороны
Модель может разбирать макеты, скриншоты и элементы интерфейса, а затем создавать код по визуальному образцу. В документации Z.ai также описаны отладка страниц по скриншотам, самостоятельное изучение сайтов агентом с последующим воссозданием интерфейса и визуальная привязка текстового запроса к области изображения. Для агентных задач модель рассчитана на связку восприятия, планирования и выполнения шагов.

#### Контекст и модальности
По данным каталога, контекст составляет 202 752 токена, а максимальный объём генерации — 131 072 токена. Входные данные: текст, изображения и видео; выход — текст. Это позволяет передавать визуальный материал вместе с инструкцией и получать текстовый анализ или код.

#### Типовые сценарии
Подходящие задачи — создание веб-страниц по макету или референсному изображению, разбор структуры и поведения интерфейса, поиск визуальных ошибок вёрстки и подготовка исправлений. В агентных рабочих процессах модель может помогать исследовать страницы, фиксировать переходы и особенности взаимодействия, а затем использовать результаты для реализации. Также в документации перечислены описание изображений, визуальный поиск объектов и работа с документами.

#### Ограничения
Модель выдаёт текст, а не готовое изображение или видео. Для автономного просмотра сайтов и выполнения действий требуется подходящая агентная среда или инструменты: сама модель может участвовать в таком цикле, но каталог не указывает на выполнение внешних действий без интеграции. Качество результата зависит от ясности инструкции и предоставленных материалов.

#### Отличие от соседей по семейству
В отличие от GLM-5-Turbo, который Z.ai описывает как текстовую модель, оптимизированную для сценариев OpenClaw, GLM-5V-Turbo принимает также визуальные данные и ориентирован на vision-based coding. Его задача — связать восприятие интерфейса или видео с кодированием и агентным планированием, а не только работать с текстом.

## Цены

- Запрос / 1М: 141,99 ₽
- Ответ / 1М: 473,31 ₽
- Чтение кэша / 1М: 28,4 ₽

## Параметры

reasoning, include_reasoning, max_tokens, temperature, top_p, tools, tool_choice, response_format, top_k

## Провайдеры

Выбрать Провайдера можно параметром `provider` в запросе.

| Провайдер | Цена | Контекст | Макс. ответ | Данные в РФ | 152-ФЗ |
| --- | --- | --- | --- | --- | --- |
| z-ai/fp8 | Запрос / 1М: 141,99 ₽; Ответ / 1М: 473,31 ₽ | 202 752 | 131 072 | — | — |

## Быстрый старт

```bash
curl https://polza.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $POLZA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "z-ai/glm-5v-turbo",
  "messages": [
    {
      "role": "user",
      "content": "Привет"
    }
  ]
}'
```

## Ссылки

- Страница: https://polza.ai/models/z-ai/glm-5v-turbo
- Каталог: https://polza.ai/models
