# DeepSeek: DeepSeek V4 Flash Vision Exp

> Принимает изображения и текст, отвечает текстом: подходит для описания визуального содержимого, чтения скриншотов и анализа диаграмм в диалогах и агентных сценариях.

- **ID для API:** `deepseek/deepseek-v4-flash-vision-exp`
- **Тип Модели:** Чат-модель
- **Контекст:** 1 048 576 токенов
- **Максимум на ответ:** 262 144 токенов
- **Вход:** текст, изображение → **Выход:** текст

## Описание

#### Суть
Экспериментальная мультимодальная версия DeepSeek Flash, предназначенная для работы с изображениями и текстом в одном запросе. Модель может интерпретировать визуальный материал и формировать текстовый ответ. Разработчик указывал, что её текстовые возможности, включая рассуждения, знания о мире и работу в агентных сценариях, соответствуют базовой Flash-модели.

#### Сильные стороны
Визуальное понимание дополняет привычную работу с текстом: можно задавать вопросы об изображении, просить описать сцену, извлечь текст со скриншота или интерпретировать диаграмму. DeepSeek также позиционировала модель для использования в агентных процессах вместе с инструментами и агентными фреймворками.

#### Контекст и модальности
По данным каталога, модель принимает текст и изображения, а генерирует текст. Длина контекста — 1 048 576 токенов; максимальная длина генерации — 384 000 токенов. Изображение можно передать вместе с текстовым сообщением.

#### Типовые сценарии
Подходит для вопросов по фотографиям и иллюстрациям, разбора скриншотов интерфейсов, чтения текста на изображениях и анализа графиков. В агентных приложениях визуальный ввод может дополнять текстовые запросы и взаимодействие с инструментами.

#### Ограничения
Модель была объявлена экспериментальной. В актуальной документации DeepSeek указано, что её прежнее имя `deepseek-v4-flash-vision-exp` сохранено для совместимости, но запросы по этому имени обслуживаются актуальной Flash-моделью. Поэтому фактическое поведение может отличаться от первоначально описанной экспериментальной версии. Выходная модальность — текст.

#### Отличие от соседей по семейству
В сравнении с DeepSeek V4 Flash Vision Exp базовая Flash-модель ориентирована на текстовый ввод; экспериментальная версия добавляла к текстовым возможностям понимание изображений. При этом разработчик заявлял о сохранении уровня текстовых возможностей базовой модели. Сейчас отдельная экспериментальная версия выведена из обращения, а прежнее имя перенаправляет запросы на актуальную Flash-модель.

## Цены

- Запрос / 1М: 25,83 ₽
- Ответ / 1М: 77,5 ₽
- Чтение кэша / 1М: 0,82 ₽

## Параметры

reasoning, include_reasoning, max_tokens, temperature, top_p, stop, frequency_penalty, presence_penalty, repetition_penalty, top_k, seed, min_p, logit_bias, response_format, structured_outputs, tools, tool_choice, reasoning_effort

## Провайдеры

Выбрать Провайдера можно параметром `provider` в запросе.

| Провайдер | Цена | Контекст | Макс. ответ | Данные в РФ | 152-ФЗ |
| --- | --- | --- | --- | --- | --- |
| deepseek | Запрос / 1М: 52,72 ₽; Ответ / 1М: 158,17 ₽ | 1 048 576 | 384 000 | — | — |
| novita | Запрос / 1М: 52,72 ₽; Ответ / 1М: 158,17 ₽ | 1 048 576 | 393 216 | — | — |
| fireworks | Запрос / 1М: 26,36 ₽; Ответ / 1М: 79,09 ₽ | 1 048 576 | 943 718 | — | — |
| deepinfra/fp8 | Запрос / 1М: 25,83 ₽; Ответ / 1М: 77,5 ₽ | 1 048 576 | 262 144 | — | — |
| siliconflow/fp8 | Запрос / 1М: 52,72 ₽; Ответ / 1М: 158,17 ₽ | 1 048 576 | 393 216 | — | — |
| atlas-cloud/fp8 | Запрос / 1М: 52,72 ₽; Ответ / 1М: 158,17 ₽ | 1 048 576 | 65 536 | — | — |
| gmicloud/fp8 | Запрос / 1М: 52,72 ₽; Ответ / 1М: 158,17 ₽ | 1 048 575 | 943 717 | — | — |

## Быстрый старт

```bash
curl https://polza.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $POLZA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "deepseek/deepseek-v4-flash-vision-exp",
  "messages": [
    {
      "role": "user",
      "content": "Привет"
    }
  ]
}'
```

## Ссылки

- Страница: https://polza.ai/models/deepseek/deepseek-v4-flash-vision-exp
- Каталог: https://polza.ai/models
