DeepSeek: DeepSeek V4 Flash Vision Exp
ID: deepseek/deepseek-v4-flash-vision-exp
25,83 ₽
Запрос / 1М
77,5 ₽
Ответ / 1М
—
Изображение вход / 1М
—
Изображение выход / 1М
1M
Контекст
262K
Макс. ответ
Провайдеры для DeepSeek: DeepSeek V4 Flash Vision Exp
Подробнее о «DeepSeek: DeepSeek V4 Flash Vision Exp»
Принимает изображения и текст, отвечает текстом: подходит для описания визуального содержимого, чтения скриншотов и анализа диаграмм в диалогах и агентных сценариях.
Суть
Экспериментальная мультимодальная версия DeepSeek Flash, предназначенная для работы с изображениями и текстом в одном запросе. Модель может интерпретировать визуальный материал и формировать текстовый ответ. Разработчик указывал, что её текстовые возможности, включая рассуждения, знания о мире и работу в агентных сценариях, соответствуют базовой Flash-модели.
Сильные стороны
Визуальное понимание дополняет привычную работу с текстом: можно задавать вопросы об изображении, просить описать сцену, извлечь текст со скриншота или интерпретировать диаграмму. DeepSeek также позиционировала модель для использования в агентных процессах вместе с инструментами и агентными фреймворками.
Контекст и модальности
По данным каталога, модель принимает текст и изображения, а генерирует текст. Длина контекста — 1 048 576 токенов; максимальная длина генерации — 384 000 токенов. Изображение можно передать вместе с текстовым сообщением.
Типовые сценарии
Подходит для вопросов по фотографиям и иллюстрациям, разбора скриншотов интерфейсов, чтения текста на изображениях и анализа графиков. В агентных приложениях визуальный ввод может дополнять текстовые запросы и взаимодействие с инструментами.
Ограничения
Модель была объявлена экспериментальной. В актуальной документации DeepSeek указано, что её прежнее имя deepseek-v4-flash-vision-exp сохранено для совместимости, но запросы по этому имени обслуживаются актуальной Flash-моделью. Поэтому фактическое поведение может отличаться от первоначально описанной экспериментальной версии. Выходная модальность — текст.
Отличие от соседей по семейству
В сравнении с DeepSeek V4 Flash Vision Exp базовая Flash-модель ориентирована на текстовый ввод; экспериментальная версия добавляла к текстовым возможностям понимание изображений. При этом разработчик заявлял о сохранении уровня текстовых возможностей базовой модели. Сейчас отдельная экспериментальная версия выведена из обращения, а прежнее имя перенаправляет запросы на актуальную Flash-модель.