DeepSeek выпустила экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp в своем API. По словам компании, она сохраняет сильные текстовые возможности линейки DeepSeek-V4-Flash, но добавляет работу с изображениями в сценариях для агентов, рассуждений и практических рабочих потоков.

Что особенно важно для разработчиков: модель работает в Chat Completions, Messages и Responses, принимает смешанный ввод из текста и изображений, а сами изображения теперь можно не пересылать заново в каждом запросе. Вместе с релизом DeepSeek включила API для файлов, чтобы загрузить картинку один раз и затем ссылаться на нее по идентификатору файла, экономя трафик и упрощая повторное использование ресурсов в цепочках запросов.

Для команд, которые строят зрительные AI-агенты, это полезный шаг сразу в двух направлениях: появляется более удобный вход в мультимодальные сценарии и снижается накладная стоимость интеграции на уровне API. Если DeepSeek удержит скорость и цену линейки Flash, модель может стать заметным вариантом для прикладных систем, где важны и зрение, и быстрый отклик.

Источник: DeepSeek