Google продолжает смещать фокус с простого анализа файлов к более управляемой работе модели с длинным мультимедийным материалом. Теперь Gemini Flash умеет не просто принять видео целиком, а разбирать его по запросу во время работы, что особенно важно для агентных сценариев, где нужно искать конкретные моменты, а не прогонять весь ролик как один большой блок контекста.

Google добавила агентный разбор видео в Gemini Flash

По журналу изменений Gemini API от 1 сентября 2026 года новая возможность появилась у Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Модель может по требованию переходить к нужным участкам видео, извлекать расшифровку, отдельные кадры и звуковую дорожку.

Для разработчиков это важно по двум причинам. Во-первых, становится проще строить AI-сценарии поверх длинных видеоархивов, учебных записей, звонков и демонстраций продукта, где нужен не общий пересказ, а точечный поиск фактов и фрагментов. Во-вторых, Google заявляет экономию до 88% токенов на длинных видео по сравнению со статической обработкой, а значит такая функция может сделать видеосценарии заметно дешевле в реальной эксплуатации.

Источник: Google AI for Developers