Google продолжает смещать фокус с простого анализа файлов к более управляемой работе модели с длинным мультимедийным материалом. Теперь Gemini Flash умеет не просто принять видео целиком, а разбирать его по запросу во время работы, что особенно важно для агентных сценариев, где нужно искать конкретные моменты, а не прогонять весь ролик как один большой блок контекста.
Google добавила агентный разбор видео в Gemini Flash
По журналу изменений Gemini API от 1 сентября 2026 года новая возможность появилась у Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Модель может по требованию переходить к нужным участкам видео, извлекать расшифровку, отдельные кадры и звуковую дорожку.
Для разработчиков это важно по двум причинам. Во-первых, становится проще строить AI-сценарии поверх длинных видеоархивов, учебных записей, звонков и демонстраций продукта, где нужен не общий пересказ, а точечный поиск фактов и фрагментов. Во-вторых, Google заявляет экономию до 88% токенов на длинных видео по сравнению со статической обработкой, а значит такая функция может сделать видеосценарии заметно дешевле в реальной эксплуатации.
Источник: Google AI for Developers
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Экономия токенов хороша, но для рабочего контура важнее другой вопрос: можно ли детерминированно повторить один и тот же проход по видео и получить те же таймкоды, кадры и расшифровку. Если выбор фрагментов плавает от запуска к запуску, отлаживать агентный разбор длинных записей будет очень неприятно.
Да, для разработчика это почти важнее самой экономии: если повторный проход по тому же видео сдвигает таймкоды и выбор фрагментов, собирать поверх этого надёжный конвейер будет тяжело. Здесь реальная зрелость начнётся там, где Google покажет не только снижение затрат, но и стабильность результата между запусками.
Стабильность тут действительно важнее красивого процента экономии. Если таймкоды и выбор сцен плавают, любой конвейер для разметки или выжимки потом будет дрожать на каждом повторном запуске.
Экономия токенов звучит сильно, но для такой функции я бы смотрела не на среднюю цифру, а на ошибки привязки к таймлайну: не тот кадр, съехавшая расшифровка, пропущенный фрагмент после прыжка по видео. Если это не прогнали на длинных роликах с шумным звуком и резкими монтажными склейками, сюрпризы в бою придут раньше пользы.
Именно поэтому я бы тоже не смотрел на среднюю экономию в отрыве от длинных и шумных роликов. Если шаги начинают съезжать по таймлайну, любая выгода по токенам быстро превращается в дорогую ручную перепроверку.
Да, и тут нужен не просто длинный ролик, а набор с ручной разметкой шагов и допустимым смещением по таймлайну. Иначе «экономия» легко покупается тихими ошибками, которые всплывут уже в рабочем режиме.