Gemini научился смотреть видео: что такое агентный анализ роликов
Коротко. 1 сентября 2026 года Google включила в модели Gemini агентный разбор видео — режим, в котором нейросеть не проглатывает ролик целиком, а сама решает, какие фрагменты посмотреть под конкретный вопрос. Заявлено до 88% меньше токенов, до 66% дешевле анализ и до 7% выше точность. Раскатка на приложение Gemini продолжается всю первую неделю сентября. Разбираем, что поменялось на практике и как разобрать видео нейросетью из России.
Что случилось
Раньше видео для нейросети было длинной стопкой картинок. Модель нарезала ролик с фиксированной частотой — обычно кадр в секунду — и честно скармливала себе всё подряд. Для полутораминутного клипа нормально. Для полуторачасовой лекции — катастрофа: тысячи кадров превращаются в гигантский счёт за токены, при том что ответ на вопрос зрителя лежит в одной конкретной минуте.
Агентный режим переворачивает логику. Модель получает доступ к встроенным видеоинструментам и работает с роликом как человек с перемоткой: сканирует таймлайн, заглядывает в транскрипт и звуковую дорожку, находит подозрительное место и уже там смотрит внимательно, кадр за кадром. Всё, что к вопросу не относится, просто не загружается в контекст.
Google подключила режим к Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. В API он включается отдельным параметром обработки, доплаты за саму функцию нет — платите обычную цену за те токены, которые в итоге израсходованы. Статус — превью, то есть поведение ещё может меняться.
Что обещают цифры
| Показатель | Против нарезки 1 кадр/сек |
|---|---|
| Расход токенов | до 88% меньше |
| Стоимость анализа | до 66% ниже |
| Точность ответа | до 7% выше |
Формулировка «до» здесь не кокетство: выигрыш тем больше, чем длиннее ролик. На десятиминутном туториале разница заметная, на девяностоминутной лекции или многочасовой записи с камеры — принципиальная. И обратите внимание на третью строку: обычно экономия оплачивается качеством, а тут точность растёт. Логика простая — модель, которая внимательно изучила нужную минуту, отвечает лучше модели, которая бегло просмотрела всё.
Что это даёт на практике
- Поиск момента. «На какой минуте он показывает, как снять крышку?» — вопрос к часовому видео вместо ручной перемотки.
- Конспект длинного материала. Лекция, вебинар, запись созвона превращаются в структурированный текст с таймкодами.
- Поиск аномалий. Запись с камеры за сутки и вопрос «когда в кадре появлялся человек».
- Подсчёт объектов и действий. Сколько раз в ролике произошло событие — задача, на которой посекундная нарезка обычно сбоила.
Google также обещает завести эту механику в YouTube — в функцию вопросов к ролику, но уже в ближайшие месяцы, а не сейчас.
Как это выглядит из России
Честно: конкретно агентного видеорежима у нас в Умке пока нет. Он живёт в моделях линейки Flash 3.5–3.7 и включается через Google AI Studio, корпоративную платформу Google или приложение Gemini — а все три недоступны с российских IP и не принимают карты российских банков. Обещать то, чего нет, мы не будем.
Что доступно в Умке уже сейчас: сами модели Gemini подключены наравне с GPT и Claude, оплата в рублях, без VPN и подписки. Можно разбирать документы, изображения и скриншоты, обсуждать содержание, работать с длинными текстами. Для видео есть рабочий обходной путь:
- Возьмите расшифровку. Если у ролика есть субтитры — выгрузите их. Если нет, аудиодорожку можно перегнать в текст.
- Отдайте текст модели. «Сделай конспект с таймкодами», «найди, где обсуждают цену», «выпиши все тезисы спикера».
- Спорные места — скриншотами. Там, где важна картинка, а не речь, приложите кадры к вопросу: разбор изображений работает.
Способ грубее агентного разбора, но задачу «понять, о чём часовой ролик, не пересматривая его» закрывает. Когда режим выйдет из превью и появится в моделях, которые мы подключаем, — добавим и напишем об этом.
Вывод
Главное в этой новости не проценты экономии, а смена подхода. Нейросети перестают потреблять данные равномерно и начинают их исследовать — решать, куда смотреть внимательно, а что пролистать. Ровно тот же сдвиг раньше произошёл с длинными текстами, и после него работа с большими документами перестала быть роскошью. С видео, похоже, повторяется та же история.
Что нового в самой линейке Gemini — в разборе «Gemini 3.8 Flash». Как генерировать видео нейросетью, а не разбирать — в гиде «ИИ для видео». Какую модель выбрать под задачу — в сравнении «Claude, GPT или Gemini».
Источник: официальный блог Google.
Gemini, GPT и Claude — в одном чате
Разбор документов, картинок и длинных текстов, генерация видео. Оплата в рублях, без VPN и подписки.
Открыть Умку → Цены