← Блог Новости

Gemini научился смотреть видео: что такое агентный анализ роликов

· · 6 минут чтения
Таймлайн видео, на котором нейросеть выбирает отдельные фрагменты для разбора

Коротко. 1 сентября 2026 года Google включила в модели Gemini агентный разбор видео — режим, в котором нейросеть не проглатывает ролик целиком, а сама решает, какие фрагменты посмотреть под конкретный вопрос. Заявлено до 88% меньше токенов, до 66% дешевле анализ и до 7% выше точность. Раскатка на приложение Gemini продолжается всю первую неделю сентября. Разбираем, что поменялось на практике и как разобрать видео нейросетью из России.

Что случилось

Раньше видео для нейросети было длинной стопкой картинок. Модель нарезала ролик с фиксированной частотой — обычно кадр в секунду — и честно скармливала себе всё подряд. Для полутораминутного клипа нормально. Для полуторачасовой лекции — катастрофа: тысячи кадров превращаются в гигантский счёт за токены, при том что ответ на вопрос зрителя лежит в одной конкретной минуте.

Агентный режим переворачивает логику. Модель получает доступ к встроенным видеоинструментам и работает с роликом как человек с перемоткой: сканирует таймлайн, заглядывает в транскрипт и звуковую дорожку, находит подозрительное место и уже там смотрит внимательно, кадр за кадром. Всё, что к вопросу не относится, просто не загружается в контекст.

Google подключила режим к Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. В API он включается отдельным параметром обработки, доплаты за саму функцию нет — платите обычную цену за те токены, которые в итоге израсходованы. Статус — превью, то есть поведение ещё может меняться.

Что обещают цифры

ПоказательПротив нарезки 1 кадр/сек
Расход токеновдо 88% меньше
Стоимость анализадо 66% ниже
Точность ответадо 7% выше

Формулировка «до» здесь не кокетство: выигрыш тем больше, чем длиннее ролик. На десятиминутном туториале разница заметная, на девяностоминутной лекции или многочасовой записи с камеры — принципиальная. И обратите внимание на третью строку: обычно экономия оплачивается качеством, а тут точность растёт. Логика простая — модель, которая внимательно изучила нужную минуту, отвечает лучше модели, которая бегло просмотрела всё.

Что это даёт на практике

  • Поиск момента. «На какой минуте он показывает, как снять крышку?» — вопрос к часовому видео вместо ручной перемотки.
  • Конспект длинного материала. Лекция, вебинар, запись созвона превращаются в структурированный текст с таймкодами.
  • Поиск аномалий. Запись с камеры за сутки и вопрос «когда в кадре появлялся человек».
  • Подсчёт объектов и действий. Сколько раз в ролике произошло событие — задача, на которой посекундная нарезка обычно сбоила.

Google также обещает завести эту механику в YouTube — в функцию вопросов к ролику, но уже в ближайшие месяцы, а не сейчас.

Как это выглядит из России

Честно: конкретно агентного видеорежима у нас в Умке пока нет. Он живёт в моделях линейки Flash 3.5–3.7 и включается через Google AI Studio, корпоративную платформу Google или приложение Gemini — а все три недоступны с российских IP и не принимают карты российских банков. Обещать то, чего нет, мы не будем.

Что доступно в Умке уже сейчас: сами модели Gemini подключены наравне с GPT и Claude, оплата в рублях, без VPN и подписки. Можно разбирать документы, изображения и скриншоты, обсуждать содержание, работать с длинными текстами. Для видео есть рабочий обходной путь:

  1. Возьмите расшифровку. Если у ролика есть субтитры — выгрузите их. Если нет, аудиодорожку можно перегнать в текст.
  2. Отдайте текст модели. «Сделай конспект с таймкодами», «найди, где обсуждают цену», «выпиши все тезисы спикера».
  3. Спорные места — скриншотами. Там, где важна картинка, а не речь, приложите кадры к вопросу: разбор изображений работает.

Способ грубее агентного разбора, но задачу «понять, о чём часовой ролик, не пересматривая его» закрывает. Когда режим выйдет из превью и появится в моделях, которые мы подключаем, — добавим и напишем об этом.

Вывод

Главное в этой новости не проценты экономии, а смена подхода. Нейросети перестают потреблять данные равномерно и начинают их исследовать — решать, куда смотреть внимательно, а что пролистать. Ровно тот же сдвиг раньше произошёл с длинными текстами, и после него работа с большими документами перестала быть роскошью. С видео, похоже, повторяется та же история.

Что нового в самой линейке Gemini — в разборе «Gemini 3.8 Flash». Как генерировать видео нейросетью, а не разбирать — в гиде «ИИ для видео». Какую модель выбрать под задачу — в сравнении «Claude, GPT или Gemini».

Источник: официальный блог Google.

Gemini, GPT и Claude — в одном чате

Разбор документов, картинок и длинных текстов, генерация видео. Оплата в рублях, без VPN и подписки.

Открыть Умку → Цены