Google навчила Gemini “дивитися” відео вибірково: аналіз став на 66% дешевшим

Відео
Google навчила Gemini “дивитися” відео вибірково: аналіз став на 66% дешевшим © Google
Нова функція дозволяє вибірково сканувати фрагменти, заощаджуючи до 88% токенів у тривалих відео.

Невдовзі після запуску сервісу для створення та редагування зображень Pics компанія Google представила функцію агентного аналізу відео для моделей Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite. Нова технологія дозволяє штучному інтелекту переглядати лише потрібні фрагменти відео замість аналізу всього матеріалу з фіксованою частотою кадрів. За даними компанії, це скорочує споживання токенів до 88%, знижує витрати на 66% і підвищує точність аналізу приблизно на 7%.

Gemini сам вирішує, що переглядати

На відміну від традиційної обробки, коли модель зчитує відео із заздалегідь визначеною частотою кадрів (за замовчуванням один кадр за секунду), агентний режим дозволяє Gemini самостійно обирати, які частини відео потрібно переглянути детальніше.

Модель аналізує візуальні кадри, аудіо та текстові розшифровки, повторно скануючи потрібні фрагменти з вищою частотою кадрів. Такий підхід дозволяє знаходити конкретні моменти з точністю до частки секунди, виявляти аномалії, підраховувати об'єкти й відповідати на складні запитання щодо багатогодинних записів.

Найвища ефективність

Google зазначає, що переваги особливо помітні під час роботи з тривалими відео — від 10-хвилинних інструкцій до 90-хвилинних лекцій і багатогодинних записів. У тестах LongVideoBench Gemini 3.7 Flash із агентним режимом продемонструвала найкраще співвідношення точності та вартості серед протестованих моделей, вийшовши на так звану межу Парето — оптимальний баланс між якістю результатів і витратами на обчислення.

Нові сценарії використання

Функція відкриває нові можливості для розробників, які працюють із великими відеоархівами. Зокрема, вона підтримує пошук монтажних склейок і миттєвих змін стану, пошук потрібної інформації в багатогодинних записах, повторний аналіз швидких рухів і точніше відстеження повторюваних дій та окремих об'єктів.

Уже доступно через API

Агентний аналіз відео вже працює через Gemini API в Google AI Studio та Gemini Enterprise Agent Platform. Функція підтримує як завантажені відео, так і ролики з YouTube.

Для активації достатньо встановити режим обробки agentic у конфігурації API. Додаткова плата за нову можливість не стягується — вона використовує стандартні тарифи Gemini API.

Google також повідомила, що найближчим часом технологія стане доступною всім користувачам застосунку Gemini. У наступні місяці вона почне працювати й у функції Ask YouTube, яка відповідатиме на запитання з урахуванням не лише субтитрів, а й візуального змісту відео.

Нещодавно Google представила Gemini 3.5 Transcribe — спеціалізовану модель для розпізнавання та структурування мовлення в реальному часі й з аудіозаписів, яка стала наступницею системи Chirp 3. Технологія підтримує понад 85 мов, працює із затримкою менш як секунда та автоматично очищає текст від слів-паразитів, фіксуючи самовиправлення спікера й розділяючи голоси співрозмовників. 

Помітили помилку?

Будь ласка, виділіть її мишкою та натисніть Ctrl+Enter або Надіслати помилку

Додати коментар
Всього коментарів: 0
Текст містить неприпустимі символи
Залишилось символів: 2000
Будь ласка, виберіть один або кілька пунктів (до 3 шт.), які на Вашу думку визначає цей коментар.
Будь ласка, виберіть один або більше пунктів
Нецензурна лексика, лайка Флуд Порушення дійсного законодвства України Образа учасників дискусії Реклама Розпалювання ворожнечі Ознаки троллінгу й провокації Інша причина Відміна Надіслати скаргу ОК
Залишайтесь в курсі останніх подій!
Підписуйтесь на наш канал у Telegram
Стежити у Телеграмі