25 сентября 2026 г.
Google Research представила систему для создания связных длинных видео
Мультиагентная система на базе Gemini и Veo планирует сюжет, сохраняет визуальные ориентиры и проверяет результат в нескольких циклах. Пока это исследовательская разработка, а не общедоступный видеоредактор.
Подразделение Google Research разработало мультиагентную систему, которая превращает творческое задание в последовательность связанных сцен. Она управляет моделями Gemini и Veo, планирует визуальные элементы и проверяет собранное видео, чтобы уменьшить изменения персонажей, окружения и объектов между кадрами.
Авторы представили исследование 24 сентября 2026 года. Они рассматривают создание длинного видео как задачу глобальной оптимизации, а не как линейную цепочку отдельных запросов к генеративным моделям.
Как система собирает видео
Сначала агент-оркестратор выбирает творческую стратегию, структуру повествования и визуальный стиль. Затем агент подготовки формирует краткий сценарий, раскадровку и набор визуальных материалов.
Производственный блок распределяет работу между специализированными агентами. Один закрепляет внешний вид персонажей и сцен на ключевых кадрах, другой создает движение, третий добавляет озвучивание и музыку. После сборки мультимодальная языковая модель оценивает результат и передает замечания в следующий цикл генерации.
| Компонент | Подтвержденная функция |
|---|---|
| Orchestrator Agent | Выбирает общую творческую конфигурацию |
| Pre-Production Agent | Создает сценарную структуру и раскадровку |
| Keyframe, Video и Audio Agents | Генерируют ключевые кадры, движение и звук |
| MLLM Judge | Оценивает видео и возвращает сигнал для корректировки |
CANVAS отслеживает персонажей и окружение
Отдельный фреймворк CANVAS поддерживает постоянную визуальную память. В ней сохраняются сведения о персонажах, локациях и состоянии объектов по мере развития сюжета. Такой подход должен ограничивать дрейф признаков, при котором одежда, внешность или декорации постепенно меняются без сюжетной причины.
По оценке исследователей, система повысила согласованность многоэпизодных историй и устойчивость внешнего вида персонажей. В экспериментах она генерировала ролики продолжительностью в несколько минут. Опубликованный материал при этом не сообщает о публичном доступе к фреймворкам или отдельном пользовательском сервисе.
Где подход может пригодиться в учебной работе
Для студентов и исследователей разработка интересна как пример архитектуры, где несколько агентов совместно решают одну творческую задачу. Подход можно разбирать в работах о генеративном видео, мультимодальных моделях, автоматической оценке контента и управлении долгосрочным контекстом.
При анализе результатов стоит отделять исследовательскую демонстрацию от готового продукта. Также нужно проверять, какие метрики использовали авторы, с какими базовыми методами сравнивали систему и насколько стабильно она сохраняет факты, персонажей и последовательность событий в разных жанрах.
