Google представила мультиагентную систему для генерации длинных видео
Google Research представила AI video co-director — мультиагентную систему поверх Gemini и Veo, которая планирует визуальную непрерывность в многосценовых видео. Она генерирует ролики длиной в минуты, снижая дрейф персонажей и накопление ошибок между кадрами.
- Система работает как оркестрационный слой поверх моделей Gemini и Veo от Google
- В основе — четыре фреймворка: Co-Director, CANVAS, A²RD и VQQA
- Co-Director примет к публикации на COLM 2026, CANVAS — на EMNLP 2026

Google Research представила AI video co-director — мультиагентную систему, которая превращает диффузионные видеомодели в инструмент для создания связных длинных историй. Разработка описана в блоге исследовательского подразделения компании.
Современные диффузионные модели генерируют отдельные клипы высокого качества за секунды, но собрать из них цельное повествование сложно. Существующие конвейеры страдают от семантического дрейфа — незаметных изменений в одежде персонажа или декорациях между кадрами — и каскадных сбоев, когда артефакт на раннем этапе ломает всю последующую генерацию.
Как устроена система
AI video co-director работает как оркестрационный слой поверх Gemini и Veo. Архитектура не привязана к конкретной модели и может использоваться с любой базовой генеративной системой. Система рассматривает создание длинного видео как задачу глобальной оптимизации и отслеживания состояния мира.
Исследование разбито на четыре направления. Первое — оркестрация творческого замысла через иерархическую мультиагентную систему: алгоритм multi-armed bandit глобально выбирает перспективные творческие направления, балансируя между исследованием новых стратегий и использованием уже эффективных конфигураций.
Второе — визуальный сторибординг CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding). Он поддерживает структурированные представления о персонажах, локациях и объектах по мере развития сюжета, опираясь на постоянную визуальную память.
В примере с ограблением музея CANVAS сравнивают с прямой генерацией через Gemini-3.1-Pro и альтернативным мультиагентным фреймворком AutoStudio. Прямая генерация даёт несоответствие реквизита и смещение фона, AutoStudio теряет кепку персонажа между кадрами, а CANVAS сохраняет идентичность героев, геометрию пространства и объекты.
Третье и четвёртое направления — A²RD и VQQA — отвечают за автоматизацию рутинных задач оркестрации: мультимодельные промпты, сцепку кадров и замкнутую визуальную доработку.
Фреймворк Co-Director примет к публикации на конференции COLM 2026, CANVAS — на EMNLP 2026. Поскольку система работает как оркестрационный слой, все генерируемые изображения, видео и аудио наследуют встроенные механизмы безопасности базовых моделей, включая SynthID watermarking.
Для профиТехнические детали: архитектура, цифры, ссылки
AI video co-director формализует видеоповествование как задачу глобальной оптимизации. Оркестратор использует multi-armed bandit для выбора творческой конфигурации по трём измерениям: творческая стратегия (замысел), нарративный режим (структура истории) и эстетический архетип (визуальный тон и кинематография).
Конвейер исполняет глобальную оптимизацию через два взаимосвязанных цикла: стратегическое управление и многоэтапное производство. Pre-Production Agent синтезирует раскадровку и визуальные ассеты, Production Agent переводит её в аудиовизуальные медиа через специализированных субагентов: Keyframe Agent закрепляет визуал персонажей и сцен, Video Agent добавляет движение, Audio Agent накладывает озвучку и музыку.
Мультимодальный LLM-судья (MLLM Judge) оценивает собранный монтаж по трём заданным измерениям и передаёт факторизованный сигнал вознаграждения обратно в MAB для итеративной оптимизации.
CANVAS поддерживает постоянную визуальную память: извлекает визуальные якоря или инициализирует новые, обеспечивая плавные переходы внутри одной локации. Это явное моделирование состояния мира сохраняет идентичность персонажей и пространственную структуру окружения при повторных посещениях.
Архитектура модели-агностична: несмотря на работу поверх Gemini и Veo, она может использоваться с любой базовой генеративной моделью. Для продакшена поверх финального видео можно применять дополнительные классификаторы безопасности.
Вопросы и ответы
- На каких моделях работает AI video co-director?
- Система построена как оркестрационный слой поверх Gemini и Veo, но архитектура модели-агностична и может использоваться с любой базовой генеративной моделью.
- Какую проблему решает система?
- Она борется с семантическим дрейфом и каскадными сбоями при генерации длинных видео, сохраняя идентичность персонажей и постоянство окружения между кадрами.
- Где опубликуют исследования?
- Фреймворк Co-Director примет к публикации на COLM 2026, CANVAS — на EMNLP 2026.

