Большинство генеративных видеомоделей последних лет остаются пассивными генераторами: они создают короткий зрелищный клип по текстовому описанию, но зритель не может повлиять на происходящее внутри сцены. Даже интерактивные прототипы первого поколения страдали от фундаментального ограничения — они рассчитывали мир исключительно с точки зрения одного наблюдателя и забывали окружение, как только камера отворачивалась в сторону.
21 сентября 2026 года исследовательская лаборатория Odyssey представила исследовательскую версию Agora-2 — многопользовательской генеративной модели мира (world model). В отличие от классических видеосетей, Agora-2 способна моделировать единое интерактивное 3D-пространство сразу для двадцати независимых участников, включая живых пользователей и автономных ИИ-агентов, обеспечивая физическую целостность окружения в реальном времени.
Двухкомпонентная архитектура: физика и нейрорендеринг
Чтобы синхронизировать действия множества игроков в общем пространстве без классического игрового движка на C++, инженеры Odyssey разделили вычисления на два специализированных слоя:
- Модель симуляции (Simulation Model). Отвечает за логику мира и эволюцию физического состояния. Слой использует механизм внимания (attention) для отслеживания пространственных координат сущностей, геометрии объектов и недавних действий каждого участника. Именно эта модель гарантирует, что если один игрок разрушит препятствие или передвинет предмет, это изменение мгновенно отразится на глобальном состоянии мира.
- Модель рендеринга (Rendering Model). Построена на базе алгоритмов сопоставления потоков (flow matching). Она принимает глобальное состояние симуляции и генерирует уникальный видеопоток с частотой обновления реального времени для каждого из двадцати клиентов с учетом индивидуального положения виртуальной камеры.
Ключевое отличие Agora-2 от предшественников — персистентность окружения (persistent memory). Мир за спиной персонажа не растворяется и не генерируется заново случайным образом при развороте камеры. Если игрок оставил предмет в комнате и вернулся через несколько минут, объект будет находиться на том же месте.
Демонстрационный полигон: физика Diablo II
В качестве обучающего набора данных для Agora-2 исследователи использовали механику и визуальный стиль культовой экшен-RPG Diablo II:
- В тестовом сценарии одновременно участвовали 4 человека и 16 автономных ИИ-агентов.
- Модель выучила сложные правила взаимодействия: перемещение по изометрической сетке, расчет траекторий снарядов, зоны видимости и столкновения персонажей.
- Автономные агенты способны преследовать цели, реагировать на атаки живых игроков и координировать совместные действия в замкнутом пространстве.
Вместимость единой сессии симуляции выросла в пять раз по сравнению с первой версией Agora, открывая возможность создания гибридных игровых песочниц, где люди и нейросетевые боты делят одно физическое поле.
Значение для робототехники и автономных систем
Хотя демонстрация построена на игровом материале, главная цель разработки выходит далеко за рамки геймдева. Классическое создание 3D-симуляторов для обучения автопилотов и шагающих роботов требует колоссальных трудозатрат программистов физических движков и 3D-моделлеров:
- Генеративные модели мира позволяют синтезировать бесконечное разнообразие нестандартных физических ситуаций (аварии, погодные катаклизмы, деформации объектов) напрямую из видеоданных.
- Роботы и алгоритмы компьютерного зрения могут проходить миллионы часов тренировок внутри нейросетевой симуляции до первого физического теста на полигоне.
Аппаратная стоимость и текущие ограничения
На этапе исследовательского превью запуск Agora-2 требует значительных серверных мощностей:
- Для поддержания одной многопользовательской сессии на 20 участников задействуется кластер из четырех высокопроизводительных GPU серверного класса.
- Сетевая задержка передачи потокового видео и задержка генерации кадров могут приводить к локальным смазываниям текстур при резких поворотах взгляда.
Тем не менее, Agora-2 демонстрирует работающую альтернативу традиционным игровым движкам, доказывая, что физику и многопользовательскую среду можно выучить на данных.
