Команда Фэй-Фэй Ли представила инновационную модель генерации миров в реальном времени под названием RTFM (Real-Time Frame Model). Эта система способна создавать тривимерные и постоянные миры на основе одного-единственного 2D-изображения, используя всего один графический процессор H100.
RTFM — это высокоэффективная авторегрессивная диффузионная Transformer-модель, прошедшая обучение на большом объёме видеоданных. Особенность модели в том, что она не строит явного 3D-представления мира, а напрямую генерирует 2D-изображения сцены с новых ракурсов.
Основные принципы модели RTFM
- Эффективность: система способна выполнять выдачу изображений в реальном времени при интерактивной частоте кадров, используя лишь одну видеокарту H100.
- Масштабируемость: модель спроектирована с учётом масштабирования с увеличением объёмов данных и вычислительных ресурсов, при этом не полагаясь на классические 3D-представления.
- Постоянство: созданный мир не исчезает во время взаимодействия, обеспечивая стабильность и непрерывность моделируемого пространства.
Инновационный подход к рендерингу и моделированию
RTFM обучается выполнять рендеринг, подобно AI, освоившему создание изображений из видеоданных. Это позволяет ей моделировать сложные физические эффекты — геометрию, отражения, тени — всего лишь анализируя видео из обучающего набора.
Благодаря этому, она способна реконструировать конкретные реальные локации, даже если исходные фотографии были сделаны в ограниченном количестве и с редких точек обзора.
Принцип функционирования: «Учится рендерить»
В отличие от традиционных 3D-графических конвейеров, использующих явные модели — треугольные сетки, Gaussian splatting и др., — RTFM не требует явной 3D-сцены. Вместо этого модель принимает один или несколько 2D-кадров и генерирует соответствующие 2D-изображения с новых перспектив.
Архитектура Transformer функционирует autoregressive образом — предсказывая следующий кадр на основе предыдущих. Входные кадры кодируются в нейронную активацию — KV-кеш, служащий имплицитным представлением сцены. При генерации новых изображений сеть обращается к этим данным через attention-механизм.
Весь процесс — от преобразования входных данных в внутреннее представление до генерации новых изображений — обучается сквозным методом («end-to-end») на основании большого объёма видеоданных.
Применение и перспективы
Сочетание RTFM с технологиями, такими как Marble, позволяет создавать полноценные 3D миры из одного изображения. Модель успешно обрабатывает различные стили сцен, эффекты освещения, отражения и сглаживания, что существенно расширяет возможности визуализации.
Таким образом, RTFM устраняет традиционные границы между реконструкцией (интерполяцией между существующими видами) и генерацией (созданием новых визуальных данных, отсутствующих во входных изображениях).
При наличии большого количества исходных ракурсов модель склонна к реконструкции, а при малом числе — к творческой экстраполяции и воображению.
Технологические вызовы и будущее генеративных моделей миров
Генеративные модели миров требуют больших вычислительных ресурсов, существенно превосходящих современные языковые модели. Для создания интерактивного видеопотока 4K при 60 fps необходимо обрабатывать более 100 000 токенов в секунду — это сопоставимо с объёмом текста «Франкенштейна» или первой книги «Гарри Поттера».
Поддержание постоянного контекста на протяжении часа требует работы с окном контекста более 100 миллионов токенов, что делает такие задачи крайне ресурсоёмкими и затратными.
При этом команда RTFM опирается на «Горький урок» («The Bitter Lesson»), утверждающий, что простые методы с возможностью масштабирования и роста вычислительной мощности часто оказываются наиболее успешными благодаря экспоненциальному снижению стоимости вычислений со временем.
Заключение
Модель RTFM представляет собой значительный шаг в области генеративных 3D миров, делая возможным создание и интерактивное исследование детализированных, устойчивых виртуальных пространств с минимальными аппаратными требованиями.
Её способность генерировать реалистичные изображения с разных точек обзора, воспроизводить сложные физические эффекты и масштабироваться с ростом вычислительной мощности обещает серьезные изменения в медиаиндустрии, робототехнике и других областях, связанных с виртуальной и дополненной реальностью.
Прокомментировать в Телеграм: https://t.me/n8nhow
Подписаться на канал обучения n8n: https://t.me/n8ncoaching

