Создание индивидуального 3D-дома мечты из одного изображения: новая модель генерации миров на базе ИИ

Команда Фэй-Фэй Ли представила инновационную модель генерации миров в реальном времени под названием RTFM (Real-Time Frame Model). Эта система способна создавать тривимерные и постоянные миры на основе одного-единственного 2D-изображения, используя всего один графический процессор H100.

RTFM — это высокоэффективная авторегрессивная диффузионная Transformer-модель, прошедшая обучение на большом объёме видеоданных. Особенность модели в том, что она не строит явного 3D-представления мира, а напрямую генерирует 2D-изображения сцены с новых ракурсов.

Основные принципы модели RTFM

  • Эффективность: система способна выполнять выдачу изображений в реальном времени при интерактивной частоте кадров, используя лишь одну видеокарту H100.
  • Масштабируемость: модель спроектирована с учётом масштабирования с увеличением объёмов данных и вычислительных ресурсов, при этом не полагаясь на классические 3D-представления.
  • Постоянство: созданный мир не исчезает во время взаимодействия, обеспечивая стабильность и непрерывность моделируемого пространства.

Инновационный подход к рендерингу и моделированию

RTFM обучается выполнять рендеринг, подобно AI, освоившему создание изображений из видеоданных. Это позволяет ей моделировать сложные физические эффекты — геометрию, отражения, тени — всего лишь анализируя видео из обучающего набора.

Благодаря этому, она способна реконструировать конкретные реальные локации, даже если исходные фотографии были сделаны в ограниченном количестве и с редких точек обзора.

Принцип функционирования: «Учится рендерить»

В отличие от традиционных 3D-графических конвейеров, использующих явные модели — треугольные сетки, Gaussian splatting и др., — RTFM не требует явной 3D-сцены. Вместо этого модель принимает один или несколько 2D-кадров и генерирует соответствующие 2D-изображения с новых перспектив.

Архитектура Transformer функционирует autoregressive образом — предсказывая следующий кадр на основе предыдущих. Входные кадры кодируются в нейронную активацию — KV-кеш, служащий имплицитным представлением сцены. При генерации новых изображений сеть обращается к этим данным через attention-механизм.

Весь процесс — от преобразования входных данных в внутреннее представление до генерации новых изображений — обучается сквозным методом («end-to-end») на основании большого объёма видеоданных.

Применение и перспективы

Сочетание RTFM с технологиями, такими как Marble, позволяет создавать полноценные 3D миры из одного изображения. Модель успешно обрабатывает различные стили сцен, эффекты освещения, отражения и сглаживания, что существенно расширяет возможности визуализации.

Таким образом, RTFM устраняет традиционные границы между реконструкцией (интерполяцией между существующими видами) и генерацией (созданием новых визуальных данных, отсутствующих во входных изображениях).

При наличии большого количества исходных ракурсов модель склонна к реконструкции, а при малом числе — к творческой экстраполяции и воображению.

Технологические вызовы и будущее генеративных моделей миров

Генеративные модели миров требуют больших вычислительных ресурсов, существенно превосходящих современные языковые модели. Для создания интерактивного видеопотока 4K при 60 fps необходимо обрабатывать более 100 000 токенов в секунду — это сопоставимо с объёмом текста «Франкенштейна» или первой книги «Гарри Поттера».

Поддержание постоянного контекста на протяжении часа требует работы с окном контекста более 100 миллионов токенов, что делает такие задачи крайне ресурсоёмкими и затратными.

При этом команда RTFM опирается на «Горький урок» («The Bitter Lesson»), утверждающий, что простые методы с возможностью масштабирования и роста вычислительной мощности часто оказываются наиболее успешными благодаря экспоненциальному снижению стоимости вычислений со временем.

Заключение

Модель RTFM представляет собой значительный шаг в области генеративных 3D миров, делая возможным создание и интерактивное исследование детализированных, устойчивых виртуальных пространств с минимальными аппаратными требованиями.

Её способность генерировать реалистичные изображения с разных точек обзора, воспроизводить сложные физические эффекты и масштабироваться с ростом вычислительной мощности обещает серьезные изменения в медиаиндустрии, робототехнике и других областях, связанных с виртуальной и дополненной реальностью.




Прокомментировать в Телеграм: https://t.me/n8nhow

Подписаться на канал обучения n8n: https://t.me/n8ncoaching

Советы, обучающие курсы, компьютерная грамотность
Обзор конфиденциальности

На этом сайте используются файлы cookie, что позволяет нам обеспечить наилучшее качество обслуживания пользователей. Информация о файлах cookie хранится в вашем браузере и выполняет такие функции, как распознавание вас при возвращении на наш сайт и помощь нашей команде в понимании того, какие разделы сайта вы считаете наиболее интересными и полезными.