#NVIDIA #генеративный ИИ #Искусственный Интеллект

Nvidia представила генератор видео по текстовому описанию

20.04.2023 Богдан Каминский

Компания Nvidia разработала нейросеть VideoLDM, генерирующую короткие и реалистичные видеоролики по текстовому описанию.

Алгоритм позволяет создавать анимации продолжительностью около пяти секунд в разрешении до 2048х1280 пикселей и частотой 24 FPS. Модель генерирует видео как по простым, так и сложным подсказкам.

В основе VideoLDM лежат наработки алгоритма Stable Diffusion. Согласно отчету, нейросеть учитывает 4,1 млрд параметров. Из них 2,7 млрд обучались на видео.

В компании заявили, что добились «значительного прогресса» в тренировке нейросети достаточно быстро. По словам разработчиков, VideoLDM стала генерировать детализированные и соответствующие описанию видео всего за месяц.

Разработчики опубликовали несколько примеров работы нейросети на своем сайте.

«Черепаха плавает в океане». Данные: Nvidia.

«Штурмовик пылесосит песчаный пляж». Данные: Nvidia.

«Одетая в костюм лисица танцует в парке». Данные: Nvidia.

«Лев стоит на серфборде в океане на закате, 4К, высокое разрешение». Данные: Nvidia.

«Две панды сидят за столом и играют в карты, 4К, высокое разрешение». Данные: Nvidia.

«Наливание пива в бокал под низким углом». Данные: Nvidia.

Модель также умеет генерировать сцены вождения. Такие ролики имеют разрешение 1024х512 пикселей продолжительностью до пяти минут.

VideoLDM может моделировать специфические сценарии вождения и прогнозировать поведение объектов на дороге. По словам разработчиков, это позволяет создавать реалистичные кадры.

Пример сгенерированной сцены вождения. Данные: Nvidia.

Опубликованная работа является участником конференции IEEE по компьютерному зрению и распознаванию образов, которая пройдет в Ванкувере с 18 по 22 июня. Неизвестно, планирует ли Nvidia выпускать алгоритм в публичный доступ.

Напомним, в апреле Meta представила инструмент для сегментации изображений и видео.

В марте Microsoft выпустила предварительную версию Bing Image Creator.

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X

Нашли ошибку в тексте? Выделите ее и нажмите CTRL+ENTER

Рассылки ForkLog: держите руку на пульсе биткоин-индустрии!

Материалы по теме

Anthropic случайно удалил тысячи репозиториев на GitHub из-за слива кода Claude Code

Сбой в работе роботакси Apollo Go привел к авариям на дорогах

Инвесторы оценили OpenAI в $852 млрд перед запуском универсального ИИ-супераппа

Масштабная утечка исходного кода Claude Code раскрыла десятки скрытых функций Anthropic

СМИ: Oracle уволит тысячи сотрудников из-за ИИ

Биткоин-майнер Bitfarms проведет ребрендинг на фоне перехода в ИИ

ИИ-агент пожаловался на бан от «Википедии»

Microsoft объединила GPT и Claude для коллективной работы

ИИ-сервис от Bluesky оказался в топе по блокировкам на платформе