Vídeos e imagens criados por inteligência artificial costumavam ser facilmente reconhecidos (lembre-se de Will Smith comendo espaguete?). No entanto, os modelos de vídeo AI mais recentes estão se tornando muito eficientes – surpreendentemente eficientes.
Produzir vídeos com inteligência artificial é consideravelmente mais desafiador do que produzir imagens. Enquanto existem numerosas opções de geradores de imagens AI de alta qualidade, no campo dos vídeos, apenas algumas ferramentas se destacam. Entre as mais conhecidas estão o Veo 3 do Google e o Sora 2.
Qual modelo de vídeo AI sai vencedor em uma competição direta? Se você está acompanhando essa disputa, a resposta provavelmente não será surpreendente.
Quais são as características do Veo 3 e do Sora 2?
O Veo 3 é o nome do mais recente modelo de vídeo de inteligência artificial generativa desenvolvido pelo Google. Além de representar uma significativa evolução em relação ao Veo 2, seu antecessor, o Veo 3 marcou o início de uma nova era na tecnologia de vídeo AI. Este novo modelo tem a capacidade de criar vídeos realistas a partir de comandos de texto, diferenciando-se da simples animação de imagens existentes. Além disso, o Veo 3 consegue gerar diálogos e outros sons de maneira realista. O acesso ao Veo 3 pode ser feito através do chatbot de IA do Google Gemini ou por meio de outras ferramentas do Google, como o Flow, uma ferramenta experimental de filmagem de IA.
Veo 3 oferece duas opções de sabores: Veo 3 Fast e Veo 3 Qualidade. Optamos por experimentar o Veo 3 Qualidade neste teste, pois queríamos avaliar a qualidade dos vídeos.
OpenAI lançou a versão 2 do Sora em 30 de setembro em um aplicativo iOS autônomo chamado Sora. Esta nova versão é o sucessor do primeiro modelo de vídeo AI da empresa, que também era chamado de Sora. Atualmente, o Sora 2 só pode ser acessado por convite através do aplicativo Sora. Além disso, o Sora 2 apresenta um feed de vídeos da comunidade, semelhante ao TikTok, mas para vídeos de inteligência artificial.
Comentários sobre comparações
Corretamente, utilizamos a inteligência artificial – neste caso, o ChatGPT – para auxiliar na elaboração de sugestões para testes de video AI. As sugestões a seguir foram elaboradas para avaliar diversos aspectos da produção de vídeos, desde áudio até animação. O ChatGPT criou sugestões para testar os geradores de vídeo, que foram posteriormente ajustadas e aprimoradas por nós.
- Uma jovem mulher caminha por uma rua movimentada em Tóquio à noite, sob uma leve chuva, acompanhada por uma câmera portátil. Os reflexos dos sinais de néon no asfalto molhado e nos guarda-chuvas são capturados, com a câmera posicionada atrás dela enquanto observa um outdoor brilhante e segue em frente. A atmosfera da cena é descrita como cinematográfica e hiper-realista, semelhante a um filme capturado por uma câmera sem espelho com profundidade de campo superficial.
- Um herói usando um traje vermelho e prateado pousa com força em um telhado ao entardecer, causando rachaduras no concreto sob seus pés. Sua capa flutua ao vento enquanto a câmera gira lentamente ao redor dele. No horizonte, drones voam entre arranha-céus com janelas reluzentes, criando uma atmosfera digna de um grande filme de ação.
- Um vídeo tridimensional com temática cyberpunk na Times Square, repleto de anúncios holográficos e veículos voadores. Um imenso painel digital se ilumina com a palavra ‘MASHABLE’ em destaque. A animação deve apresentar texto claro, reflexos brilhantes e iluminação dinâmica, evocando a energia visual de “Homem-Aranha no Aranhaverso”.
- Uma cena animada em 2D mostra dois amigos sentados junto a uma janela de café em uma tarde chuvosa, com uma iluminação suave e pinceladas visíveis, como se fosse aquarela. Um dos amigos diz de forma tranquila: “Às vezes, um pequeno passo pode fazer toda a diferença.” O outro amigo sorri e concorda. A animação inclui movimentos sutis na boca dos personagens, sons suaves de chuva lá fora e o tranquilo barulho de copos sendo tocados ao fundo.
- Descrição de uma cena realista de rua, com [o tema] dançando de forma livre em uma calçada de uma cidade arborizada, vestindo roupas casuais folgadas e ao som de uma música animada. Os ruídos ambientais da rua (tráfego ao longe, passos) e a iluminação cinematográfica no horário do pôr do sol completam a atmosfera.
Um dispositivo de gravação móvel acompanha uma jovem mulher que caminha por uma rua movimentada em Tóquio à noite, debaixo de uma chuva suave. Os letreiros de néon refletem no asfalto molhado e nos guarda-chuvas. A câmera permanece estática atrás dela, enquanto ela admira um outdoor brilhante antes de seguir seu caminho. A intenção é que a cena tenha uma atmosfera cinematográfica e hiper-realista, como se fosse filmada com uma câmera sem espelho, com uma profundidade rasa de campo.
Um herói vestindo um traje vermelho e prateado pousa com firmeza em um telhado durante o pôr do sol, causando rachaduras no concreto sob seus pés. Seu capuz flutua ao vento enquanto a câmera se move em torno dele em câmera lenta. Ao fundo, drones voam entre arranha-céus com janelas reluzentes, criando uma atmosfera digna de um filme de ação de grande sucesso.
Uma cena em animação 3D, com elementos de cyberpunk, ambientada em Times Square, repleta de anúncios holográficos e veículos voadores. Um enorme painel digital se ilumina com a palavra ‘MASHABLE’ em destaque. A animação apresenta texto claro, reflexos brilhantes e uma iluminação dinâmica, evocando a vibrante energia visual de “Homem-Aranha no Aranhaverso”.
Uma cena animada em 2D mostra dois amigos sentados perto de uma janela de café em uma tarde chuvosa. A iluminação é suave e parecida com aquarela, com pinceladas visíveis. Um dos amigos diz suavemente: “Às vezes, um simples passo pode fazer toda a diferença.” O outro sorri e concorda. A animação inclui movimentos sutis da boca para acompanhar o diálogo, sons suaves de chuva do lado de fora e o tranquilo tilintar de copos ao fundo.
Descrição de uma cena realista de rua, com [o tema] dançando livremente sob uma calçada arborizada em uma cidade, vestindo roupas confortáveis e seguindo um ritmo animado. Os sons ambientais da rua (carros ao longe, passos) e a iluminação cinematográfica durante o pôr do sol completam o cenário.
Eu desenvolvi um comando específico para produzir um vídeo de um personagem com direitos autorais, e também criei um segundo comando alternativo caso o sistema se recuse a fazê-lo. No entanto, optei por não divulgar esse comando para evitar incentivar a geração de vídeos de IA que utilizem material protegido por direitos autorais, uma questão delicada para OpenAI e Sora até o momento.
Prompt 1: Uma mulher na capital do Japão.
Este comando era tipicamente direto em relação à originalidade, porém a expectativa era de que os criadores de vídeo pudessem produzir um efeito cinematográfico e dinâmico, utilizando elementos como reflexos na água. Como eles conseguiram fazer isso?
Ambos Sora 2 e Veo 3 produziram vídeos atraentes, porém apresentaram algumas diferenças notáveis. O vídeo produzido por Sora 2 teve um enquadramento mais estreito em comparação com o de Veo 3, resultando em uma menor visibilidade de imagens e detalhes no fundo da cena. Por outro lado, Veo 3 ofereceu um ângulo mais amplo, proporcionando uma experiência de visualização mais imersiva. Isso pode ser considerado uma vantagem para Sora, já que o cenário mencionado no prompt exigia uma profundidade de campo superficial; o vídeo de Sora 2 exibiu uma profundidade de campo mais rasa em comparação com o criado por Veo 3.
Foi interessante observar as decisões feitas pelos criadores em relação à mulher jovem. Sora optou por abordar o tema do guarda-chuva, mesmo que o prompt não tenha sugerido isso diretamente – embora tenha mencionado guarda-chuvas. Embora o vídeo produzido por Sora 2 estivesse correto, o vídeo feito por Veo 3 foi mais cativante, mais minucioso e superior em geral.
Ganador: Observo 3
Tema 2: Pousando como um super-herói
Nós utilizamos os dois geradores de vídeo para produzir vídeos de personagens com direitos autorais, porém não neste contexto específico. Fiquei surpreso ao ver que Sora 2 se recusou a criar o vídeo devido ao uso de material protegido por direitos autorais. Embora o conceito de um super-herói não seja protegido por direitos autorais, parece que há uma tentativa de reprimir a violação de propriedade intelectual após o lançamento.
Enquanto Veo 3 fez um vídeo, ele não ficou conforme solicitado. A instrução exigia que fosse em live-action, porém o rosto do super-herói, ou o pouco que era visível dele, parecia mais animado do que real.
O gerador também teve dificuldades com as leis da física. Durante a maior parte do vídeo, nosso super-herói está em pé sobre o que parece ser um vão no concreto, e as peças de concreto desaparecem no ar quando o super-herói pousa sobre elas. Embora uma solução de engenharia rápida pudesse resolver esse problema, ainda é irritante.
O Google saiu vitorioso nesta situação, embora tenha sido por falta de comparecimento do seu oponente.
Ganador: Observo 3
Tema 3: Times Square futurista com influências cyberpunk.
Felizmente, tanto Veo 3 quanto Sora 2 conseguiram seguir facilmente as instruções deste prompt, criando uma representação do possível aspecto futuro de Times Square, incluindo arranha-céus e outdoors. Ambos também incluíram a solicitação de exibir palavras específicas em um dos outdoors.
Sora 2 teve um desempenho um pouco superior ao tentar reproduzir a estética de Into the Spider-Verse, mesmo que nenhum dos dois tenha sido considerado excelente.
Apesar disso, o vídeo do Veo 3 foi mais cativante do que o do Sora 2, pois apresentava movimento em vez de uma única imagem parada. Frequentemente, os geradores acrescentam detalhes em movimento às imagens estáticas, resultando em algo monótono.
Enquanto Sora 2 respondeu de forma um pouco mais precisa ao estímulo, o conteúdo do vídeo de Veo 3 foi significativamente mais cativante. Por isso, estou atribuindo pontuação positiva a ambos.
Ganhador: Empate
Texto: Tópico 4: Diálogo entre dois amigos
Este comando foi elaborado com o objetivo de avaliar a habilidade dos geradores em produzir áudio complementar ao vídeo. Tanto Veo 3 quanto Sora 2 possuem a capacidade de incluir diálogos e efeitos sonoros.
Inicialmente, vamos falar sobre os gráficos. A instrução era para usar animação 2D, e somente o Veo 3 seguiu essa orientação corretamente. O Sora 2 optou por criar algo utilizando um estilo de animação 3D, ao invés de 2D.
O áudio produzido por Sora 2 foi considerado peculiar, com o diálogo dando a impressão de que os personagens estavam conversando de forma monótona ou hipnotizada. Por outro lado, o diálogo de Veo 3 foi mais vibrante e natural. Os efeitos sonoros de fundo foram semelhantes em ambos os vídeos, incluindo o som de chuva, mas nenhum deles incluiu os sons de copos batendo, conforme solicitado.
O vencedor é facilmente identificado, sendo Veo 3 mais uma vez o destaque.
Ganador: Veo 3
Tópico 5: Bailando ao ar livre
Uma das principais funcionalidades do Sora 2 da OpenAI é o recurso de cameos, que permite criar vídeos com a aparência de pessoas reais que tenham autorizado explicitamente o seu uso. Neste caso, foi feita uma tentativa de produzir um vídeo de dança na rua com a própria pessoa.
No Sora 2, foi simples realizar essa tarefa, uma vez que o aplicativo oferece suporte explícito para esse recurso. Por outro lado, no Veo, a situação foi mais complicada. O Google disponibiliza uma funcionalidade denominada Ingredientes para Vídeo, que permite carregar elementos como imagens para o gerador utilizar na produção do vídeo. Contudo, o Veo 3 não é compatível com o Ingredientes para Vídeo, sendo suportado apenas pelo Veo 2 Fast de baixa qualidade. Além disso, somente é possível criar vídeos no formato de retrato com esse recurso.
Além disso, durante nossos testes com Veo 3, notamos que o Gemini frequentemente não produz vídeos a partir de imagens contendo pessoas. Essa medida é tomada para prevenir deepfakes, o que é positivo, porém a animação de imagens continua sendo uma das aplicações mais comuns de inteligência artificial em vídeo, e Veo 3 torna esse processo desnecessariamente complicado.
Ambos os vídeos tinham um tom peculiar, e digo isso como a pessoa retratada nos mesmos. O rosto no vídeo feito por Veo 2 estava luminoso, e de alguma maneira, Veo 2 optou por me retratar dançando de costas. Já o vídeo produzido por Sora 2 foi mais inventivo, e me vestiu com trajes que eu duvido que usaria na vida real.
Sora foi mais eficaz em me fazer dançar do que Veo 2. Não entendo por que Sora 2 me fez dizer “isso se sente bem”, mas não é tão ruim.
Ganador: Sora 2
Tópico 6: Conteúdo com direitos autorais
Este desafio foi criado para verificar se os geradores são capazes de produzir vídeos com personagens protegidos por direitos autorais. Como observamos no desafio anterior sobre super-heróis, Sora 2 é muito sensível a esse respeito, então não foi surpresa quando ele se recusou a responder aos dois primeiros desafios, mesmo que o segundo não tenha mencionado um personagem específico, apenas fazendo uma referência.
Vejo que o Veo 3 não teve dificuldade em criar um vídeo com um personagem que é protegido por direitos autorais. Isso também foi eficaz com diversos personagens.
Nesta categoria, não há ganhador nem perdedor. Não iremos discutir sobre a criação de conteúdo protegido por direitos autorais aqui. No entanto, é importante considerar que se você deseja fazer vídeos com personagens conhecidos e amados, não será possível usar Sora enquanto o aplicativo estiver sendo monitorado pelos detentores dos direitos autorais.
O ganhador é o Veo 3, e está longe de ser um competidor fraco.

O Sora 2 da OpenAI está recebendo destaque por sua interação social inovadora e sua habilidade de produzir vídeos personalizados. No entanto, apesar de sua capacidade de criar memes, sua funcionalidade é bastante restrita.
O dispositivo Veo 3 do Google produz vídeos de alta qualidade superiores. Se a intenção é utilizar a tecnologia de vídeo AI generativo para propósitos profissionais, como filmagens, jogos, mídias sociais ou publicidade, o Veo 3 é a escolha mais recomendada entre os dois modelos disponíveis.
Sora 2 é reconhecido por sua habilidade em produzir vídeos de alta qualidade, o que é sua principal vantagem atualmente. Por outro lado, o Veo 3, ao ser utilizado no aplicativo Google Flow, oferece uma qualidade superior e uma maior versatilidade, com recursos para orientações tanto horizontais quanto verticais, além de configurações que permitem a criação de múltiplos vídeos simultaneamente.
Reformulação: A empresa Ziff Davis, que é a controladora da Mashable, entrou com um processo contra a OpenAI em abril, acusando-a de violar os direitos autorais da Ziff Davis ao utilizar o treinamento e operar seus sistemas de inteligência artificial.
– OpenAI

