Kling 3.0 é lançado globalmente com vídeo em 4K, áudio nativo e geração de múltiplas tomadas
A Kuaishou lançou o Kling 3.0 globalmente após anunciá-lo inicialmente em 4 de fevereiro. A atualização traz saída nativa em 4K/HDR, áudio sincronizado com sincronia labial, geração narrativa de múltiplas tomadas e controle de movimento que permite extrair o movimento de um vídeo e aplicá-lo a personagens completamente diferentes.
Visão geral dos novos recursos do Kling 3.0
4K com áudio nativo
O Kling 3.0 gera vídeos em resolução 4K (3840x2160) e 30 FPS diretamente no processo de difusão. Não há aumento de resolução após a geração. A geração de áudio é integrada à mesma passagem de inferência e inclui diálogos com sincronia labial em cinco idiomas: inglês, chinês, japonês, coreano e espanhol. As versões anteriores exigiam etapas separadas de dublagem e sincronização de áudio. Isso não é mais necessário.
Sequências narrativas de múltiplas tomadas
O recurso de maior destaque é a geração de múltiplas tomadas. É possível gerar uma série de até 6 tomadas conectadas em uma única sessão, com o modelo mantendo a consistência dos personagens, da iluminação e da continuidade espacial entre os cortes. Cada tomada pode ter até 15 segundos.
Isso se destina diretamente ao conteúdo narrativo de curta duração. Em vez de gerar clipes individuais e tentar juntá-los — tendo que lidar com as inevitáveis variações dos personagens entre as gerações —, você descreve uma sequência e recebe tomadas que parecem pertencer à mesma cena.
Controle e transferência de movimento
O Kling 3.0 pode extrair o movimento de um vídeo de referência e aplicá-lo a novos personagens. Você pode pegar uma sequência de dança, uma coreografia de luta ou um gesto específico de um vídeo e mapeá-lo para um personagem gerado. O modelo inclui um pincel de movimento para controle quadro a quadro e controles de câmera em 6 eixos para uma composição precisa das tomadas.
Há também uma sintaxe com @ para prompts que permite referenciar personagens ou elementos específicos pelo nome. Se você definiu um personagem em uma geração, pode reutilizá-lo em prompts posteriores.
Análise detalhada do que o Kling 3.0 muda para vídeos gerados por IA
O editor 7 em 1
O Kling 3.0 inclui o que a Kuaishou chama de “editor multimodal 7 em 1”. Ele reúne texto para vídeo, imagem para vídeo, vídeo para vídeo, transferência de movimento, sincronia labial, extensão e refilmagem em um único espaço de trabalho. O objetivo é eliminar o conjunto fragmentado de ferramentas que a produção de vídeos com IA normalmente exige, no qual seriam necessárias ferramentas separadas para geração, dublagem, correspondência de cores e montagem das tomadas.
Comparação com os concorrentes
O Kling 3.0 concorre diretamente com o Sora 2 Pro da OpenAI e o Veo 3.1 do Google. No papel, o Kling leva vantagem na resolução (4K nativo contra 1080p do Sora) e no preço (US$ 0,07–0,14 por segundo contra US$ 0,10–0,50 do Sora). Ele também oferece um generoso plano gratuito de 66 créditos por dia, enquanto o Sora não oferece nenhum.
O Sora 2 ainda lidera em simulação física, reproduzindo refração da luz, dinâmica de fluidos e física de colisões de maneira mais convincente. Ele também alcança pontuações mais altas em fidelidade visual básica nas comparações lado a lado. A recomendação prática da maioria dos avaliadores é usar ambos e escolher o melhor resultado para cada tomada específica.
Para desenvolvedores de jogos, a geração de múltiplas tomadas e a transferência de movimento do Kling 3.0 são os recursos mais interessantes. A capacidade de gerar uma sequência consistente de tomadas cinematográficas, com personagens e iluminação correspondentes entre os cortes, pode ser aplicada diretamente à produção de trailers e à prototipagem de cutscenes.