Skip to content

Kling 3.0 se lanza globalmente con vídeo 4K, audio nativo y generación multitoma

Kuaishou ha lanzado Kling 3.0 a nivel mundial tras anunciarlo por primera vez el 4 de febrero. La actualización incorpora salida 4K/HDR nativa, audio sincronizado con sincronización labial, generación narrativa multitoma y control de movimiento, que permite extraer el movimiento de un vídeo y aplicarlo a personajes completamente diferentes.

Resumen de las nuevas capacidades de Kling 3.0

4K con audio nativo

Kling 3.0 genera vídeo con resolución 4K (3840x2160) y 30 FPS directamente mediante el proceso de difusión. No hay reescalado posterior a la generación. La generación de audio está integrada en la misma pasada, incluido el diálogo con sincronización labial en cinco idiomas: inglés, chino, japonés, coreano y español. Las versiones anteriores requerían pasos separados de doblaje y sincronización de audio. Eso ya no es necesario.

Secuencias narrativas multitoma

La función más destacada es la generación multitoma. Puedes generar una serie de hasta 6 tomas conectadas en una sola sesión, mientras el modelo mantiene la coherencia de los personajes, la iluminación y la continuidad espacial entre cortes. Cada toma puede durar hasta 15 segundos.

Esta función está dirigida directamente al contenido narrativo de formato corto. En lugar de generar clips individuales e intentar unirlos —y lidiar con la inevitable inconsistencia de los personajes entre generaciones—, describes una secuencia y recibes tomas que parecen pertenecer a la misma escena.

Control y transferencia de movimiento

Kling 3.0 puede extraer el movimiento de un vídeo de referencia y aplicarlo a nuevos personajes. Puedes tomar una secuencia de baile, una coreografía de lucha o un gesto específico de un vídeo y trasladarlo a un personaje generado. El modelo incluye un pincel de movimiento para controlar cada fotograma y controles de cámara de 6 ejes para componer las tomas con precisión.

También incorpora una sintaxis con @ para los prompts que permite hacer referencia por nombre a personajes o elementos específicos. Si has establecido un personaje en una generación, puedes volver a invocarlo en prompts posteriores.

Análisis en profundidad de lo que Kling 3.0 cambia en el vídeo generado con IA

El editor 7 en 1

Kling 3.0 incluye lo que Kuaishou denomina un «editor multimodal 7 en 1». Reúne texto a vídeo, imagen a vídeo, vídeo a vídeo, transferencia de movimiento, sincronización labial, extensión y repetición de tomas en un único espacio de trabajo. El objetivo es eliminar el flujo de herramientas fragmentado que suele requerir la producción de vídeo con IA, para la que normalmente se necesitan herramientas independientes para la generación, el doblaje, la igualación de color y el montaje de tomas.

Comparativa

Kling 3.0 compite directamente con Sora 2 Pro de OpenAI y Veo 3.1 de Google. Sobre el papel, Kling tiene ventaja en resolución (4K nativo frente a los 1080p de Sora) y en precio (entre 0,07 y 0,14 dólares por segundo frente a los 0,10-0,50 dólares de Sora). También ofrece un generoso nivel gratuito de 66 créditos al día, mientras que Sora no ofrece ninguno.

Sora 2 sigue a la cabeza en simulación física y gestiona de forma más convincente la refracción de la luz, la dinámica de fluidos y la física de colisiones. También obtiene mejores puntuaciones en fidelidad visual básica en comparaciones directas. El consejo práctico de la mayoría de los analistas es utilizar ambos y elegir el mejor resultado para cada toma concreta.

Para los desarrolladores de videojuegos, la generación multitoma y la transferencia de movimiento de Kling 3.0 son las funciones más interesantes. La posibilidad de generar una secuencia coherente de tomas cinematográficas, con los mismos personajes e iluminación entre cortes, es directamente aplicable a la producción de tráileres y al prototipado de escenas cinemáticas.

Referencias