NPC con IA y diálogos en videojuegos: herramientas y análisis realista (2026)
Última actualización: julio de 2026.
Un NPC con IA es un personaje no jugable cuyo diálogo se genera mediante un modelo de lenguaje en tiempo de ejecución, en lugar de escribirse línea por línea de antemano. Hablas o escribes al personaje, el modelo lee un prompt de sistema que define quién es y cuál es el estado actual del juego, y genera una respuesta al instante. Algunas configuraciones también incorporan voz: conversión de voz a texto para que el personaje te escuche y conversión de texto a voz para que te responda hablando. La promesa es un aldeano capaz de contestar preguntas que ningún guionista había previsto. La realidad en 2026 es más compleja y conviene entenderla antes de construir algo alrededor de esta tecnología.
Tus opciones reales se dividen en tres categorías. Puedes usar una plataforma de personajes alojada como Convai, que ofrece memoria, voz y plugins para motores desde el primer momento. Puedes integrar middleware de voz y animación como NVIDIA ACE si quieres que la sincronización labial y la animación facial coincidan con el habla generada. O puedes crear tu propia solución llamando a la API de un modelo de lenguaje —o ejecutando localmente un modelo pequeño— con un prompt definido de forma estricta, lo que resulta más barato y flexible, pero deja las medidas de seguridad en tus manos. Cabe destacar que Inworld, el nombre en el que mucha gente sigue pensando primero, se ha alejado en gran medida de su enfoque como estudio de NPC listo para usar y se ha reposicionado como infraestructura de IA B2B. Por eso, «alternativa a Inworld» es ahora mismo una de las búsquedas más frecuentes en este ámbito. Así es como está realmente el panorama.
Referencia rápida
| Herramienta | Qué es | Modelo de precios | Motores (incluida la web) | Estado en 2026 |
|---|---|---|---|---|
| Convai | Plataforma de NPC alojada: diálogo, voz, memoria y percepción | Basado en uso, nivel gratuito + 29 USD/mes para Indie | Unity, Unreal, three.js y web | Activa y orientada a desarrolladores |
| NVIDIA ACE | Middleware de voz y animación facial (Audio2Face, Riva ASR) | Microservicios por uso / en el dispositivo | Unity, Unreal e independiente del motor | Presente en algunos títulos |
| Inworld | Infraestructura de ejecución de IA + voz/TTS | Créditos basados en uso, TTS desde unos 5-25 USD/1 millón de caracteres | Hay SDK, pero con enfoque B2B | Se ha alejado del estudio de NPC para consumidores |
| Ubisoft Neo NPCs | I+D interna sobre personajes generativos («Teammates») | No es un producto que puedas comprar | Uso interno de Ubisoft | Prueba de juego / I+D, sin lanzamiento |
| Crea tu propia solución | API de LLM o modelo local + tus propios prompts y medidas de seguridad | Tokens de API o gratis si se ejecuta localmente | Cualquier plataforma, incluida la web convencional | La opción más flexible |
Comparativa de herramientas
Convai es la vía de entrada más sencilla si quieres una plataforma de personajes en lugar de un proyecto experimental. Gestiona el diálogo, la voz en tiempo real, la memoria a largo plazo y la «percepción multimodal» para que un personaje pueda reaccionar a lo que ve y oye. Además, ofrece plugins para Unity, Unreal y three.js, así como API abiertas para la web, según su descripción general de la plataforma. El precio se basa en el uso: hay un nivel gratuito para desarrolladores con una cuota diaria y, después, un plan Indie Dev de 29 USD al mes —o 19 USD con facturación anual— por 3000 interacciones, con las interacciones adicionales facturadas por separado. Esa unidad de «interacción» es lo que debes vigilar, porque determina cómo aumentará la factura a medida que crezca el número de jugadores.
NVIDIA ACE no es un cerebro completo para NPC. Es un conjunto de microservicios para los componentes que rodean al cerebro: Audio2Face para generar animación facial a partir de audio y Riva para el reconocimiento de voz, que puedes combinar con el modelo de lenguaje que prefieras. Es la pieza que consigue que una voz generada parezca estar siendo pronunciada de verdad por un rostro. NVIDIA menciona socios como Tencent, NetEase, miHoYo y Ubisoft, y cada vez es más frecuente que el modelo de lenguaje se ejecute en el propio dispositivo como un modelo pequeño en lugar de hacerlo en la nube, algo importante para la latencia y el coste —hablaremos de ello más adelante—. Si tu juego está pensado principalmente para navegadores, ACE probablemente sea excesivo, ya que está orientado a títulos para PC con un uso intensivo de la GPU.
Inworld merece un análisis claro porque es el nombre que domina los tutoriales antiguos. Comenzó como la plataforma de referencia para crear personajes de videojuegos y aún dispone de SDK, pero se ha reposicionado como infraestructura de IA para escalar juegos y contenidos multimedia, con énfasis en la voz, la conversión de texto a voz y un entorno de ejecución de agentes dirigido a empresas como Google, NVIDIA y Xbox. Su sistema de precios se basa en créditos de uso: la conversión de texto a voz cuesta desde unos 25 USD por millón de caracteres en el nivel gratuito On-Demand hasta aproximadamente 5 USD con volúmenes empresariales; la conversión de voz a texto ronda los 0,15 USD por hora, y los modelos de lenguaje se facturan por separado al coste del proveedor. Sigue siendo una opción utilizable, pero un desarrollador web independiente que busque un NPC listo para integrar la encontrará más pesada que antes. Esa es precisamente la razón por la que Convai y las soluciones propias han ocupado su lugar.
Los Neo NPCs de Ubisoft merecen una mención precisamente porque no son un producto que puedas utilizar. Son el esfuerzo de I+D más visible de un gran estudio y ahora se presentan como un prototipo llamado Teammates, que incorpora compañeros de escuadrón con IA controlados por voz en un juego de disparos en primera persona. Fue creado por un equipo de unas 80 personas mediante Google Gemini y middleware interno, y se encuentra en una prueba de juego cerrada, no en un juego ya publicado. Ubisoft ha afirmado que la IA generativa supone un cambio para la industria tan importante como el salto al 3D, pero la situación real a mediados de 2026 es que se trata de un experimento, no de un lanzamiento.
Quién está utilizando realmente esta tecnología en juegos publicados
Si dejamos a un lado las demostraciones, el número de juegos publicados con NPC de IA reales es reducido, aunque por fin es superior a cero. El ejemplo más claro es inZOI, el simulador de vida de Krafton que se lanzó en acceso anticipado el 28 de marzo de 2025 y vendió más de un millón de copias durante su primera semana. Sus personajes «Smart Zoi» se ejecutan mediante un pequeño modelo de lenguaje en el dispositivo creado con NVIDIA ACE, por lo que la IA controla localmente el comportamiento de cada momento en vez de contactar con la nube para generar cada línea. Krafton está ampliando el mismo enfoque a PUBG con un personaje cooperativo llamado PUBG Ally, en pruebas hasta principios de 2026.
En el extremo centrado en la conversación, Where Winds Meet, un MMO de gran tamaño, añadió chat de texto libre mediante LLM a un subconjunto de NPC secundarios, con seguimiento de afinidad para que un personaje pueda encariñarse contigo, negarse a seguir hablando o volverse hostil. La decisión de diseño más reveladora, según un análisis de noviembre de 2025, es lo limitado de su alcance: la IA solo interviene en personajes secundarios ambientales, y sus resultados se restringen a respuestas de texto y un conjunto fijo de indicadores del juego. No puede generar objetos, crear ubicaciones ni reescribir líneas de misiones. La historia principal sigue estando escrita a mano. Los juegos independientes han sido más atrevidos a la hora de convertir la IA en el eje central. Suck Up! es un juego publicado cuyo bucle completo consiste en convencer mediante conversaciones a residentes impulsados por GPT para que inviten a entrar a un vampiro. Funciona porque la conversación es la mecánica, no un adorno añadido sobre una misión guionizada.
El patrón es el mismo en todos los ejemplos publicados. La parte generativa está contenida. Se utiliza para las conversaciones de un simulador de vida, la charla informal de un personaje secundario o un juego creado específicamente en torno a la persuasión. Ningún estudio creíble ha publicado un juego de gran presupuesto en el que la IA escriba los diálogos de la misión principal, y los motivos son, por este orden, el coste, la latencia y la confianza.
Cuánto cuesta y el problema de la latencia
Hay dos factores que rompen la fantasía de que «todos los NPC son chatbots», y ninguno tiene que ver con la inteligencia del modelo.
El primero es la latencia. La conversación tiene un ritmo, y los jugadores perciben cuando se rompe. Las investigaciones sobre NPC con IA señalan que las respuestas inferiores a unos 800 milisegundos parecen naturales dentro de una conversación, mientras que cualquier demora mucho mayor resulta extraña. Un trayecto completo de ida y vuelta a una API general en la nube añade entre uno y dos segundos de retraso, lo que se percibe como una interrupción. Un estudio de 2025 sobre el realismo percibido en la realidad virtual pidió a los jugadores que evaluaran cómo afectaba la latencia a la humanidad que transmitía un personaje, y la petición constante fue sencilla: que el sistema respondiera más rápido. Esta es la razón principal por la que inZOI y PUBG eligieron modelos pequeños ejecutados en el dispositivo en lugar de un modelo gigante en la nube. Un modelo local más pequeño y rápido que responde en medio segundo supera a otro más inteligente que tarda tres.
El segundo es el coste, y escala en la dirección equivocada. Una línea de diálogo escrita a mano se paga una vez y se muestra gratis a millones de jugadores. Una línea generada cuesta dinero cada vez que se produce, por NPC, por jugador y por conversación. Las plataformas basadas en uso lo hacen evidente: Convai factura por interacción, Inworld por carácter de voz y token de texto, y una API de LLM convencional cobra por cada token de entrada y salida. Para un juego tranquilo de un solo jugador con unas pocas conversaciones, supone unos céntimos. Para un juego en vivo con un millón de jugadores diarios hablando libremente, supone una factura de servicios en la nube que nadie había presupuestado. Por eso existen los precios basados en créditos y cuotas, y por eso ofrecer «chat libre con un número ilimitado de NPC» es una forma rápida de quemar dinero. Diseña el número de turnos de IA como diseñarías cualquier otro coste, porque eso es exactamente lo que representa.
Patrones de diseño que funcionan y los que no
El patrón que llega al mercado es la generación restringida, no el chat abierto. En lugar de permitir que un modelo diga cualquier cosa, le proporcionas un prompt de sistema estricto —quién es el personaje, qué sabe y qué no debe revelar jamás—, mantienes las respuestas breves y limitas el resultado a texto más un pequeño conjunto de acciones o indicadores permitidos dentro del juego. El diseño basado en indicadores de Where Winds Meet es un ejemplo de manual: el NPC habla y las únicas acciones estructuradas que puede realizar son cosas como modificar un valor de afinidad o volverse hostil. Todo lo demás queda fuera del control del modelo.
El patrón que falla es el NPC libre de «pregúntame cualquier cosa» insertado en un juego centrado en la historia. Sin restricciones, un modelo inventará datos con total seguridad, se desviará del trasfondo del juego o revelará una misión porque un jugador ha formulado la pregunta capciosa adecuada. Un artículo del sector sostiene, correctamente, que la coherencia del personaje importa más que la inteligencia bruta: los jugadores perdonan que un NPC sea un poco torpe, pero un personaje que se contradice o rompe la ficción destruye la inmersión al instante. De ahí también procede el escepticismo de los jugadores. Muchas demostraciones de NPC con IA parecen conversaciones con un bot de atención al cliente disfrazado, y los jugadores se dan cuenta. Los equipos que lo hacen bien tratan el modelo como un guionista de diálogos que trabaja dentro de una jaula de reglas, no como un oráculo.
Unas pocas medidas de seguridad concretas hacen la mayor parte del trabajo. Proporciona al personaje únicamente lo que debería saber para que no pueda revelar el final. Limita la longitud de las respuestas para que se mantenga dentro del personaje en lugar de comenzar un monólogo. Conserva la versión escrita a mano para cualquier elemento esencial de la trama y reserva la generación para aportar textura: frases breves, conversaciones triviales, reacciones y personajes secundarios. Y decide desde el principio si un NPC concreto necesita realmente ser libre, porque muchos momentos que parecen requerir un «NPC con IA» funcionan mejor con un árbol de diálogos ramificados más inteligente que con una llamada en directo a un modelo.
Cómo probarlo en un juego web
No necesitas un motor que haga un uso intensivo de la GPU para experimentar. La opción más sencilla es llamar a la API de un modelo de lenguaje directamente desde el backend de tu juego con un prompt de sistema que defina al personaje e incluya el estado actual de la partida, y después mostrar la respuesta en un cuadro de diálogo. Es un proyecto de fin de semana y así es exactamente como comienzan la mayoría de los prototipos para navegador. Si quieres que una plataforma gestione la memoria y la voz, Convai cuenta con un SDK web y una integración con three.js para que puedas añadir un personaje parlante a una escena en el navegador sin tener que construir toda la infraestructura.
Si el coste o la privacidad te alejan de la nube, la opción de código abierto ejecuta el modelo en el propio dispositivo del jugador. WebLLM ejecuta un pequeño modelo de lenguaje directamente en el navegador mediante WebGPU, por lo que no hay factura de servidor ni retraso de red una vez cargado, a cambio de una descarga inicial más pesada y de necesitar un dispositivo suficientemente potente. Ejecutar un modelo local mediante una herramienta como Ollama durante el desarrollo es otra forma económica de iterar antes de comprometerte con un proveedor alojado. Elijas lo que elijas, crea primero las restricciones: un prompt de personaje claro, un límite estricto de longitud y una lista fija de acciones que el NPC puede activar.
Si prefieres evitar por completo la integración y limitarte a ver en el navegador personajes con personalidades diferenciadas, para eso está pensado el chat de creación de juegos de Cinevva. Describes la aldea y a sus habitantes, y el agente genera los personajes y sus comportamientos en una escena 3D jugable que puedes abrir y en la que puedes hablar con ellos. Así puedes comprobar si una idea basada en personajes de IA es divertida antes de invertir en un flujo de trabajo completo.
Describe el reparto y Cinevva creará un mundo jugable que podrás recorrer conversando.
Preguntas frecuentes
¿Qué es un PNJ con IA?
Un PNJ con IA es un personaje no jugador cuyos diálogos y, en ocasiones, su comportamiento son generados por un modelo de lenguaje en tiempo de ejecución, en lugar de haber sido escritos de antemano por un guionista. Le escribes o le hablas, el modelo consulta un prompt que describe al personaje y el estado actual del juego, y genera una respuesta al instante. También se pueden añadir capas de voz opcionales con reconocimiento de voz para que pueda oírte y conversión de texto a voz para que pueda responderte hablando.
¿Cuál es la mejor alternativa a Inworld en 2026?
Para la mayoría de los desarrolladores es Convai, que siguió centrándose en ser una plataforma de PNJ integrable con diálogos, voz, memoria y plugins para motores (Unity, Unreal, three.js y web) después de que Inworld se orientara hacia la infraestructura de IA B2B. Si buscas el máximo control y un coste menor, la otra gran alternativa es crear tu propia solución mediante una API de modelos de lenguaje o ejecutar un modelo local con tu propio prompt de sistema y medidas de seguridad. La opción ideal depende de si valoras más la comodidad o el control.
¿Qué juegos publicados utilizan realmente PNJ con IA?
La lista es corta, pero real. El simulador de vida inZOI de Krafton utiliza personajes con IA ejecutada en el dispositivo y creados con NVIDIA ACE, y la empresa está ampliando esta tecnología a PUBG. El MMO Where Winds Meet añadió chat mediante LLM a varios personajes secundarios, con límites estrictos sobre lo que pueden hacer. Títulos independientes como Suck Up! están construidos por completo en torno a conversaciones con personajes impulsados por IA. Los juegos narrativos de gran presupuesto aún no han dejado los diálogos de la misión principal en manos de la IA, y los Neo NPCs de Ubisoft siguen siendo una prueba interna en lugar de una función publicada.
¿Cuánto cuesta ejecutar PNJ con IA?
Cada línea generada cuesta dinero cada vez que se produce, a diferencia de una línea escrita, que solo se paga una vez. Las plataformas alojadas cobran según el uso: Convai cobra por interacción, con un nivel gratuito y un plan independiente de 29 dólares al mes, e Inworld factura por carácter de voz y por token de texto. Una API directa cobra por token. El coste es insignificante para un pequeño juego para un jugador, pero elevado para un juego en vivo con millones de jugadores diarios que mantienen conversaciones abiertas. Por eso los estudios limitan cuántos turnos con IA pueden producirse.
¿Los jugadores perciben los PNJ con IA como un mero truco?
A menudo sí, y ese escepticismo está justificado. Los personajes de IA sin restricciones tienden a inventar hechos, desviarse de la historia del juego o parecer un chatbot disfrazado, lo que rompe la inmersión rápidamente. Las versiones que reciben una buena respuesta de los jugadores están sujetas a límites estrictos: una personalidad clara, respuestas breves y acordes con el personaje, y ninguna capacidad para destripar la trama o contradecir el mundo. La conclusión que se desprende de los ejemplos publicados es que la coherencia importa más que la inteligencia bruta.
¿Cuál es la forma más sencilla de añadir un PNJ con IA a un juego web?
Llama a una API de modelos de lenguaje desde el backend de tu juego con un prompt de sistema que defina al personaje e incluya el estado actual del juego; después, muestra la respuesta en un cuadro de diálogo. Con eso puedes crear un prototipo en un fin de semana. Para evitar la factura de un servidor, puedes ejecutar un modelo pequeño en el navegador con WebLLM sobre WebGPU. Si prefieres que la memoria y la voz ya estén resueltas, Convai ofrece un SDK para web y three.js. En todos los casos, define las restricciones (prompt del personaje, límite de longitud y acciones permitidas) antes de preocuparte por el modelo.
Contenido relacionado
- Los mejores generadores de juegos con IA de 2026 — las herramientas que crean un juego jugable a partir de un prompt
- Cómo crear un juego con IA (sin programar) — el proceso completo, de principio a fin
- Actuación de voz con IA para juegos — la capa de conversión de texto a voz que da voz a los PNJ con IA
- Modelos de IA generativa de vanguardia — los modelos de lenguaje que se encargan de hablar entre bastidores
- Vibe coding de juegos: qué es y cómo empezar — el enfoque de creación rápida de prototipos para poner a prueba ideas como esta
- Diseño de juegos cooperativos — cómo diseñar personajes que comparten un mundo con los jugadores