게임 속 AI NPC와 대화: 도구와 현실 점검 (2026)
최종 업데이트: 2026년 7월.
AI NPC는 미리 한 줄씩 작성된 대사를 사용하는 대신, 실행 중에 언어 모델이 대화를 생성하는 비플레이어 캐릭터입니다. 플레이어가 말하거나 텍스트를 입력하면 모델은 캐릭터의 정체성과 현재 게임 상태를 정의한 시스템 프롬프트를 읽고 즉석에서 답변을 작성합니다. 일부 구성은 음성 기능도 추가합니다. 음성 인식으로 캐릭터가 플레이어의 말을 듣고, 음성 합성으로 직접 대답하게 만드는 방식입니다. 작가가 예상하지 못한 질문에도 답하는 마을 주민을 만들 수 있다는 것이 홍보 문구입니다. 하지만 2026년의 현실은 좀 더 복잡하며, 이를 중심으로 무언가를 만들기 전에 제대로 이해할 필요가 있습니다.
실질적인 선택지는 세 가지로 나뉩니다. 메모리, 음성, 엔진 플러그인을 기본 제공하는 Convai 같은 호스팅형 캐릭터 플랫폼을 사용할 수 있습니다. 생성된 음성에 립싱크와 표정 애니메이션을 맞추고 싶다면 NVIDIA ACE 같은 음성 및 애니메이션 미들웨어를 연결할 수 있습니다. 또는 정교하게 작성한 프롬프트로 언어 모델 API를 호출하거나 소형 모델을 로컬에서 실행해 직접 구축할 수도 있습니다. 이 방식은 더 저렴하고 유연하지만 안전장치도 직접 마련해야 합니다. 특히 아직도 많은 사람이 가장 먼저 떠올리는 Inworld는 플러그 앤 플레이 방식의 NPC 스튜디오에서 상당 부분 물러나 B2B AI 인프라로 방향을 전환했습니다. 그래서 현재 이 분야에서 가장 흔한 검색어 중 하나가 바로 "Inworld 대안"입니다. 실제 시장 상황을 살펴보겠습니다.
빠른 참고표
| 도구 | 정의 | 가격 모델 | 엔진(웹 포함) | 2026년 현황 |
|---|---|---|---|---|
| Convai | 대화, 음성, 메모리, 인지 기능을 제공하는 호스팅형 NPC 플랫폼 | 사용량 기반, 무료 티어 + 월 $29 인디 요금제 | Unity, Unreal, three.js, 웹 | 활발히 운영 중, 개발자 대상 |
| NVIDIA ACE | 음성 + 얼굴 애니메이션 미들웨어(Audio2Face, Riva ASR) | 사용량 기반 마이크로서비스 / 온디바이스 | Unity, Unreal, 엔진 비종속적 | 일부 타이틀에 출시됨 |
| Inworld | AI 런타임 + 음성/TTS 인프라 | 사용량 기반 크레딧, TTS는 약 $5~25/100만 자부터 | SDK는 존재하지만 B2B 중심 | 소비자용 NPC 스튜디오에서 방향 전환 |
| Ubisoft Neo NPCs | 자체 생성형 캐릭터 연구개발("Teammates") | 구매할 수 있는 제품이 아님 | Ubisoft 내부용 | 플레이테스트 / 연구개발 단계, 미출시 |
| 직접 구축 | LLM API 또는 로컬 모델 + 자체 프롬프트와 안전장치 | API 토큰, 로컬 실행 시 무료 | 일반 웹을 포함한 모든 환경 | 가장 유연한 방법 |
도구 비교
Convai는 연구 프로젝트가 아닌 완성된 캐릭터 플랫폼을 원할 때 가장 쉽게 시작할 수 있는 선택지입니다. 대화, 실시간 음성, 장기 메모리를 처리하며, 캐릭터가 보고 듣는 것에 반응할 수 있도록 "멀티모달 인지"도 지원합니다. 플랫폼 개요에 따르면 Unity, Unreal, three.js용 플러그인과 웹용 개방형 API를 제공합니다. 가격은 사용량 기반입니다. 일일 할당량이 있는 무료 Developer 티어가 있으며, 이후에는 월 $29 또는 연간 결제 시 월 $19에 3,000회 상호작용을 제공하는 Indie Dev 요금제를 사용할 수 있습니다. 초과 사용분은 상호작용당 과금됩니다. 플레이어 수에 따라 비용이 늘어나는 기준이 바로 이 "상호작용" 단위이므로 주의해야 합니다.
NVIDIA ACE는 완전한 NPC 두뇌가 아닙니다. 원하는 언어 모델과 결합해 사용하는, 두뇌 주변 기능을 위한 마이크로서비스 모음입니다. 여기에는 오디오로 얼굴 애니메이션을 생성하는 Audio2Face와 음성 인식을 위한 Riva가 포함됩니다. 생성된 음성이 얼굴에서 실제로 발화되는 것처럼 보이게 만드는 구성 요소입니다. NVIDIA는 Tencent, NetEase, miHoYo, Ubisoft 등을 파트너로 소개하고 있습니다. 또한 지연 시간과 비용 측면에서 중요한 변화로, 언어 모델을 클라우드가 아닌 소형 온디바이스 모델로 실행하는 사례가 늘고 있습니다. 이 부분은 아래에서 더 자세히 다룹니다. 브라우저 중심 게임이라면 GPU를 많이 사용하는 PC 타이틀을 겨냥한 ACE는 필요 이상으로 무거울 가능성이 큽니다.
Inworld는 오래된 튜토리얼에서 가장 많이 등장하는 이름이기 때문에 냉정하게 짚고 넘어갈 필요가 있습니다. 처음에는 게임 캐릭터 제작을 위한 대표 플랫폼으로 출발했으며 여전히 SDK를 제공하지만, 지금은 게임과 미디어의 확장을 위한 AI 인프라로 재편되었습니다. Google, NVIDIA, Xbox 같은 기업을 대상으로 음성, 텍스트 음성 변환, 에이전트 런타임에 집중하고 있습니다. 가격은 사용량 기반 크레딧 시스템입니다. 텍스트 음성 변환은 무료 On-Demand 티어에서 100만 자당 약 $25부터 시작해 엔터프라이즈 규모에서는 약 $5까지 내려갑니다. 음성 텍스트 변환은 시간당 약 $0.15이며, 언어 모델 비용은 제공업체 원가에 따라 별도로 청구됩니다. 여전히 사용할 수는 있지만, 바로 적용할 수 있는 NPC를 찾는 1인 웹 개발자에게는 예전보다 부담이 큰 플랫폼입니다. 바로 이 때문에 Convai와 직접 구축 방식이 그 자리를 대신하게 되었습니다.
Ubisoft의 Neo NPCs는 사용할 수 있는 제품이 아니라는 점에서 언급할 가치가 있습니다. 대형 스튜디오의 연구개발 가운데 가장 눈에 띄는 사례이며, 현재는 1인칭 슈팅 게임에 음성으로 상호작용하는 AI 분대원을 배치한 Teammates라는 프로토타입으로 공개되었습니다. 이 프로젝트는 약 80명으로 구성된 팀이 Google Gemini와 자체 미들웨어를 사용해 개발했으며 비공개 플레이테스트를 진행 중입니다. 출시된 게임은 아닙니다. Ubisoft는 생성형 AI가 3D로의 전환만큼 업계에 큰 변화를 가져올 것이라고 평가했지만, 2026년 중반 현재 솔직한 상태는 출시가 아니라 실험 단계입니다.
실제로 출시한 곳은 어디인가
데모를 제외하면 진정한 AI NPC를 탑재해 출시된 게임은 아직 적지만, 마침내 0개보다는 많아졌습니다. 가장 분명한 사례는 Krafton의 생활 시뮬레이션 게임 inZOI입니다. 이 게임은 2025년 3월 28일 앞서 해보기로 출시되었으며 첫 주에 100만 장 이상 판매되었습니다. "Smart Zoi" 캐릭터는 NVIDIA ACE로 구축한 온디바이스 소형 언어 모델에서 실행됩니다. 따라서 모든 대사마다 클라우드에 요청하는 대신 AI가 순간순간의 행동을 로컬에서 제어합니다. Krafton은 같은 방식을 PUBG에도 확장하고 있으며, PUBG Ally라는 함께 플레이할 수 있는 캐릭터를 2026년 초까지 테스트하고 있습니다.
대화를 중심에 둔 사례로는 대형 MMO인 Where Winds Meet가 있습니다. 일부 보조 NPC에게 LLM 기반 자유 형식 텍스트 채팅을 추가했으며, 호감도 추적을 통해 캐릭터가 플레이어에게 호감을 느끼거나 대화를 거부하거나 적대적으로 변할 수 있습니다. 2025년 11월 분석에서 드러난 핵심적인 설계 선택은 매우 좁은 적용 범위입니다. AI는 주변의 보조 캐릭터에만 사용되며, 출력도 텍스트 답변과 미리 정해진 게임 내 플래그로 제한됩니다. 아이템을 생성하거나 장소를 만들거나 퀘스트 흐름을 다시 쓸 수는 없습니다. 메인 스토리는 계속 사람이 직접 작성합니다. 인디 게임은 AI 자체를 게임의 핵심으로 삼는 데 더 과감했습니다. 정식 출시된 Suck Up!은 GPT 기반 주민을 설득해 뱀파이어를 집 안으로 초대하게 만드는 것이 전체 게임 루프입니다. 대화가 각본형 퀘스트에 덧붙인 장식이 아니라 게임 메커니즘 자체이기 때문에 가능한 구성입니다.
출시된 모든 사례에서 반복되는 패턴은 같습니다. 생성형 요소의 범위가 제한되어 있습니다. 생활 시뮬레이션의 잡담, 보조 캐릭터의 일상 대화, 또는 설득을 중심으로 특별히 설계된 게임에 활용됩니다. 신뢰할 만한 대형 게임 중 AI가 메인 퀘스트 대사를 작성하도록 한 사례는 없습니다. 그 이유는 순서대로 비용, 지연 시간, 신뢰성입니다.
비용과 지연 시간 문제
"모든 NPC가 챗봇"이라는 환상을 깨뜨리는 요소는 두 가지이며, 어느 쪽도 모델이 얼마나 똑똑한지와는 관계가 없습니다.
첫 번째는 지연 시간입니다. 대화에는 리듬이 있고 플레이어는 그 흐름이 끊기는 순간을 느낍니다. AI NPC 관련 연구에 따르면 약 800밀리초 이내의 응답은 자연스러운 대화로 느껴지지만, 그보다 훨씬 느리면 어색하게 느껴집니다. 일반적인 클라우드 API 왕복에는 1~2초의 지연이 더해져 대화가 멈춘 것처럼 보입니다. 가상 현실에서의 지각된 사실감을 다룬 2025년 연구에서는 지연 시간이 캐릭터의 인간다움에 어떤 영향을 미치는지 플레이어가 평가했으며, 일관되게 나온 요구는 단순히 시스템이 더 빠르게 응답해야 한다는 것이었습니다. 이것이 inZOI와 PUBG가 거대한 클라우드 모델 대신 소형 온디바이스 모델을 선택한 가장 큰 이유입니다. 3초 만에 답하는 더 똑똑한 모델보다 0.5초 만에 답하는 더 작고 빠른 로컬 모델이 낫습니다.
두 번째는 비용이며, 잘못된 방향으로 규모가 커집니다. 사람이 작성한 대사 한 줄은 한 번만 비용을 지불하면 수백만 명의 플레이어에게 무료로 보여줄 수 있습니다. 생성된 대사는 NPC별, 플레이어별, 대화별로 만들어질 때마다 비용이 발생합니다. 사용량 기반 플랫폼은 이를 명확하게 보여줍니다. Convai는 상호작용당, Inworld는 음성 문자 수와 텍스트 토큰 수에 따라 과금하며, 일반 LLM API는 입력과 출력 토큰마다 비용을 청구합니다. 대화가 몇 번뿐인 조용한 싱글플레이 게임이라면 몇 센트에 불과합니다. 하지만 매일 100만 명의 플레이어가 자유롭게 대화하는 라이브 게임이라면 누구도 예산에 넣지 않았던 거액의 클라우드 청구서가 됩니다. 크레딧과 할당량 기반 가격 정책이 존재하는 이유도, "무제한 NPC와의 자유 대화"가 순식간에 돈을 태우는 방법인 이유도 여기에 있습니다. AI 대화 횟수도 다른 비용 요소와 마찬가지로 설계해야 합니다. 실제로 비용이기 때문입니다.
효과적인 디자인 패턴과 실패하는 패턴
실제로 출시되는 패턴은 개방형 채팅이 아니라 제한된 생성입니다. 모델이 아무 말이나 하게 두는 대신, 캐릭터의 정체성, 알고 있는 정보, 절대 공개해서는 안 되는 내용을 포함한 엄격한 시스템 프롬프트를 제공합니다. 답변은 짧게 유지하고, 출력은 텍스트와 소수의 허용된 게임 내 행동 또는 플래그로 제한합니다. Where Winds Meet의 플래그 기반 설계가 교과서적인 사례입니다. NPC는 대화하지만, 구조화된 행동은 호감도 값을 변경하거나 적대적으로 변하는 것 등으로 제한됩니다. 그 외의 모든 것은 모델의 손이 닿지 않는 곳에 둡니다.
실패하는 패턴은 스토리 중심 게임에 자유 형식의 "무엇이든 물어보세요" NPC를 집어넣는 것입니다. 제약이 없으면 모델은 존재하지 않는 사실을 자신 있게 만들어내거나 게임 설정에서 벗어나거나, 플레이어가 적절한 유도 질문을 했다는 이유로 퀘스트의 비밀을 누설합니다. 한 업계 분석에서는 순수한 지능보다 캐릭터의 일관성이 더 중요하다고 정확히 지적합니다. 플레이어는 조금 둔한 NPC는 용서하지만, 스스로 모순되거나 게임 세계의 설정을 깨뜨리는 캐릭터는 즉시 몰입을 무너뜨립니다. 플레이어의 회의적인 시선도 여기에서 비롯됩니다. 많은 AI NPC 데모는 의상을 입은 고객 지원 봇과 대화하는 것처럼 느껴지며 플레이어는 이를 알아챕니다. 제대로 구현하는 팀은 모델을 신탁처럼 대하지 않고, 규칙이라는 울타리 안에서 일하는 대사 작가로 취급합니다.
몇 가지 구체적인 안전장치만으로도 대부분의 문제를 해결할 수 있습니다. 결말을 누설할 수 없도록 캐릭터가 알아야 하는 정보만 제공하세요. 독백을 늘어놓다가 캐릭터성을 잃지 않도록 답변 길이를 제한하세요. 줄거리의 핵심을 지탱하는 내용에는 사람이 작성한 버전을 유지하고, 생성 기능은 분위기를 더하는 요소인 짧은 반응 대사, 잡담, 반응, 보조 캐릭터에만 사용하세요. 또한 해당 NPC에게 정말 자유 형식 대화가 필요한지 먼저 결정해야 합니다. 많은 "AI NPC" 장면은 실시간 모델 호출보다 더 정교한 분기형 대화 트리가 더 적합합니다.
웹 게임에서 시험하는 방법
실험하기 위해 GPU 집약적인 엔진이 필요한 것은 아닙니다. 가장 간단한 방법은 캐릭터를 정의하는 시스템 프롬프트에 현재 게임 상태를 주입하고, 게임 백엔드에서 언어 모델 API를 직접 호출한 다음 답변을 대화 상자에 표시하는 것입니다. 주말 동안 만들 수 있는 프로젝트이며, 대부분의 브라우저 프로토타입도 바로 이런 방식으로 시작합니다. 메모리와 음성을 플랫폼에 맡기고 싶다면 Convai가 웹 SDK와 three.js 연동 기능을 제공하므로 기반 기능을 직접 만들지 않고도 브라우저 장면에 말하는 캐릭터를 연결할 수 있습니다.
비용이나 개인정보 보호 문제로 클라우드를 피하고 싶다면, 오픈 소스 방식으로 플레이어의 기기에서 모델을 실행할 수 있습니다. WebLLM은 WebGPU를 사용해 소형 언어 모델을 브라우저에서 직접 실행합니다. 초기 다운로드 용량이 더 크고 성능이 충분한 기기가 필요하지만, 로딩이 끝나면 서버 비용도 네트워크 지연도 없습니다. 개발 중에는 Ollama 같은 도구로 로컬 모델을 실행하는 것도 호스팅 제공업체를 선택하기 전에 저렴하게 반복 개발할 수 있는 방법입니다. 어떤 방식을 선택하든 제약 조건부터 만드세요. 명확한 캐릭터 프롬프트, 엄격한 길이 제한, NPC가 실행할 수 있는 고정된 행동 목록이 필요합니다.
연결 작업을 모두 건너뛰고 개성 있는 캐릭터들이 브라우저에서 움직이는 모습을 보고 싶다면, 바로 그런 용도로 Cinevva의 게임 채팅이 만들어졌습니다. 마을과 그 안의 사람들을 설명하면 에이전트가 캐릭터와 행동을 생성해 직접 열어 대화할 수 있는 플레이 가능한 3D 장면으로 만듭니다. 전체 파이프라인에 투자하기 전에 AI 캐릭터 아이디어가 재미있는지 직접 확인할 수 있습니다.
등장인물을 설명하면 Cinevva가 대화하며 진행할 수 있는 플레이 가능한 세계를 만들어 드립니다.
자주 묻는 질문
AI NPC란 무엇인가요?
AI NPC는 작가가 대사를 미리 작성하는 대신, 런타임에 언어 모델이 대사와 경우에 따라 행동까지 생성하는 비플레이어 캐릭터입니다. 플레이어가 텍스트나 음성으로 말을 걸면 모델이 캐릭터와 현재 게임 상태를 설명하는 프롬프트를 읽고 즉석에서 답변을 생성합니다. 선택적으로 음성 레이어를 추가하면 음성 인식으로 플레이어의 말을 듣고, 텍스트 음성 변환으로 대답하게 할 수 있습니다.
2026년 최고의 Inworld 대안은 무엇인가요?
대부분의 개발자에게는 Convai가 가장 좋은 대안입니다. Inworld가 B2B AI 인프라로 방향을 전환한 이후에도 Convai는 대화, 음성, 기억, 엔진 플러그인(Unity, Unreal, three.js, 웹)을 제공하는 플러그인형 NPC 플랫폼에 집중해 왔습니다. 최대한의 제어권과 낮은 비용을 원한다면 언어 모델 API를 직접 호출하거나, 자체 시스템 프롬프트와 가드레일을 적용한 로컬 모델을 실행하는 것도 강력한 대안입니다. 어떤 방식이 적합한지는 편의성과 제어권 중 무엇을 더 중시하는지에 따라 달라집니다.
실제로 출시된 게임 중 AI NPC를 사용하는 게임은 무엇인가요?
목록은 짧지만 실제 사례가 있습니다. Krafton의 인생 시뮬레이션 게임 inZOI는 NVIDIA ACE로 구현된 온디바이스 AI 캐릭터를 사용하며, 이 기술을 PUBG에도 확대 적용하고 있습니다. MMO Where Winds Meet는 일부 조연 캐릭터에게 LLM 채팅을 추가했지만, 이들이 할 수 있는 행동에는 엄격한 제한을 두었습니다. Suck Up! 같은 인디 게임은 AI 캐릭터와 대화하는 경험을 중심으로 게임 전체를 구성했습니다. 대규모 예산의 스토리 게임은 아직 메인 퀘스트 대사를 AI에 맡기지 않았으며, Ubisoft의 Neo NPCs도 출시된 기능이 아니라 내부 플레이테스트 단계에 머물러 있습니다.
AI NPC 운영 비용은 얼마나 드나요?
한 번 비용을 지불하면 끝나는 미리 작성된 대사와 달리, 생성형 대사는 생성될 때마다 비용이 발생합니다. 호스팅 플랫폼은 사용량에 따라 요금을 청구합니다. Convai는 상호작용당 요금을 부과하며 무료 등급과 월 29달러의 인디 플랜을 제공하고, Inworld는 음성의 글자 수와 텍스트의 토큰 수를 기준으로 요금을 부과합니다. API를 직접 사용하면 토큰당 비용이 청구됩니다. 소규모 싱글플레이어 게임에서는 부담이 미미하지만, 수백만 명의 일일 플레이어가 자유롭게 대화를 나누는 라이브 게임에서는 비용이 크게 늘어납니다. 스튜디오가 실제 AI 대화 횟수를 제한하는 이유도 여기에 있습니다.
플레이어는 AI NPC를 단순한 눈속임으로 느끼나요?
그런 경우가 많으며, 이러한 회의적인 반응에는 타당한 이유가 있습니다. 제약이 없는 AI 캐릭터는 사실을 지어내거나 게임의 이야기에서 벗어나고, 겉모습만 캐릭터인 챗봇처럼 느껴지는 경향이 있어 몰입감을 빠르게 무너뜨립니다. 플레이어의 반응이 좋은 구현은 명확한 성격, 캐릭터다운 짧은 답변, 줄거리를 누설하거나 세계관과 모순되는 말을 할 수 없도록 하는 제한 등 엄격한 제약을 적용합니다. 출시 사례에서 얻을 수 있는 핵심 교훈은 순수한 지능보다 일관성이 더 중요하다는 것입니다.
웹 게임에 AI NPC를 추가하는 가장 쉬운 방법은 무엇인가요?
캐릭터를 정의하는 시스템 프롬프트에 현재 게임 상태를 주입해 게임 백엔드에서 언어 모델 API를 호출한 다음, 생성된 답변을 대화 상자에 표시하면 됩니다. 주말 동안 프로토타입으로 구현할 수 있는 수준입니다. 서버 비용을 피하려면 WebGPU 기반 WebLLM을 사용해 브라우저에서 소형 모델을 실행할 수 있습니다. 기억과 음성 기능까지 대신 처리해 주는 서비스를 원한다면 Convai의 웹 및 three.js SDK를 사용할 수 있습니다. 어떤 방식을 선택하든 모델을 고민하기 전에 먼저 제약 조건(캐릭터 프롬프트, 길이 제한, 허용되는 행동)을 작성하세요.
관련 문서
- 2026년 최고의 AI 게임 생성기 — 프롬프트로 플레이 가능한 게임을 만드는 도구
- AI로 게임을 만드는 방법(코딩 불필요) — 처음부터 끝까지 알아보는 전체 제작 과정
- 게임용 AI 음성 연기 — AI NPC에게 목소리를 부여하는 텍스트 음성 변환 레이어
- 최첨단 생성형 AI 모델 — 내부에서 대화를 생성하는 언어 모델
- 바이브 코딩 게임: 개념과 시작 방법 — 이와 같은 아이디어를 테스트하기 위한 빠른 프로토타이핑 방식
- 협동 게임 디자인 — 플레이어와 같은 세계를 공유하는 캐릭터 설계하기