게임용 AI 성우 연기: 도구, 비용, 규정(2026년)
마지막 업데이트: 2026년 7월.
네, 상업용 게임에 AI 생성 음성을 사용할 수 있으며, 대부분의 1인 및 소규모 스튜디오 개발자에게는 비용도 저렴합니다. ElevenLabs 같은 도구의 유료 플랜은 월 6달러부터 시작하고 상업용 라이선스가 포함되므로, 생성한 대사를 판매용 게임에 넣어 출시할 수 있습니다. OpenAI의 텍스트 음성 변환 API는 오디오 1분당 약 0.015달러이며 상업적 사용도 허용됩니다. Piper와 Kokoro처럼 허용 범위가 넓은 라이선스의 오픈 소스 모델은 실행 비용이 들지 않고 상업적으로 출시할 수 있지만, XTTS v2 같은 다른 모델은 비상업용이므로 무엇을 판매할 수 있는지는 해당 모델의 라이선스에 따라 결정됩니다. 대사가 수백 줄 정도인 일반적인 인디 게임이라면 생성 비용은 무료에서 약 20~30달러 사이입니다.
문제는 돈이 아니라 규정과 반응입니다. 무료 등급은 거의 항상 상업적 사용을 허용하지 않고 일반적으로 결과물에 출처 표시를 요구하므로, 실제로 게임을 출시할 수 있는 “무료” 도구는 라이선스에서 이를 명시적으로 허용하는 도구뿐입니다. 실제 인물의 음성을 허락 없이 복제하면 시간을 절약하는 것이 아니라 소송을 당하거나 게임이 목록에서 삭제될 수 있습니다. Steam에서는 AI 음성 대사를 비롯해 플레이어에게 노출되는 AI 콘텐츠를 공개해야 합니다. 플레이어도 이를 알아챕니다. 2025년과 2026년에 여러 게임이 AI 음성 사용으로 거센 반발을 샀으므로, 이를 창작상의 선택이 아닌 조용한 비용 절감 수단으로 취급하는 것은 잘못입니다. 이 가이드에서는 도구, 실제 비용, 노조 및 스토어 규정, 그리고 그냥 사람을 고용하는 편이 나은 경우를 살펴봅니다.
빠른 참고: 도구 비교
| 도구 | 가격(2026년) | 상업용 라이선스 | 음성 복제 정책 | 품질 참고 사항 |
|---|---|---|---|---|
| ElevenLabs | 무료 등급, 이후 월 6달러(Starter)부터 월 99달러(Pro)까지 | 유료 플랜만 해당, 해지 후에도 영구 유지 | Starter에서 즉석 복제, Creator+에서 전문가용 복제, 실제 음성은 동의 필요 | 감정 표현과 연기력이 업계 최고 수준이며 게임 대사의 기본 선택지 |
| OpenAI TTS (gpt-4o-mini-tts) | 오디오 1분당 약 0.015달러, 사용량 기반 결제 | 가능, OpenAI 사용 정책 적용 | 사전 설정 음성만 제공, 복제 불가 | 저렴하고 자연스러우며 대량 생성에 적합하지만 세밀한 연출은 어려움 |
| Murf | 유료 플랜에 상업적 사용 권리 포함 | 모든 유료 플랜 | 상위 등급에서 복제 가능 | 빠른 속도(저지연 Falcon 모델), 스튜디오 스타일 내레이션 |
| Resemble AI | 유료 플랜 및 오픈 소스 Chatterbox | 유료 플랜에서 가능하며 MIT 라이선스 Chatterbox도 제공 | 복제가 핵심 기능이며 동의 필요 | Chatterbox에는 게임 캐릭터에 유용한 “과장” 조절 기능이 있음 |
| XTTS v2 (Coqui) | 무료, 자체 호스팅 | CPML, 비상업용 가중치, 프로토타입 용도로만 사용 가능 | 약 6초 분량으로 복제, 17개 언어 | 최고의 로컬 다국어 음성 복제 모델이지만 GPU 필요 |
| Piper | 무료, 자체 호스팅 | 허용 범위가 넓어 출시 가능 | 사전 설정 음성, 복제 불가 | CPU에서 실시간으로 실행되며 임베디드 또는 저사양 환경에 적합 |
가격과 약관은 달라질 수 있으므로, 이를 기반으로 파이프라인을 구축하기 전에 제공업체의 공식 페이지에서 현재 라이선스를 확인하세요. 이 가이드의 나머지 부분에서는 이 표의 내용이 판매할 게임에 실제로 어떤 의미인지 설명합니다.
각 도구와 적합한 용도
ElevenLabs는 대부분의 게임 개발자가 가장 먼저 찾는 도구이며, 그럴 만한 이유가 있습니다. 다른 대안보다 폭넓은 감정과 자연스러운 호흡을 더 잘 구현합니다. 대사를 단순히 소리 내어 읽는 것이 아니라 겁먹거나 빈정대거나 지친 것처럼 들리게 해야 할 때 중요한 차이입니다. 무료 등급은 매월 10,000크레딧을 제공하지만 상업적 사용 권리가 없고 출처 표시가 필수이므로 테스트 용도로만 적합합니다. 월 6달러인 Starter 플랜에는 상업용 라이선스와 30,000크레딧이 추가됩니다. 표준 모델에서는 텍스트 한 글자당 1크레딧이므로 음성 약 30분 분량입니다. 월 22달러인 Creator는 약 121,000크레딧과 전문가용 음성 복제를 제공하고, 월 99달러인 Pro는 600,000크레딧을 제공합니다. 대부분의 소규모 게임에는 6달러 또는 22달러 등급이면 충분합니다.
OpenAI의 텍스트 음성 변환은 가성비가 뛰어난 선택지입니다. gpt-4o-mini-tts 모델은 생성된 오디오 1분당 약 0.015달러이며 API를 통해 사용량 기반으로 과금되고, OpenAI 사용 정책에 따라 상업적 사용도 허용됩니다. 사전 설정된 음성만 사용할 수 있고 복제는 지원하지 않으며 ElevenLabs보다 세밀한 연출은 어렵지만, 수백 개의 짧은 대사와 외침을 생성해야 한다면 가격 면에서 따라오기 어렵습니다. 대량으로 필요한 중요도가 낮은 대사에 적합합니다.
Murf는 스튜디오 내레이션 수요에 더 초점을 맞춥니다. 모든 유료 플랜에 상업적 사용 권리가 포함되며, 최신 Falcon 모델은 낮은 지연 시간을 목표로 설계되었습니다. 독립 테스트에서 약 55ms로 보고되었는데, 이는 미리 생성하는 게임 대사보다 실시간 에이전트에서 더 중요합니다. Resemble AI는 두 가지 이유로 알아둘 만합니다. 유료 제품이 음성 복제를 중심으로 설계되었으며, 허용 범위가 넓은 라이선스의 오픈 소스 모델인 Chatterbox도 공개합니다. Chatterbox에는 음성을 캐리커처 수준으로 밀어붙이는 “과장” 매개변수가 있어 게임 캐릭터와 크리처에 실질적으로 유용합니다.
오픈 소스 쪽에서는 현재 폐업한 Coqui의 XTTS v2가 여전히 2026년 최고의 로컬 다국어 음성 복제 엔진으로 평가됩니다. 약 6초 분량의 오디오만으로 17개 언어에서 음성을 복제할 수 있으며, 회사가 2024년 1월 폐업했지만 커뮤니티 포크를 통해 명맥을 이어가고 있습니다. 다만 프로토타입 용도로만 취급하세요. 모델 가중치가 비상업용인 Coqui의 CPML 라이선스로 배포되므로 판매할 게임에는 합법적으로 사용할 수 없습니다. Piper는 정반대에 있습니다. GPU 없이 CPU에서 실시간으로 실행되므로 임베디드 시스템, 저사양 하드웨어 또는 게임 내부에서 런타임에 음성을 생성하는 용도에 적합합니다. Bark는 MIT 라이선스를 사용하며 웃음이나 한숨 같은 비언어적 소리를 생성할 수 있고, Kokoro는 상업적으로 출시할 수 있는 경량 영어 중심 선택지입니다. Skyrim 스타일 모딩에서는 xVASynth 같은 도구가 오랫동안 커스텀 NPC 대사 제작의 커뮤니티 표준이었지만, 모더라면 배포하기 전에 원작 게임과 도구의 약관을 확인하세요.
이 분야에 관해 한 가지 참고할 사항이 있습니다. Play.ht는 2025년 중반 Meta에 인수된 뒤 그해 말 서비스를 종료한 것으로 알려졌으므로, 이전 글에서 추천하는 내용을 보더라도 건너뛰세요.
실제 비용
분당 및 글자당 가격만으로는 전체 상황을 파악하기 어려우므로 실제 계산을 해보겠습니다. 예를 들어 대사 300줄, 줄당 평균 12단어인 짧은 내러티브 게임은 약 21,600자입니다. ElevenLabs에서는 Starter 플랜의 월간 한도 안에 들어가므로 게임 전체의 음성 예산이 6달러이며, 복제 음성이나 더 높은 품질의 음성을 원한다면 22달러입니다. OpenAI API에서는 같은 대본이 오디오 몇 분 분량에 불과해 1달러도 들지 않습니다. 오픈 소스 모델은 자체 컴퓨팅 자원과 시간을 제외하면 비용이 들지 않습니다.
비용이 실제로 늘어나는 지점은 반복 작업과 규모입니다. 첫 생성에서 원하는 대사가 나오는 경우는 드물고, 연기를 다시 생성하고 강조점을 조정하며 대본 변경 후 재생성하는 과정에서 모두 크레딧이 소모됩니다. 수천 줄의 대사, 대사마다 여러 테이크, 여러 언어를 포함하는 대화 중심 RPG라면 99달러 플랜이 필요하거나 상당한 API 비용이 발생할 수 있습니다. 하지만 그런 경우에도 인간 성우진 전체를 고용하는 데 드는 수천 달러와 비교하면 수십 달러에서 많아야 수백 달러 초반 수준입니다. 솔직히 말하면 AI 음성의 원본 생성 비용은 저렴하며, 비용이 비싸지는 것도 AI 음성 자체를 기준으로 비교할 때뿐이지 노조 소속 성우진을 고용하는 비용에 비하면 결코 비싸지 않습니다. 예산이 0이라면 무료 등급으로 프로토타입을 만들 수 있고, 라이선스만 준수한다면 오픈 소스 모델로 출시 가능한 게임을 만들 수 있습니다.
라이선스 및 노조 규정
많은 사람이 실수하는 부분이므로 주의 깊게 읽으세요. 라이선스에는 별개의 두 가지 문제가 있으며, 둘을 혼동하기 쉽습니다.
첫 번째는 도구의 라이선스로, 생성한 결과물을 판매할 수 있는지를 규정합니다. ElevenLabs, Murf, Resemble 및 OpenAI의 유료 등급에서는 판매가 허용됩니다. 특히 ElevenLabs의 경우 유료 구독 기간에 생성한 오디오는 구독을 해지한 후에도 상업적 사용 권리가 유지됩니다. 세부 약관에서 알아둘 사항은 두 가지입니다. 기본 대본과 콘텐츠에 대한 권리를 보유하고 있어야 하며, ElevenLabs 같은 제공업체는 생성된 콘텐츠를 모델 훈련 및 개선에 사용할 수 있는 라이선스를 보유합니다. 무료 등급은 대개 상업적 사용을 금지하고 출처 표시를 요구하므로 함정이 될 수 있습니다. 무료 등급의 결과물을 사용해 출시한 게임은 약관을 준수하지 않은 것입니다. 오픈 소스 모델의 경우 라이선스는 도구 유형이 아니라 특정 모델에 귀속되므로, 이를 기반으로 개발하기 전에 MIT인지 Apache인지 또는 비상업적 사용 조항이 있는지 확인하세요.
두 번째 문제는 음성 자체입니다. 사전 설정 음성이나 합성 음성을 생성하는 것은 문제가 없습니다. 실제 인물의 음성을 동의 없이 복제하는 것은 그렇지 않으며, 법적 위험이자 윤리적 문제입니다. 여기서 노조 규정이 중요해집니다. 거의 1년간 이어진 파업 끝에 SAG-AFTRA 조합원은 2025년 7월 9일 95%의 찬성률로 새로운 인터랙티브 미디어 협약을 비준하여 2024년 7월에 시작된 비디오 게임 파업을 공식적으로 종료했습니다. 이 협약의 AI 조항은 연기자의 디지털 음성 복제본을 사용하기 전에 동의, 공개 및 보상을 제공하도록 요구하며, 파업 중에는 연기자가 새로운 AI 자료 생성에 대한 동의를 중단할 수 있도록 합니다.
합성 사전 설정 음성을 사용하는 인디 개발자라면 이 협약의 직접적인 적용을 받지 않습니다. 이 협약은 노조 소속 연기자와 일하는 협약 체결 스튜디오에 적용되기 때문입니다. 하지만 이는 이제 모든 사람이 평가받는 기준을 제시합니다. 실제 사람의 음성을 복제하기 전에 명시적인 동의를 받고 그에 대한 대가를 지급하세요. 성우의 데모 릴이나 스트리머의 클립을 무단 수집해 모델을 훈련하지 마세요. 노조 분쟁은 명확히 연기자의 동의 없이 그들의 작업물로 훈련된 AI가 연기자를 대체하는 문제에 관한 것이었으며, 소규모 스튜디오가 이런 일을 하는 것은 법적 책임을 자초하는 동시에 평판에 치명적인 위험을 안는 일입니다.
공개 요건
Steam으로 출시한다면 AI 음성 콘텐츠를 공개해야 합니다. Valve의 AI 공개 정책은 2024년 초부터 시행되었으며 2026년 1월 17일 업데이트되어, 특히 게임과 함께 제공되고 플레이어가 소비하는 AI 생성 콘텐츠에 초점을 맞추며 개발 이면의 효율화 도구는 제외했습니다. AI 음성 대사는 명시적으로 적용 대상입니다. 정책은 두 가지 유형으로 구분됩니다. 사전 생성 콘텐츠는 AI 음성 대사나 아트처럼 다운로드 파일에 포함되는 콘텐츠이고, 실시간 생성 콘텐츠는 게임이 즉석에서 대화를 생성하는 콘텐츠로 불법적이거나 불쾌감을 주는 결과물을 막기 위한 보호 장치를 구현해야 합니다. 공개 내용은 스토어 페이지의 “게임 정보” 아래에 표시되며, 플레이어가 구매하기 전에 볼 수 있습니다.
실무적으로 해석하면 게임에 포함할 음성 대사를 AI로 생성했다면 사전 생성 항목을 선택하고 사실대로 설명하세요. NPC가 런타임에 대화를 생성한다면 실시간 생성에 해당하며 추가적인 보호 장치 의무가 따릅니다. 현재 다른 플랫폼에서는 게임별 음성 공개 규정이 덜 공식적이지만, 업계 전반의 방향은 표시를 줄이는 것이 아니라 늘리는 쪽입니다. 나중에 발각되는 것보다 처음부터 솔직하게 공개하는 편이 플레이어에게 더 좋은 반응을 얻는 경향이 있습니다. 스토어 규정 외에도 일부 커뮤니티와 시상식에는 자체 기준이 있습니다. Indie Game Awards는 2025년 생성형 AI 사용 사실이 밝혀진 후보작의 자격을 박탈했으므로, 특정 페스티벌이나 스토어 입점을 목표로 한다면 해당 정책도 확인하세요.
작업 흐름 팁
게임처럼 들리는 AI 음성과 자동응답 전화처럼 들리는 AI 음성의 차이는 대부분 디렉팅에서 비롯됩니다. 원하는 방식으로 연기될 수 있도록 대사를 작성하고, 문장부호를 적극적으로 활용하세요. 쉼표, 말줄임표, 줄바꿈은 어떤 설정보다도 대사의 속도와 호흡에 큰 영향을 줍니다. 중요한 대사는 각각 여러 버전으로 생성한 다음, 감독이 인간 성우의 여러 테이크 중 하나를 고르듯 가장 좋은 결과를 선택하세요. 전체 대본에서 캐릭터마다 일관된 목소리를 유지하고, 사용한 정확한 음성 ID와 설정을 기록해 두세요. 그래야 3개월 후에 대사를 다시 생성하더라도 기존 음성과 자연스럽게 어울립니다.
대본이 확정된 후에는 음성을 일괄 생성하세요. 집필 중에 계속 다시 생성하면 크레딧과 시간이 빠르게 소모됩니다. 감정이 중요한 장면에서는 일부 도구가 짧은 지시문이나 감정 조절 기능으로 어조를 제어할 수 있으므로 여기에 노력을 집중하고, 중요하지 않은 짧은 외침 대사는 자동으로 생성해도 됩니다. 음성 작업물의 음량과 형식을 다른 오디오와 동일하게 유지해 대사, 음악, 음향 효과가 믹스 안에서 자연스럽게 어우러지도록 하세요. 또한 실제 플레이어를 대상으로 음성을 일찍 테스트해야 합니다. 50번쯤 듣고 나면 본인은 더 이상 알아차리지 못하는 무미건조한 연기를, 처음 듣는 플레이어는 가장 먼저 눈치채기 때문입니다.
인간 성우를 고용해야 할 때
AI 음성은 도구이지 연기를 대신하는 수단이 아니며, 이를 잘 활용하는 개발자는 그 사실을 솔직하게 인정합니다. 심지어 2025년 10월 AI 생성 대사가 포함된 ARC Raiders를 출시한 Embark Studios도 출시 후 해당 대사의 상당수를 인간 성우의 연기로 교체했습니다. 이 스튜디오의 CEO는 AI와 실제 전문 성우 사이에는 분명한 품질 차이가 있다고 솔직하게 밝혔습니다. 이것이 판단 기준입니다. 캐릭터의 목소리가 게임의 정체성을 좌우하거나, 섬세한 감정 연기가 중요하거나, 타깃 플레이어층이 AI 음성을 꼼꼼히 따지고 부정적으로 반응할 가능성이 크다면 사람을 고용하세요. 실제 성우는 해석과 즉흥 연기, 구체적인 표현력을 더합니다. 현재의 모델은 아직 이를 완벽히 구현하지 못하고 비슷하게 흉내 내는 수준입니다.
AI 음성은 실제로 적합한 곳에 사용하세요. 본격적인 작업 전에 대사 타이밍을 확인하기 위한 프로토타입과 임시 트랙, 무전 대화나 일반적인 외침처럼 양이 많은 기능성 대사, 나중에 교체할 임시 음성, 예산이 없어 음성이 전혀 없는 것 외에는 선택지가 없는 1인 개발 프로젝트, UI 텍스트를 소리 내어 읽는 접근성 기능 등이 좋은 예입니다. 흔히 사용하는 절충안은 먼저 모든 음성을 AI로 생성해 대본과 타이밍을 확정한 다음, 게임의 핵심을 전달하는 대사만 인간 성우에게 맡기는 것입니다. 이렇게 하면 실질적인 효과가 큰 부분에 음성 예산을 집중하고 나머지는 AI로 처리할 수 있습니다.
Cinevva는 프롬프트를 브라우저에서 플레이할 수 있는 게임으로 만들고, 음향 효과와 음악도 생성해 줍니다. 음성 연기는 위의 도구로 추가하면 됩니다.
자주 묻는 질문
상업용 게임에서 AI 음성을 사용하는 것은 합법인가요?
네. 상업적 이용을 허용하는 라이선스의 도구를 사용하고, 당사자의 동의 없이 실제 인물의 목소리를 복제하지 않는다면 가능합니다. ElevenLabs, OpenAI, Murf, Resemble의 유료 플랜에는 모두 상업적 이용 권한이 포함되어 있으며, Piper와 Bark처럼 허용 범위가 넓은 라이선스를 사용하는 오픈 소스 모델은 무료로 게임에 포함해 출시할 수 있습니다. 문제가 되는 경우는 상업적 이용을 금지하고 저작자 표시를 요구하는 무료 플랜의 결과물을 출시하거나, 허가 없이 실제 성우의 녹음으로 음성 모델을 학습시키는 것입니다. 둘 다 충분히 피할 수 있습니다.
게임용 AI 음성 연기의 비용은 얼마인가요?
대부분의 사람이 예상하는 것보다 저렴합니다. 대사가 수백 줄 정도인 짧은 게임이라면 ElevenLabs의 월 6달러 Starter 플랜으로 충분하거나 OpenAI API에서 1달러 미만의 비용이 듭니다. 오픈 소스 모델은 자체 하드웨어에서 무료로 실행할 수 있습니다. 수천 줄의 대사와 여러 언어를 지원하는 대화 중심 RPG라면 99달러 플랜이 필요하거나 API 비용으로 수백 달러 정도가 들 수 있습니다. 비용이 높은 경우에도 전체 배역을 인간 성우로 구성할 때 드는 비용의 일부에 불과합니다.
Steam에서 AI 음성 연기 사용 사실을 공개해야 하나요?
네. Steam의 AI 공개 정책에 따라 게임에 포함되어 플레이어가 접하는 AI 생성 콘텐츠를 신고해야 하며, AI 음성 대사도 명시적으로 이에 해당합니다. 이 공개 사항은 상점 페이지의 "게임 정보" 아래에 표시됩니다. 2026년 1월 업데이트 기준으로 플레이어에게 노출되는 콘텐츠를 생성하지 않는 내부 제작 도구는 주요 대상이 아니지만, 플레이어가 실제로 듣는 음성 대사는 대상입니다. 게임이 실행 중에 실시간으로 대화를 생성한다면 별도의 범주에 해당하며, 안전 보호 장치도 필요합니다.
실제 배우나 유명인의 목소리를 게임용으로 복제해도 되나요?
당사자의 명시적인 동의와 정당한 대가 지급 없이는 안 됩니다. 허가 없이 실제 인물의 목소리를 복제하면 초상권과 퍼블리시티권 관련 법적 소송에 노출될 수 있으며, 이는 SAG-AFTRA 비디오 게임 협약이 막으려는 바로 그 행위입니다. 2025년 협약은 배우의 디지털 음성 복제본에 대해 동의, 공개, 보상을 요구합니다. 해당 협약의 적용을 받지 않는 인디 개발자라도 무단 복제에 따른 법적·평판상 위험은 실재합니다. 합성 프리셋 음성을 사용하거나 적법하게 음성 라이선스를 취득하세요.
플레이어가 AI 음성을 사용했다는 사실을 알아챌까요? 그리고 싫어할까요?
두 질문 모두 그렇다고 답할 수 있는 경우가 많습니다. 플레이어들은 현재 텍스트 음성 변환 기술 특유의 무미건조하고 미묘하게 어색한 연기를 잘 알아차리게 되었습니다. 2025년과 2026년에 출시된 여러 게임이 AI 음성 때문에 공개적인 반발을 샀으며, 일부 개발사는 출시 후 결정을 번복하기도 했습니다. 모든 경우에 해당하는 것은 아니며, 기능성 대사나 명확하게 스타일화된 음성은 주인공이 감정적인 대사를 읽을 때보다 반발이 적은 편입니다. 사용 사실을 솔직하게 공개하고, 명백히 어울리지 않는 곳이 아니라 실제로 적합한 곳에 AI를 활용하세요. 게임을 대표하는 목소리에는 인간 성우를 기용하는 것도 고려해야 합니다.
게임에 가장 적합한 무료 AI 음성 도구는 무엇인가요?
예산 없이 상업용 게임을 출시하려면 허용 범위가 넓은 라이선스의 오픈 소스 모델을 사용하세요. 유료 도구의 무료 플랜은 상업적 이용을 금지하기 때문입니다. Piper는 일반 CPU에서도 실행되며 저사양 환경이나 런타임 생성에 적합하고, Bark와 Kokoro도 게임에 포함해 출시하기 쉽습니다. GPU가 있다면 XTTS v2가 가장 강력한 다국어 음성 복제 기능을 제공하지만, 프로토타입에만 사용할 수 있고 출시용으로는 쓸 수 없습니다. 모델 가중치에 비상업적 라이선스인 Coqui의 CPML이 적용되기 때문입니다. "오픈 소스"가 언제나 "상업적 이용 허용"을 뜻하지는 않으므로, 해당 모델을 기반으로 개발하기 전에 반드시 구체적인 라이선스를 확인하세요.
관련 문서
- 게임을 위한 최고의 AI 음악 생성기 — 사운드트랙 제작에 동일한 도구 선택 기준 적용하기
- 게임용 무료 음향 효과와 음악 — 나머지 오디오를 합법적으로 구하는 방법
- AI NPC와 대화 — 대사를 소리 내어 읽는 것을 넘어 대화 자체 생성하기
- 게임용 AI 에셋 생성기 — 프롬프트로 아트, 모델, 오디오 만들기
- 게임 에셋 라이선스 설명 — 상업용, CC0, 로열티 프리의 정확한 의미
- AI로 게임을 만드는 방법(코딩 없이) — 음성을 추가할 게임 만들기