Skip to content

Kimi K3, 오픈 웨이트를 공개하고 브라우저 게임으로 성능을 입증하다

Moonshot AI는 7월 16일 Kimi K3를 출시하고 11일 뒤인 7월 27일에 웨이트를 공개했다. Hugging Face에서 제공되는 다운로드 파일은 96개 샤드로 구성되며 용량은 약 1.56TB다. Nathan Lambert는 이를 "지금까지 공개된 오픈 모델 중 단연 가장 강력하다"고 평가했고, 순위도 이를 뒷받침한다. Frontend Code Arena 1위, Vals AI Index 2위, Artificial Analysis Intelligence Index에서는 Claude Fable 5와 GPT-5.6 Sol Max에 이어 3위를 기록했다. 오픈 웨이트 모델 중에서는 경쟁 상대가 없을 정도다.

모두가 다룬 이야기는 여기까지다. 우리가 주목한 부분은 Moonshot이 이 모델을 자랑하기 위해 무엇을 선택했느냐는 것이다.

데모는 Three.js 게임이다

출시와 함께 K3는 브라우저 탭에서 실행되는 절차적 3D 탐험 게임을 제작했다. 물과 나무, 오두막, 설산, 말을 탄 사람들이 있는 오픈 월드이며, GPU 컴퓨트를 활용하는 WebGPU 렌더러 기반의 Three.js로 구축됐다. 연구용 영상도, 게임을 촬영한 동영상도 아니다. 직접 불러와 실행하는 웹페이지다.

장면 자체보다 중요한 것은 제작 방식이다. WebGPU 커뮤니티의 소개 글에 따르면 모델은 비전을 루프에 포함해 작업했다. 자신이 생성한 코드와 실행 결과의 실시간 스크린샷을 오가며 반복 작업함으로써, 직접 만든 결과를 보고 문제를 수정할 수 있었다. 이는 Cinevva의 Game Creator 내부에서 사용하는 것과 동일한 루프이며, 그럴듯한 Three.js 코드를 작성하는 모델과 실제로 렌더링되는 게임을 완성하는 모델을 가르는 핵심이다. 누구나 씬 그래프는 생성할 수 있다. 카메라가 지형 안에 들어가 있다는 사실을 알아차리는 것이 어려운 부분이다.

따라서 이번 주 현재 상황은 이렇다. 최첨단 AI 연구소가 자사의 가장 강력한 모델을 출시하면서, 사람들에게 확실한 인상을 남길 시연으로 브라우저 기반 3D 게임 제작을 선택했다. 2년 전만 해도 대표 데모는 수수께끼에 답하는 챗봇이었다. 이제 기준은 직접 돌아다닐 수 있는 무언가로 높아졌다.

모델에는 실제로 무엇이 들어 있는가

K3는 총 2조 8천억 개의 파라미터를 갖춘 Mixture-of-Experts 모델로, 토큰당 1,040억 개의 파라미터가 활성화된다. 컨텍스트 윈도는 1,048,576토큰이며 텍스트, 이미지, 동영상 입력을 지원한다. Moonshot은 Kimi Delta Attention과 Attention Residuals라는 두 가지 아키텍처 변경 사항을 도입했으며, Kimi K2보다 스케일링 효율이 약 2.5배 향상됐다고 밝혔다. 모델은 항상 추론하며, 7월 출시 버전에서는 단일 "max" 작업 수준만 제공했지만 오픈 릴리스에서는 low, high, max를 선택할 수 있다.

Moonshot이 공개한 자체 수치에 따르면 K3는 제품군 대부분에서 max 설정의 Claude Opus 4.8과 high 설정의 GPT-5.5를 앞서며, Fable 5와 GPT-5.6 Sol에는 뒤처진다. 자체 보고 벤치마크는 결론이 아니라 주장으로 받아들여야 한다. 하지만 독립 테스트에서도 두 가지 결과가 재현됐으며, 둘 다 소프트웨어 제작에서 중요한 유형의 지표다. 에이전트형 브라우징을 평가하는 BrowseComp에서는 91.2점, 장시간 코딩을 평가하는 SWE Marathon에서는 42.0점을 기록했다. 몇 초가 아니라 몇 시간 동안 이어지는 작업에서 Fable 5와 Sol을 모두 앞선 결과다.

API 가격은 입력 토큰 100만 개당 3.00달러, 출력 토큰 100만 개당 15.00달러이며, 캐시된 입력은 0.30달러로 낮아진다. 대표 요금은 Claude Sonnet 5와 동일하다. OpenRouter에는 이보다 조금 저렴하게 등록돼 있다. 다만 이 모델을 기반으로 개발하기 전에 살펴봐야 할 주의점이 하나 있다. 제한 없이 Apache 2.0으로 공개된 Tencent의 Hunyuan Hy3와 달리 K3는 자체 Kimi K3 License로 배포된다. 오픈 웨이트와 오픈 소스는 같은 문서가 아니다. 이를 상용 제품에 넣을 계획이라면 추측하지 말고 라이선스 조건을 직접 확인해야 한다.

출시 주기에서 보이는 것보다 격차는 빠르게 좁혀지고 있다

Lambert는 더 큰 흐름을 두고, 최고의 폐쇄형 모델과 최고의 오픈 모델 간 격차가 6~9개월에서 3~5개월 정도로 줄어들었다고 분석한다. Alibaba는 이미 2조 4천억 개의 파라미터를 갖춘 Qwen 3.8을 발표했으며, 추후 오픈 웨이트도 공개할 예정이어서 경쟁의 가속은 멈추지 않고 있다. 우리는 2025년 1월에 DeepSeek R1이 지능의 비용 기준을 재설정했다고 썼다. 18개월이 지난 지금 나타나는 패턴은, 기준이 재설정될 때마다 시장이 이를 흡수하고 더 빠른 속도로 같은 일이 반복된다는 것이다.

게임을 만드는 사람이라면 누구에게나 실질적인 결과는 분명하다. 에셋 계층에서 이미 그랬듯이, 지능 계층 역시 계속 더 저렴하고 이식하기 쉬워지고 있다. 자체 코드베이스에 맞춰 미세 조정한 모델을 원하던 스튜디오는 과거에 자신이 통제할 수 없는 API 의존성과 성능이 낮은 로컬 모델 중 하나를 선택해야 했다. 그 절충 관계는 분기마다 희미해지고 있다.

우리가 이에 대응하는 방식

우리는 다중 제공자 게이트웨이를 운영하므로, 이는 추상적인 문제가 아니라 구체적인 의사결정이다. K3의 강점은 장시간 에이전트형 코딩, 도구 사용, 실행 중인 게임의 스크린샷과 콘솔 로그를 바탕으로 한 반복 작업 등 우리의 워크로드와 정확히 맞닿아 있다. 우리는 누군가가 공개한 표가 아니라 실제 Game Creator 세션에서 K3를 현재 모델 라인업과 비교해 벤치마킹하고 있다. 우리가 중요하게 보는 지표는 Elo 점수가 아니기 때문이다. 한 번의 턴이 사용자가 실제로 플레이할 수 있는 게임으로 끝나는 빈도, 그리고 사용자가 직접 지적하기 전에 모델이 자신의 실수를 발견하는 빈도가 중요하다.

이미 사용 중인 모델보다 뛰어나지 않다는 결론이 나오더라도 그 결과를 포함해 공개할 예정이다. 이번 릴리스에서 흥미로운 점은 중국 연구소가 매우 뛰어난 오픈 모델을 출시했다는 사실이 아니다. 이제 그것은 더 이상 놀라운 일이 아니다. 흥미로운 점은 이를 입증하기 위해 선택한 데모가 브라우저 탭에서 실행되는 게임이었다는 것이다. 바로 우리가 계속 만들어 온 것이기도 하다.

참고 자료