Kimi K3, 6시간 만에 우주 전략 게임 제작
이 게임은 그래픽을 포함한 모든 요소를 코드로 직접 구현한 결과물입니다. 사용자의 개입 없이 인공지능이 스스로 복잡한 게임을 기획하고 개발하는 능력을 보여줬습니다. 이 과정에서 Kimi K3는 3D 모델, 텍스처, 폰트, 음원 파일을 사용하지 않고 Three.js의 도형, 캔버스, 셰이더, 웹 오디오 기반으로 제작되었습니다.
새로운 대규모 언어 모델 Kimi K3가 복잡한 개발 작업을 장시간 수행하며 다른 모델 대비 높은 잠재력을 보였습니다.
이 게임은 그래픽을 포함한 모든 요소를 코드로 직접 구현한 결과물입니다. 사용자의 개입 없이 인공지능이 스스로 복잡한 게임을 기획하고 개발하는 능력을 보여줬습니다. 이 과정에서 Kimi K3는 3D 모델, 텍스처, 폰트, 음원 파일을 사용하지 않고 Three.js의 도형, 캔버스, 셰이더, 웹 오디오 기반으로 제작되었습니다.
Kimi K3는 13개의 서브 에이전트 역할을 나누어 맡겨 게임 개발을 진행했습니다. 빌드와 실제 실행 화면을 반복 검증하며 5시간 45분 만에 게임을 완성했습니다. 특히 Kimi K3 모델은 장기간 코딩 작업에 강점을 보이며 안정적인 동작을 확인했습니다. 메인 에이전트 외에도 비평가 에이전트가 따로 생성되어 비평 및 검증 과정을 스스로 수행했습니다.
또한, 100만 토큰의 컨텍스트 윈도우를 지원하여 매우 긴 문맥을 이해하고 처리할 수 있는 능력을 보유하고 있습니다.
첫 번째 과제로 한국어 카피 모션 포스터 제작이 요청되었습니다. 행사 브리프 정보만 제공하고 자연스러운 한국어 카피, 포스터 스튜디오, 한글 자모 애니메이션 등을 만들어 달라는 과제였습니다. 세 모델 모두 자모 애니메이션 구현은 잘 수행했습니다. 각 모델은 제공된 정보만을 활용하여 포스터를 디자인하고 한국어 카피를 작성하는 능력을 평가받았습니다.
반면, GPT-5.6 Sol 모델의 포스터는 GPT 고유의 독자적인 느낌을 나타냈습니다. 이는 각 모델이 정보를 해석하고 시각화하는 방식에 차이가 있음을 보여줍니다.
각 모델이 작성한 한국어 카피를 비교했을 때, '달빛 한옥 산책' 카피가 가장 자연스럽고 매력적이라는 평가를 받았습니다. 자체 AI 평가에서도 Kimi K3 모델이 작성한 이 카피가 1위를 차지했습니다. GPT-5.6 Sol과 Fable 5 모델의 카피는 각각 2위와 3위를 기록했습니다. 이는 Kimi K3가 한국어 문맥 이해 및 창작 능력에서 뛰어난 성능을 보임을 시사합니다.
세 프로젝트 모두 PNG 내보내기, 카피 추가, 자모 조건 등 기능적인 측면에서 모든 테스트를 통과했습니다. 자체 AI 채점 결과, Kimi K3가 96점, Fable 5가 94점, GPT-5.6 Sol이 92점을 기록하여 Kimi K3가 근소하게 높은 점수를 받았습니다. 이는 Kimi K3가 기능 구현과 함께 전반적인 과제 수행에서 우수한 성능을 보였음을 의미합니다.
이는 Kimi K3가 높은 품질의 결과물을 생성했지만, 작업 속도에서는 다른 모델 대비 일부 지연이 있었음을 보여줍니다.
이는 Kimi K3가 높은 점수와 함께 경제적인 비용 효율성을 제공했음을 나타냅니다.
이는 Kimi K3가 비용 효율적인 측면에서 높은 경쟁력을 가지고 있음을 보여주는 결과입니다.
외부 3D 모델 없이 도로를 생성하고, 와이어를 걸어 당길 수 있으며, 관성을 이용해 다음 건물로 넘어가는 게임이었습니다. 플레이어는 총 다섯 개의 체크포인트를 순서대로 통과해야 하며, 추락 시에는 최근 지점으로 돌아올 수 있어야 하는 조건이 제시되었습니다. 이 과제는 3D 환경 구현, 물리 엔진 적용, 게임 로직 설계 등 복합적인 개발 능력을 요구했습니다.
세 모델 모두 첫 화면이 뜨기까지는 큰 차이가 없었으나, 전체 기능 완료 시간에서는 큰 차이를 보였습니다. Fable 5 모델이 31분 만에 가장 빠르게 모든 기능을 완주했으며, GPT-5.6 Sol 모델은 51분 14초로 그다음으로 빠르게 완료했습니다. 이 두 모델은 제한 시간 90분 내에 모든 기능을 완벽하게 구현하고 검증했습니다. 반면, Kimi K3 모델은 모든 기능을 통과했지만, 전체 완주에 2시간 27분 24초가 걸려 제한 시간을 초과했습니다.
Kimi K3는 제한 시간인 90분 이후에도 작업을 계속 진행하며, 추가 지시 없이도 스스로 문제를 찾고 수정했습니다. 제한 시간 이후에도 약 2시간 16분 동안 작업을 진행하여 모든 게이트를 통과하며 가장 화려하고 멋진 결과물을 만들어냈습니다. 제한이 없는 상황을 가정했을 때 기술 채점에서는 Kimi K3 모델이 가장 높은 점수를 받았습니다. 이는 Kimi K3의 장기적인 자율 학습 및 문제 해결 능력을 보여주는 사례입니다.
두 번째 과제의 API 환산 비용을 비교했을 때, Fable 5 모델은 980만 토큰을 사용하여 약 19달러가 소요되어 가장 비쌌습니다. GPT-5.6 Sol 모델은 1,000만 토큰을 사용하여 약 8.4달러가 들었습니다. Kimi K3는 제한 시간 초과 후 최종 완성본 기준으로 1,800만 토큰을 사용했으며, 약 9.06달러가 소요되어 GPT-5.6 Sol 다음으로 비쌌습니다. Kimi K3는 Fable 5 대비 약 두 배의 토큰을 사용했지만, 비용은 절반 수준이었습니다.
Kimi K3에게 트리플 A급 우주 실시간 전략(RTS) 게임을 만들어 달라고 요청했습니다. 프롬프트는 서브 에이전트를 여러 개로 나누어 각 항목을 개별 서브 에이전트가 맡아 게임을 완벽하게 만들도록 지시했습니다. 또한, 각 항목에 대해 루프를 돌리고 별도의 서브 에이전트가 시각적으로 직접 확인하여 트리플 A급 품질인지 검증하도록 요청하여 서브 에이전트의 활용을 극대화했습니다. 이는 복잡한 대규모 프로젝트를 AI가 분담하여 수행하는 능력을 시험하는 과정이었습니다.
Kimi K3는 작업 실행에 들어가 가장 먼저 `contract.md` 파일에 파일 소유권, 공유 API, 완료 조건 등을 명시했습니다. 이후 카메라, 월드, 함선, 전투 FX, 게임 로직, UI 도메인으로 작업을 나누고, 각각의 서브 에이전트에게 병렬 실행을 요청했습니다. 총 13개의 서브 에이전트를 구성했으며, 초기 구현에는 6개를 사용했습니다. 이는 Kimi K3가 복잡한 프로젝트를 체계적으로 분할하고 병렬 처리하는 능력을 보여줍니다.
Kimi K3가 모든 개발 라운드를 통과하고 최종적으로 3D 우주 전략 게임을 완성하는 데 걸린 시간은 약 5시간 45분입니다. 이 과정에서 개발자의 개입은 전혀 없었습니다. 게임 내의 함선, 행성, 자원 등 모든 요소는 외부에 있는 3D 모델, 텍스처, 폰트, 음원 파일을 사용하지 않고 Three.js의 도형, 캔버스, 셰이더, 웹 오디오 기반으로 자체 구현되었습니다. 이는 Kimi K3의 완전한 자율 개발 능력을 입증하는 결과입니다.
Kimi K3가 Claude나 GPT 같은 선도적인 모델이 아닌 오픈 모델임에도 불구하고 이 정도의 결과물을 만들어낼 수 있었다는 점은 오픈 모델 기술의 굉장한 발전을 의미합니다. Kimi K3는 이렇게 장기간 작업을 진행하는 동안 스스로 역할을 서브 에이전트에게 나누어주는 모습도 보여주었습니다. 이는 Kimi K3의 장기간 자율 실행 능력과 복잡한 문제 해결 능력을 잘 보여준 사례로 평가됩니다.
두 번째 과제인 복잡한 3D 그래플링 게임 제작에서 Kimi K3 모델은 제한 시간 내에 완성을 하지 못했습니다. 하지만 제한 시간을 풀어주고 작업을 계속 진행했을 때, 2시간 27분이 걸려 작업이 완료되었습니다. 제한 시간을 풀고 난 후의 점수 기준으로 Kimi K3 모델은 더 높은 점수를 받을 수 있었습니다. 이는 Kimi K3가 충분한 시간이 주어지면 매우 높은 품질의 복합 과제도 수행할 수 있음을 보여줍니다.
메인 에이전트와 13개의 서브 에이전트를 사용하여 작업을 완수했으며, 비평가 에이전트가 따로 생성되어 비평하고 검증하는 과정을 스스로 구축했습니다. 이는 Kimi K3가 장시간에 걸쳐 복잡하고 다단계적인 프로젝트를 자율적으로 계획하고 실행하며, 스스로 품질을 검증하는 매우 인상적인 능력을 갖추고 있음을 보여줍니다.
Answers come from the transcript, with the exact spot cited.
Want the next article from 개발동생?
When 개발동생 publishes, we'll write it up like the one you just read and email it to you.
No new videos from this channel in the last 7 days.
GitHub Trending Graft: What are the Actual Measurement Results?개발동생3 weeks ago · 20:53 · 26.7K views · Created 3 weeks ago
Websites Directly Inform AI Agents How to Use Them개발동생3 weeks ago · 12:15 · 11.9K views · Created 3 weeks ago
Anthropic's 'intent.md' File: Development Strategy in the Age of AI개발동생last month · 36:57 · 171 views · Created last month