AI 모델 간 결과 차이, 설정값이 핵심 원인
Jump to 1:45동일한 프롬프트를 AI 모델에 입력하더라도, 모델별로 다른 설정값이 결과에 결정적인 영향을 미친다. AI 겸임교수 이종범은 같은 프롬프트를 다른 모델에 넣었을 때 나타나는 차이가 이제는 설정에서 온다는 점을 강조했다. 각 모델의 기본 설정값에 따라 결과물이 크게 달라질 수 있기 때문에, 사용자가 이를 이해하고 조절하는 것이 중요하다.
강수진 박사가 최신 AI 모델 GPT-4o, Claude Fable 5, Kimi K3를 비교 분석하며 가격 경쟁력과 실제 비용 효율성 사이의 격차를 강조했다.
Want the next one from this channel too?
동일한 프롬프트를 AI 모델에 입력하더라도, 모델별로 다른 설정값이 결과에 결정적인 영향을 미친다. AI 겸임교수 이종범은 같은 프롬프트를 다른 모델에 넣었을 때 나타나는 차이가 이제는 설정에서 온다는 점을 강조했다. 각 모델의 기본 설정값에 따라 결과물이 크게 달라질 수 있기 때문에, 사용자가 이를 이해하고 조절하는 것이 중요하다.
AI 모델 개발사의 공식 홈페이지에 공개된 데모 영상은 대부분 가장 잘 나온 결과만을 선별한 '체리 피킹(Cherry-picking)'된 결과물이다. 강수진 대표는 "공식 홈페이지에 약간 체리 피킹하는 예쁜 데모들 어와 진짜 이게 된단 말이야 이런게 있어요."라고 설명하며, 실제 동일한 프롬프트를 입력했을 때 데모와 같은 결과가 나오지 않을 가능성이 높다고 지적했다. 이는 사용자들이 모델의 실제 성능을 오해하게 만들 수 있다.
강수진 대표는 실험에 앞서 두 가지 가설을 세웠다. 첫 번째 가설은 동일한 프롬프트를 주면 세 가지 모델이 기본 설정값에 따라 반응할 것이라는 내용이다. 두 번째 가설은 모델 순위와 관계없이 프롬프트 보정을 통해 동일 조건에서 원하는 결과물을 구현할 수 있는지 검증하는 것이다. 이 가설들을 통해 AI 모델 간의 본질적인 성능 차이와 프롬프트 활용 전략의 중요성을 확인하고자 했다.
각 AI 모델은 추론 방식에 따라 설정값 조정에 차이가 있었다. Claude Fable 5는 'Thinking' 기능을 끌 수 없어 항상 기본적으로 활성화되어 있었다. 반면 GPT-4o는 'Thinking' 기능 사용 여부를 조절할 수 있었다. Kimi K3는 'Thinking' 기능이 기본으로 활성화되어 있었지만, 상세한 조정은 러프하게만 가능했다. 이러한 모델별 고유 특성은 동일한 조건하의 실험 통제를 어렵게 만들었다.
페이블 5 같은 경우는 사고를 끌 수가 없어요. 그래서 항상 디폴트로 얘는 Thinking이 켜져 있는 친구라.
강수진 대표팀은 AI 모델 성능 비교를 위해 자체 플랫폼인 'Compare LRMG'를 구축했다. 이 플랫폼은 Claude Code를 활용하여 개발되었으며, Claude Fable 5, GPT-4o, Kimi K3 세 모델을 동시에 실시간으로 시연할 수 있도록 설계되었다. 이는 객관적인 비교 실험을 위한 핵심 도구로 활용되었다.
성공적인 게임 결과물을 얻기 위해 상세한 프롬프트 구성이 중요했다. 단순한 기능 구현을 넘어 방향타, 시점 전환 등 게임 조작성을 추가했으며, 외부 도구 없이 브라우저 내 단일 파일로 구현되도록 설정했다. 강수진 대표는 언어와 UI, 그리고 사운드 생성 및 UI 컨트롤의 중요성을 강조하며, 이러한 요소들이 게임의 재미와 완성도에 큰 영향을 미친다고 설명했다.
비교 실험은 외부 도구 연동 없이 순수 LLM(거대 언어 모델)만을 사용하여 진행되었다. 실험 대상 모델은 GPT-4o, Claude Fable 5, Kimi K3였다. 특히 Kimi K3는 로우(Low), 하이(High), 맥스(Max) 세 가지 옵션만 제공하여 섬세한 설정이 어려웠다. 동일한 프롬프트를 각 모델에 입력하여 결과물의 차이를 비교했다.
GPT 5.6솔 그다음에 클로드 페이블 5 그다음에 키미 K3인데 여기에서 이제 설정을 해야 됩니다.
동일한 프롬프트 실험에서 Kimi K3는 결과물 생성 중 오류가 발생하는 모습을 보였다. 반면 GPT-4o는 2D 게임 형태로, Claude Fable 5는 상대적으로 괜찮은 결과물을 도출했다. 강수진 대표는 "GP 5.6솔 그다음에 클로드 페이블 5 키미 K3인데 키미는 지금 오류가 생겼어요."라고 언급하며, Kimi K3가 개발사에서 공개한 체리 피킹된 데모에 비해 실망스러운 품질을 보였다고 평가했다.
Kimi K3는 다른 AI 모델들에 비해 2배에서 10배가량 많은 추론 과정을 거치는 것으로 나타났다. 결과물 생성에 필요한 토큰 수가 70K를 상회했으며, 이는 다른 모델들이 0.9K에서 5.5K 수준으로 추론을 마치는 것과 비교하면 매우 비효율적인 수치다. 강수진 대표는 "보편적으로 다른 모델들에 비해서 한 두 배에서 세 배 혹은 다섯 배에서 열 배까지도 계속 늘어나더라고요."라고 지적하며 Kimi K3의 과도한 추론량 문제를 강조했다.
Kimi K3는 토큰 가격이 다른 모델의 3분의 1 수준으로 저렴하다는 장점을 내세운다. 그러나 과도한 추론량으로 인해 실제 비용은 오히려 더 비싸질 수 있다. 홍재의 기자는 "토큰 가격이 3분의 1 정도라고 했잖아요. 근데 지금 추론을 70배를 많이 하면 더 비싸네요."라고 의문을 제기했다. 즉, 추론량이 70배 차이 날 경우, 토큰 단가가 저렴하더라도 총 비용은 훨씬 증가하게 되는 것이다. 모델별 최적화와 추론량 제어가 비용 효율성의 핵심임을 보여주는 사례다.
이번 실험에서는 프롬프트를 동일하게 설정하고 출력 형식을 단일 HTML로 통제하려고 시도했다. 강수진 대표는 "통제한 거는 프롬프트를 똑같이 했고 출력 형식은 단일 HTML로 떨어지는 걸 아까 볼 수가 있었어요."라고 설명했다. 그러나 모델사별 정책 차이로 인해 '사고 모드(Thinking mode)' 제어는 불가능했으며, 각 모델의 고유한 특성으로 인한 통제 불능 영역이 존재한다는 점을 인정했다.
동일한 프롬프트를 사용하더라도, 모델이 가지고 있는 설정값들을 최대한 잘 활용하는 것이 가장 효율적인 결과 도출 방법이라는 결론이 나왔다. 강수진 대표는 "프롬프트가 동일하다면 그 모델이 갖고 있는 설정값들을 최대한 잘 활용해서 내 것에 맞게 하는 것이 가장 베스트다라는 결론이 나옵니다."라고 말했다. 프롬프트 내용을 상세하고 빽빽하게 작성하면 낮은 추론 강도로도 충분한 결과를 얻을 수 있으며, 모델별 최적 설정을 조합하는 것이 현재 가장 효율적인 AI 사용법으로 제시되었다.
Kimi K3는 게임 구현 시 화려한 이미지나 시각적인 효과는 부족했다. 그러나 강수진 대표는 "화려한 이미지와 어떤 눈이 시원해지는 시각적인 이미지 효과는 구현할 순 없으나 게임이 정교하고 제가 설계를 했던 평가 루브릭에 합당한 그거에 맞는 정도의 정교한 게임이 완성돼요."라고 평가했다. 이는 Kimi K3가 시각적 요소보다는 게임의 기본 설계와 논리적 완성도 측면에서 강점을 가질 수 있음을 시사한다.
프레젠테이션 제작을 위해 강수진 대표는 '미드센트리 모던 큐레이티드 굿 스토어'를 주제로 인테리어 제안서 PPT를 요청하는 프롬프트를 구성했다. 16대 9 슬라이드 덱으로 최종 편집 가능한 형태로 9개 섹션을 지정했으며, 프리미엄 건축 인테리어 스튜디오 스타일을 요구했다. 또한, 슬라이드에 들어갈 텍스트는 아주 짧고 감각적으로, 이미지 중심으로 구현하도록 지시하여 시각적 효과를 강조했다.
프레젠테이션 제작 실험에서 모델별 성능 차이가 명확하게 드러났다. GPT-4o는 외부 실사 이미지 URL을 활용하여 높은 품질의 PPT를 생성한 반면, Claude Fable 5와 Kimi K3는 외부 도구 없이 도형 위주로 구현하여 품질이 떨어졌다. 강수진 대표는 "왜 그러는 거예요? 왜 왜... 도구 사용의 차이죠?"라며 외부 도구 사용 능력이 모델 특징의 큰 차이로 나타난다고 설명했다. GPT는 디자인 소스 홈페이지 URL을 활용해 더 나은 결과물을 만들 수 있었던 것이다.
강수진 대표는 AI 모델이 모든 것을 알아서 처리하는 것이 아니며, 더 좋은 결과물을 얻기 위해서는 외부 도구 사용을 명시하는 구체적인 지시가 필요하다고 강조했다. "외부에 있는 URL이나 디자인 툴을 사용해 가지고 더 예쁘게 만들 수 있으니까 그걸 사용하라고 해 주기만 하면 더 좋은 꼭 프런티어 모델이라고 해도 우리가 원하는 결과물이 안 나올 수도 있다. 그래서 프롬프트에 채워 주셔야 된다. 다 알아서 하는 게 아니다 보니."라고 설명하며, 프롬프트에 모델의 도구 사용을 적극적으로 지시해야 함을 역설했다.
흥미로운 점은 서로 다른 AI 모델들이 특정 디자인 구성 요소를 공통적으로 선호하는 경향을 보였다는 것이다. 강수진 대표는 '키네틱 조각과 기계적 움직임'이라는 묘사를 했을 때 세 모델 모두 굉장히 비슷한 느낌의 결과물을 생성했다고 밝혔다. 이는 프롬프트에서 해석할 수 있는 모델의 생성 범위가 굉장히 비슷해서 나타나는 현상으로, AI 모델들이 특정 시각적 패턴에 대한 유사한 인식을 가지고 있음을 시사한다.
AI 모델 활용의 핵심은 단순한 모델 순위보다는 자신이 달성하려는 목표에 맞는 모델을 선택하고, 그에 맞춰 설정을 세분화하고 정교하게 작업하는 것이다. 강수진 대표는 "이런 순위보다는 내가 하려고 하는 거에 있어서 그 목표에 달성하는 그런 모델이 좋은 것 같아요... 같은 프롬프트를 넣어도 모델마다 좀 다르고 그다음에 설정에서 차이가 나오니 여러분이 하시고자 하는 과제에 맞춰서 설정을 이제 세분화해서 정교하게 작업하시는 것이 추론 모델에 어떤 이용을 하실 때 잘 활용하시는 지름길일 것 같습니다."라고 조언했다. 이는 사용자가 AI를 효과적으로 활용하기 위한 실질적인 지침을 제공한다.
Answers come from the transcript, with the exact spot cited.
Want the next one from this channel too?
When 티타임즈TV publishes, we'll write it up like the one you just read and email it to you.
{channel} published 8 in the last 7 days.
We skip Shorts. You can unfollow any time.