xAI, Cursor 인수 후 모델 개발 속도 가속화
원본 영상 0:00xAI가 Cursor를 인수한 이후 최근 엄청난 속도로 발전하고 있습니다. 한동안 주목할 만한 모델을 전혀 내놓지 않던 침체기를 지나, 이제는 연달아 모델을 출시하고 있습니다.
얼마 전 Grok 4.5가 나왔는데, 정말 인상적이었습니다.
xAI의 최신 모델 Grok 4.6은 복잡한 실무 작업과 장기 과제 처리에서 진전을 보였으나, Grok 4.5에 비해 가격이 두 배 이상 오르고 토큰 효율성이 저하되는 등 아쉬운 점을 남겼다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
xAI가 Cursor를 인수한 이후 최근 엄청난 속도로 발전하고 있습니다. 한동안 주목할 만한 모델을 전혀 내놓지 않던 침체기를 지나, 이제는 연달아 모델을 출시하고 있습니다.
얼마 전 Grok 4.5가 나왔는데, 정말 인상적이었습니다.
Grok 4.5는 Anthropic이나 OpenAI가 아닌 다른 연구소에서 만든 모델 중에서는 일상 업무에 실제로 사용할 수 있을 만큼 충분히 좋은 첫 번째 모델입니다. 비록 이 모델이 기본으로 사용하는 모델은 아니지만, 그 실용성에는 깊은 인상을 받았습니다.
이러한 모델의 등장은 인공지능 분야에서 새로운 가능성을 보여주며, 앞으로의 발전에 대한 기대를 높이고 있습니다.
Grok 4.6은 Grok 4.5를 기반으로 구축되었으며, 특히 장기 실행 에이전트와 더욱 야심찬 인터랙티브 및 시각적 작업에 중점을 둡니다. 이는 Grok 4.6이 새로운 사전 훈련 모델이 아니라, Grok 4.5에 대한 새로운 후속 훈련(post-training) 모델임을 의미합니다.
이러한 접근 방식은 Cursor 인수의 일부로, Cursor의 엄청난 강화 학습(RL) 및 후속 훈련 기술을 xAI가 활용하고 있음을 보여줍니다.
xAI는 Cursor 인수를 통해 강화 학습(RL) 및 후속 훈련 기술을 확보했습니다. 이를 통해 사전 훈련이 완료된 모델도 지속적으로 개선할 수 있게 되었습니다.
이 기술은 특히 장기 실행 작업과 에이전트 작업의 신뢰성을 크게 높여주는데, 이는 일반적으로 사전 훈련 단계가 아닌 후속 훈련에서 이루어지는 개선 사항입니다.
Grok 4.6은 Grok 4.5를 기반으로 하며, 특히 장기 실행 에이전트와 야심찬 인터랙티브 및 시각적 작업에 초점을 맞추고 있습니다. 이 모델은 주제 연구, 정보 분석, 코드베이스 작업, 아이디어를 정교한 애플리케이션이나 작업 결과물로 전환하는 등 여러 단계에 걸쳐 복잡한 작업을 처리할 수 있습니다.
이러한 능력은 Grok 4.6이 단순히 정보를 처리하는 것을 넘어, 실질적인 문제 해결과 프로젝트 진행을 돕는 다목적 도구로 활용될 수 있음을 시사합니다.
Grok 4.6은 Frontier Code 벤치마크에서 56.6에서 61.3으로 의미 있는 도약을 보였습니다. 이는 이 모델이 Soul과 Fable이라는 다른 경쟁 모델들 사이에 정확히 위치하게 되었음을 의미합니다.
이러한 점수 상승은 Grok 4.6이 코드 생성 및 처리 능력에서 상당한 발전을 이루었음을 보여주며, 시장 내 입지를 강화하는 중요한 지표가 됩니다.
Grok 4.6은 Grok 4.5보다 더 긴 보충 훈련을 거쳤으며, 추론 및 고급 기술 개념에 중점을 두었습니다. 이를 위해 모델이 생성한 데이터를 선별하여 고품질 엔지니어링 데이터로 활용했습니다.
개선된 최적화 도구와 훈련 레시피는 이후의 지도 미세 조정(SFT) 및 강화 학습(RL) 단계에 더욱 강력한 기반을 제공했습니다.
이러한 심층적인 훈련 과정은 Grok 4.6의 전반적인 성능 향상에 크게 기여했습니다.
Grok 4.6에는 새로운 안전 기능과 잠재적인 해킹으로부터 보호하기 위한 더 많은 안전 장치가 추가되었습니다. 안전 장치 평가 작업은 4.6의 확장된 기능을 반영하여 매우 광범위하게 이루어졌습니다.
여기에는 가장 광범위한 사전 배포 테스트 스위트와 광범위한 배포 후 및 타사 테스트가 모두 포함됩니다. 이는 모델의 안전성과 신뢰성을 확보하기 위한 xAI의 노력을 보여줍니다.
Grok 4.6의 성능 향상은 AI 분석 분야에서 프런티어 모델 수준으로 도약했음을 의미합니다. Artificial Analysis에 따르면, 이 모델은 다른 프런티어 모델들과 비교될 수 있는 수준에 이르렀습니다.
특히 GDPval과 같은 부분에서는 훨씬 더 강력한 에이전트 성능을 보입니다. 이는 Grok 4.6이 복잡한 작업 처리와 문제 해결 능력에서 상당한 진전을 이루었음을 나타냅니다.
Grok 4.6의 가격은 Grok 4.5보다 두 배 이상 상승했습니다. 이는 xAI가 공개하려 하지 않는 중요한 세부 사항입니다. 이러한 가격 차이는 4.6과 4.5의 토큰 차이에서 기인한 것으로 예상됩니다.
Grok 4.5가 매우 효율적이었던 점을 고려할 때, 4.6에서 실행당 토큰 수가 30% 이상 늘어나면서 이러한 효율성을 잃은 것은 아쉬운 점으로 지적됩니다.
Grok 4.6이 제시한 UI 디자인은 오래된 AI 슬라빅과 같은 느낌을 주며, 마치 GPT 5.0의 초기 버전과 유사하게 느껴집니다. 보라색을 사용한 작은 앱 모형은 괜찮은 수준이지만, 너무 많은 카드와 구식 Tailwind 템플릿 같은 디자인은 인상적이지 않습니다.
이것은 흔히 볼 수 있는 잔혹주의 디자인이며, 지루한 중앙 정렬 페이지에 불과합니다. 전반적으로 Grok 4.6의 UI 디자인 능력은 기대를 충족시키지 못했습니다.
작년 말 Opus 4.5와 함께 Fish Slop이라는 게임을 만들었지만, 크게 진전되지 못했습니다. 정신없는 수족관 클론이 될 예정이었습니다. 이에 저는 오래된 코드베이스에 모델을 던지고 '이것을 다시 만드세요. 자산 등을 재사용해도 좋지만, 그 코드베이스를 참조하여 이 게임의 새 버전을 처음부터 만드세요'라고 지시하여 모델이 얼마나 잘 이해하고 재구축하는지 평가했습니다. 이 작업은 모델의 깊이 있는 이해도를 확인하는 흥미로운 방법입니다.
Grok 4.6이 구현한 2D 게임은 여러 면에서 미흡한 점을 보였습니다. 컨트롤이 좋지 않았고, 물고기 사료가 너무 크고 물고기가 너무 작은 등 요소들의 크기도 모두 잘못되었습니다.
또한, 바닥에 하이라이트된 부분이 커서를 옮겨도 그대로 남아있는 시각적 버그도 있었으며, 움직임이나 게임 진행 속도도 부적절했습니다. 사물들이 충분히 빨리 성장하지 않고 다음 단계로 넘어가지 못하는 문제도 확인되었습니다.
Grok 4.6에게 3D 게임을 만들도록 했을 때, 처음 열었을 때 검은 화면만 나타나며 완전히 실패했습니다. 다른 모든 모델들은 움직임이나 메커니즘, 또는 3D 공간에 생성된 모델에 버그나 문제가 있었을지라도 최소한 3D 환경을 열 수 있었습니다. 심지어 GPT4도 여기까지는 가능했습니다.
3D 포트 구현에서 이렇게 완전히 실패한 모델은 Grok 4.6이 처음입니다. 이는 3D 작업 처리 능력에서 심각한 한계를 드러냈음을 보여줍니다.
Grok 4.6이 생성한 3D 물고기 모델은 오랫동안 본 것 중에 가장 나쁜 결과물입니다. 사실, 이 정도 품질은 작년에나 예상했을 수준으로 매우 실망스러웠습니다. 이는 Muse12가 훨씬 저렴하게 만든 버전과 비교해도 현저히 떨어지는 수준입니다.
Muse12의 모델은 위아래 기울기 같은 방향 문제가 약간 있지만 기능은 작동하며, 움직임도 훨씬 좋고 핵심 메커니즘도 훨씬 잘 작동합니다. Kimmy와 같은 최첨단 모델과 비교하면 Grok 4.6의 3D 모델링 품질은 훨씬 뒤떨어져 있습니다.
Grok 4.6은 복잡한 실무 작업 수행 능력에서 꽤 관대하게 평가되었습니다. 특히 복잡한 여러 가지를 다루고 장기적인 작업에 꾸준히 집중해야 하는 실제 작업 수행에서 놀라울 정도로 능력이 있다고 판단되었습니다.
이러한 능력은 Grok 4.6이 단순히 주어진 작업을 처리하는 것을 넘어, 현실 세계의 복잡한 문제 해결에 기여할 수 있는 잠재력을 가지고 있음을 보여줍니다.
Grock은 복잡한 Pull Request(PR)를 생성하고, 계정을 사용해 답변하는 능력을 보여주었습니다. 모델은 Theo를 대신해 응답한다는 주석과 함께 글을 시작하며, 이는 모델이 스스로 정의된 스킬에 따라 행동하는 에이전트 기능을 수행했음을 나타냅니다.
예를 들어, Grock은 Grock Build의 여러 커버리지 격차를 해결하기 위해 작성된 1000줄짜리 PR을 만들었으며, PR 생성 후에는 요청에 따라 후속 관리를 수행했습니다. 이는 모델의 복잡한 코드 관리 및 자율적인 에이전트 동작 능력을 입증하는 사례입니다.
Grok 4.5는 비용 면에서 Fable이나 Soul보다 훨씬 우수했습니다. Fable은 너무 비싸고 Soul이 더 나았지만, Grok 4.5는 비용 효율성이 뛰어났습니다.
지능 면에서는 Fable이 최고였고 Soul도 놀랍도록 좋았으나 Grok 4.5는 그 정도는 아니었습니다. 속도 면에서는 Fable이 매우 느렸고 Soul은 효율적이라 의미 있게 빨랐던 반면, Grok 4.5는 특히 빠른 모드에서 매우 빠른 성능을 보였습니다.
철저함 면에서는 Fable이 충분히 철저하지 못했고, Soul은 놀라울 정도로 철저했지만 너무 많은 코드를 작성하는 경향이 있었습니다. Grok 4.5는 이 부분이 전혀 없었습니다. 오케스트레이션 기능에서는 Fable이 최고였고 Soul이 근접했지만 Grok 4.5는 대부분보다 나았지만 아직 완벽하지는 않았습니다.
새로운 모델인 Grok 4.6은 Grok 4.5와 비교했을 때 몇 가지 중요한 변화를 보였습니다. 비용 면에서는 아쉽게도 퇴보했습니다. 그러나 지능 면에서는 의미 있는 향상이 있는 것으로 보입니다.
속도 면에서는 가장 큰 퇴보 중 하나를 보였으며, 철저함은 개선되었지만 여전히 놓치는 부분이 있었습니다. 오케스트레이션 기능에서는 서브 에이전트를 상당히 잘 사용하는 것을 확인할 수 있었습니다.
전반적으로 Grok 4.6은 지능 측면에서는 발전했으나, 비용과 속도 효율성에서는 아쉬움을 남겼습니다.
Grok 4.5가 좋았던 이유는 특정 분야에서 프런티어 모델만큼 좋아서가 아니라, 속도와 비용 면에서 프런티어 모델과 충분히 차이가 나 독특하게 유용했기 때문입니다. 하지만 Grok 4.6에서는 그러한 장점을 다소 잃은 것으로 보입니다.
결론적으로, Grok 4.6이 현재 가장 좋아하는 모델은 아니며, 이 영상이 끝난 후에도 많이 사용할 것 같지는 않습니다. 그러나 Grok 4.7에 대한 기대감은 확실히 갖게 합니다. Elon Musk가 현재 4.6보다 4.7에 대해 더 많이 이야기하는 이유를 충분히 이해할 수 있으며, Grok이 매우 빠르게 따라잡을 미래가 명확해 보여 매우 기대됩니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
Theo - t3․gg에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 7편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.
Ox Alpha Excels, Reaches Top Tier at 1/10th CostTheo - t3․gg14분 전 게시 · 43:14 · 조회 935 · 6분 전 생성
Theo - t3.gg Explores the Pitfalls of AI Code Assistants' Persistent MemoryTheo - t3․gg2일 전 게시 · 39:28 · 조회 7 · 2일 전 생성
Why Terminals Might Be Slowing You Down: A Developer's PerspectiveTheo - t3․gg2일 전 게시 · 0:42 · 2일 전 생성