xAI의 빠른 모델 개발 속도
원본 영상 0:00xAI는 Cursor 인수 이후 모델 개발 속도를 빠르게 끌어올리고 있습니다. 과거 몇 달간 이렇다 할 모델을 내놓지 못했던 것과 달리, 최근에는 연이어 새로운 모델을 출시하며 활발한 활동을 보이고 있습니다. 이러한 변화는 AI 업계에서 xAI의 존재감을 다시 한번 각인시키고 있습니다.
Grok 4.6이 인텔리전스 지수에서 프론티어 모델 수준에 도달했으나, 토큰 효율성 저하로 비용이 증가하고 속도가 느려져 전반적인 매력이 감소했습니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
xAI는 Cursor 인수 이후 모델 개발 속도를 빠르게 끌어올리고 있습니다. 과거 몇 달간 이렇다 할 모델을 내놓지 못했던 것과 달리, 최근에는 연이어 새로운 모델을 출시하며 활발한 활동을 보이고 있습니다. 이러한 변화는 AI 업계에서 xAI의 존재감을 다시 한번 각인시키고 있습니다.
Artificial Analysis에 따르면 Grok 4.6은 이제 GPT-5.6 Soul과 거의 동등한 성능을 보입니다. Grok 4.6이 5분의 1 가격으로 이처럼 근접한 성능을 유지한다면, AI 시장의 판도가 빠르게 변화할 수 있습니다. 이러한 벤치마크 결과는 Grok 4.6이 프론티어 모델 대열에 합류했음을 시사합니다.
Grok 4.6 is now neck-and-neck with GPT-5.6 Soul according to Artificial Analysis. We need to see if this holds up because if it's actually getting that close at a fifth the price, things are changing quickly.
벤치마크 점수만으로는 모델의 실제 스마트함이나 유용성을 완전히 측정하기 어렵습니다. 예를 들어, Opus 5는 Fable과 Soul에 비해 사용 경험이 훨씬 나빴던 점을 고려하면, 단순히 점수만으로 모델의 실제 가치를 평가하기는 어렵습니다. 벤치마크는 참고 지표일 뿐 실제 사용자 경험과는 차이가 있을 수 있습니다.
Frontier Code 벤치마크에서 Grok 4.6은 56.6점에서 61.3점으로 의미 있는 점수 상승을 보였습니다. 이 결과는 Grok 4.6이 Soul과 Fable 모델의 중간 수준에 위치함을 나타냅니다. 코드 관련 작업에서 Grok 4.6의 성능이 향상되었음을 보여주는 지표입니다.
And then with frontier code, they saw a meaningful jump as well from 56.6 to 61.3 putting it smack dab in the middle between soul and fable.
Grok 4.6은 이전 버전인 4.5보다 더 긴 보충 훈련을 거쳤습니다. 이 훈련은 추론 및 고급 기술 개념, 고품질 엔지니어링 데이터, 그리고 개선된 최적화 도구와 훈련 방식을 통해 모델이 생성한 데이터를 선별적으로 학습하도록 설계되었습니다. 이러한 과정을 통해 이후 SFT(Supervised Fine-Tuning) 및 RL(Reinforcement Learning) 단계의 강력한 기반을 마련했습니다.
Grok 4.6은 새로운 안전 기능과 잠재적 해킹 위험에 대응하기 위해 더 많은 안전장치를 추가했습니다. 안전장치 평가 작업은 4.6의 확장된 기능을 반영하여, 배포 전 기능 및 안전장치 보정을 위한 광범위한 테스트 스위트와 광범위한 배포 후 및 타사 테스트를 포함합니다. 이는 모델의 안전성과 신뢰성을 높이기 위한 조치입니다.
xAI의 Grok 4.6은 Artificial Analysis 인텔리전스 지수에서 61점을 기록하며 5.6 Sol과 함께 프론티어 모델 대열에 합류했습니다. 이는 저렴한 비용으로 탁월한 에이전트 성능을 보여줍니다. 4.6은 출시 1개월 만에 4.5에 비해 인텔리전스 지수에서 5점 상승했으며, 얼마 전인 4.3과 비교하면 23점 상승하여 지능 측면에서 상당한 발전을 이루었습니다.
Grok 4.6의 작업당 비용은 Kimmy K3와 비슷하며, Gemini 3.6 Flash와 Terra보다는 약간 비싸고 5.6 Sol보다는 약간 저렴합니다. 실제 사용 시에는 Opus 5와 Fable 5보다 훨씬 저렴한 것으로 나타났습니다. 예를 들어 Fable은 3.14달러인 반면 Grok 4.6은 84센트 수준으로 비용 효율성 면에서 강점을 보였습니다.
AI 브리프케이스 벤치마크에서 Grok 4.6은 Fable 5와 비슷한 수준의 성능을 달성했습니다. 두 모델 모두 50만 토큰의 컨텍스트 창을 가지며 가격도 동일합니다. 다만, Grok 4.6의 캐시 읽기 가격은 이전 백만 토큰당 3센트에서 5센트로 인상되었습니다. 성능 향상과 함께 비용 구조에 일부 변화가 있었음을 보여줍니다.
Grok 4.6으로 생성한 첫 번째 디자인은 노이즈 패턴과 흐릿한 배경에 비해 텍스트가 너무 선명하여 조화롭지 못했습니다. 이는 마치 GPT 5.0 시대의 구식 AI가 만든 것처럼 느껴졌습니다. 디자인 작업에서 Grok 4.6의 결과물은 시각적으로 만족스럽지 못하며, 개선이 필요한 부분으로 지적됩니다.
Fable과 Opus, 심지어 56 Sol과 같은 다른 모델들은 Grok 4.6보다 훨씬 나은 디자인 결과물을 보여주었습니다. Grok 4.6은 디자인 작업에는 전혀 능숙하지 못한 모습을 보였습니다. 이는 시각적 창작 분야에서 Grok 4.6이 경쟁력을 갖추기 위해서는 상당한 개선이 필요함을 의미합니다. 디자인 관련 작업을 수행할 경우 Grok 4.6보다는 다른 AI 모델을 선택하는 것이 더 효율적일 수 있습니다.
Grok 4.6으로 3D 버전을 처음 열었을 때 검은 화면만 나타났습니다. Grok 4.6은 테스트한 새로운 모델 중 유일하게 3D 버전에서 검은 화면을 보여준 모델입니다. 3D 환경에서의 그래픽 처리 능력에 심각한 문제가 있음을 드러냈습니다.
스크린샷을 통해 문제를 고치라고 지시했으나, 결과는 여전히 심각한 오류를 보였습니다. 위아래는 맞았지만 좌우가 반전되어 나타났고, 지면에 있는 모든 것의 배치가 완전히 틀어지는 코믹한 결과가 발생했습니다. 이는 Grok 4.6이 복잡한 시각적 오류를 해결하는 데 어려움을 겪는다는 것을 보여줍니다.
오픈 웨이트 모델인 Kimmy와 비교했을 때, Grok 4.6의 3D 성능은 현저히 열악했습니다. Kimmy는 지면의 사물 모델링과 전반적인 그래픽 품질에서 세대 차이를 보일 정도로 발전했습니다. 온라인에서 웨이트를 다운로드할 수 있는 오픈 웨이트 모델조차 3D에서 훨씬 뛰어난 결과물을 만들어냈으며, 물고기 모델도 Grok 4.6보다 훨씬 좋았습니다. 이는 Grok 4.6의 3D 그래픽 및 모델링 분야가 개선될 여지가 크다는 것을 시사합니다.
Grok 4.6에게 T3 코드의 Cursor 구현 방식을 검토하고, 현재 빌드에서 사용 중인 오래된 ACP 어댑터를 SDK로 전환하는 방법을 감사해 달라고 요청했습니다. Julius의 새 오케스트레이터 작업에 이 전환이 포함되어 있다고 예상했지만, Grok 4.6은 마이그레이션 과정에서 여러 문제를 드러냈습니다.
Cursor SDK는 GUI 수준의 승인 또는 거부 기능을 제공하지 않으며, 에이전트 로그인을 재사용하는 기능도 작동하지 않아 자체 로그인을 구현해야 하는 번거로움이 있습니다. Grok 4.6의 구현 역시 개선이 필요하며, 특히 레거시 계획 모드를 켜야 하는 문제가 발견되었습니다. 이러한 한계와 Grok의 문제점은 코드 마이그레이션 작업의 효율성을 떨어뜨렸습니다.
Grok 4.5는 작은 변화가 아닌, Grok 빌드의 적용 범위에서 여러 간극을 해결하기 위해 만든 1천 라인 PR(Pull Request)을 생성하는 기능을 선보였습니다. PR이 제출된 후에는 이를 관리하도록 지시하는 'babysitting' 기능도 시연되었습니다. 이는 Grok 4.5가 코드 변경 및 관리 작업에서 상당한 능력을 가지고 있음을 보여주었습니다.
Grok 4.5는 비용 면에서 Opus 5, Fable 5보다 훨씬 좋았고, 특히 빠른 모드에서 속도가 매우 빨랐습니다. 그러나 지능 면에서는 Fable과 Soul에 미치지 못했으며, 철저함에서도 부족한 점을 보였습니다. 오케스트레이션 능력은 대부분의 모델보다 나았지만 아직 완벽하지 않아, 이 세 가지 측면에서 개선이 필요했습니다.
Grok 4.6은 지능 면에서 의미 있는 향상을 보였고, 오케스트레이션 능력에서는 하위 에이전트를 꽤 잘 사용하는 모습을 보여주었습니다. 철저함도 더 나아졌지만 여전히 놓치는 부분이 있었습니다. 그러나 비용과 속도 면에서는 퇴보했습니다. 특히 속도 저하는 가장 큰 변화 중 하나로 지적되었습니다.
이전 Grok 모델이 강점을 보였던 유일한 부분은 속도와 비용이었습니다. 하지만 Grok 4.6은 이 두 가지 범주 모두에서 퇴보를 보였습니다. 토큰당 비용이 오르지는 않았지만 토큰 효율이 떨어져 결과적으로 더 비싸졌습니다. 또한 토큰 효율 저하로 더 많은 토큰을 생성하고 처리 시간이 길어져 속도가 느려졌습니다. 이러한 변화는 Grok 4.6의 전반적인 매력을 감소시키는 요인으로 작용하고 있습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
Tech Bridge에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 21편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.