일론 머스크의 Grok 4.7 우수성 주장이 충족되지 않다
머스크는 SpaceX의 독점적인 훈련 코퍼스를 결정적인 장점으로 강조하며, Grok 4.7이 실제 코딩 성능에서 타의 추종을 불허할 것이라고 시사했습니다. 그러나 예비 테스트에 따르면 Grok 4.7은 현재 여러 벤치마크에서 이전 모델인 Grok 4.6보다 성능이 떨어지고 있습니다.
일론 머스크의 높은 기대에도 불구하고, Grok 4.7은 주요 벤치마크와 실제 비용 효율성에서 상당한 저조한 성능을 보이며 선도적인 AI 모델들과 경쟁하는 데 어려움을 겪고 있습니다.
이 아티클
아티클 전체를 저장하고 메모를 남길 수 있어요.
머스크는 SpaceX의 독점적인 훈련 코퍼스를 결정적인 장점으로 강조하며, Grok 4.7이 실제 코딩 성능에서 타의 추종을 불허할 것이라고 시사했습니다. 그러나 예비 테스트에 따르면 Grok 4.7은 현재 여러 벤치마크에서 이전 모델인 Grok 4.6보다 성능이 떨어지고 있습니다.
Grok 4.7을 포함한 최근 모델 출시에 관한 수많은 오해의 소지가 있는 벤치마크 데이터는 개발자와 평가자들 사이에서 상당한 불만을 야기했습니다.
벤치마크 점수에도 불구하고 Grok 4.7은 콘텐츠 제작자에게는 특정 실제 코딩 성능 때문에 개인적으로 선호됩니다. 이는 종종 합성 테스트 결과와 다릅니다.
그러나 Artificial Analysis의 데이터에 따르면 Grok 4.7은 작업당 81,000개의 토큰을 사용하며, 이는 Grok 4.6의 38,000개 토큰에 비해 상당한 증가입니다.
이러한 토큰 사용량은 Fable 5.1과 같은 다른 경쟁 모델보다도 훨씬 높아서, 토큰 효율성 향상이라는 약속은 사실상 부정확합니다.
제공 속도는 약간 느리지만 훨씬 더 나은 토큰 효율성을 제외하고는 모든 면에서 Grok 46보다 나을 것입니다. 이것은 거짓말이었습니다.
Artificial Analysis 벤치마크를 사용한 분석 결과 Grok 4.7의 운영 비용이 눈에 띄게 증가했습니다.
Grok 4.6은 작업당 1.86달러, Astra는 3.26달러가 들었으며, Grok 4.7은 작업당 3.74달러로 가장 비쌌습니다. 이는 이 특정 실행에서 새 모델의 비용이 거의 두 배 증가했음을 나타냅니다.
XAI의 Michael은 SpaceX 및 Cursor의 프로덕션 환경에서 Grok 4.7이 4.6에 비해 중간 요청에 대해 5% 더 많은 토큰을 사용하고 P99 요청에 대해 20-30% 더 많은 토큰을 사용할 것이라고 설명했습니다.
XAI는 이러한 차이가 사용자들이 모델에 대한 프롬프트를 구성하는 방식의 분포 변화 때문이라고 설명합니다.
발표자는 토큰 효율성과 기본 모델 아키텍처에 대한 XAI의 주장이 오해의 소지가 있을 수 있다고 의문을 제기했습니다.
모델이 주장하는 대로 실제로 새로운 2.1조 파라미터 기본 모델을 사용하는지에 대한 의문이 제기되었습니다.
'요청'으로 토큰 사용량을 측정하는 것은 부정확한 방법이라고 주장되기도 했습니다. 프롬프트에는 가변적인 수의 도구 호출이 포함될 수 있으므로 단일 요청은 정확한 측정 단위가 될 수 없기 때문입니다.
발표자가 실시한 비공개 벤치마크에 따르면 Grok 4.7은 가장 비싼 실행에서 20달러의 비용이 발생하여 다른 모델보다 훨씬 높았습니다.
대부분의 다른 모델은 10달러를 초과하지 않았으며, Astra 실행 중 하나만 간신히 11.44달러에 도달했을 뿐이었습니다. 반면 Opus 5 실행은 Grok 4.7 가격의 4분의 1 미만으로 관찰되었습니다.
발표자는 공식 XAI 벤치마크에 Astra가 없는 것을 지적하며 그 제외에 의문을 제기했습니다.
OpenAI의 정책은 SpaceX가 경쟁 벤치마크에 OpenAI 모델을 포함하는 것을 금지하고 있으며, 이는 Astra의 누락을 설명합니다.
Grok 4.7은 Grokbot 하네스를 기본적으로 이해하도록 특별히 훈련되었으며, 발표자는 처음에는 특이하다고 생각했지만 나중에는 진정으로 유익한 기능임을 인정했습니다.
초기 회의론에도 불구하고, 이 통합은 사용자들 사이에서 매우 유리하고 인기가 있는 것으로 입증되었으며, Grokbot을 합법적인 도구로 만들었습니다.
모델은 다른 벤치마크에서 기대되는 부드럽고 예측 가능한 곡선 대신 다양한 추론 수준에서 무작위적인 성능 급등 및 하락을 보였으며, Grok 4.7은 특정 작업에서 '과잉 사고'로 인해 Grok 4.6보다 뒤처졌습니다.
놀랍게도 Grok 4.7은 모든 Artificial Analysis 벤치에서 Muse Spark 1.3보다 낮은 점수를 기록하여 전반적으로 기대에 미치지 못하는 성능을 보였습니다.
이 채널의 새 영상도 아티클로 메일 받으세요.
벤치마크에서 단 6점의 차이도 모델이 특정 시간 내에 오류를 범하거나 최적화되지 않은 출력을 생성할 빈도를 크게 나타낼 수 있습니다.
오류율을 줄이면 사용자가 오류를 수정하는 데 시간을 덜 소비하므로 작업을 완료하는 데 사용할 수 있는 시간이 효과적으로 늘어납니다.
고급 모델은 사용자의 광범위한 '지침' 또는 자세한 사전 사양 필요성을 최소화하여 더욱 자율적인 경험을 제공합니다.
반면 Grok 4.7은 최고 수준의 경쟁 모델과 동일한 수준의 품질과 결과를 얻기 위해 더 많은 사용자 노력을 요구합니다.
Artificial Analysis는 Grok 4.7이 AA Briefcase 벤치마크에서 3위를 차지하며 특정 영역에서 상당한 발전을 보였다고 관찰했습니다.
이러한 개선에도 불구하고 Grok 4.7은 프리젠테이션 품질에서 퇴보를 보였으며, ELO 점수가 Grok 4.6보다 실제로 낮았습니다. 반면 Anthropic은 디자인 기능에서 선두를 유지하고 있으며 Astra는 조종성이 향상되었습니다.
Grok 4.7의 출시는 Reinforcement Learning(RL) 튜닝과 관련된 문제로 인해 지난주보다 지연되었습니다.
일론 머스크는 이러한 지연이 훈련 중에 응답 길이에 과도하게 페널티를 부여하여 모델이 어려운 작업을 조기에 포기하게 만들었기 때문이라고 설명했습니다. 이는 이러한 동작을 수정하는 것이 이전에 홍보했던 토큰 효율성을 손상시켰을 가능성이 있음을 암시합니다.
RL에서 응답 길이에 너무 많은 페널티를 주었거나, 아직 할 수 있는 어려운 작업을 너무 일찍 포기하고, 작업을 확인하는 데 충분히 엄격하지 않은 경우가 있을 수 있습니다.
발표자는 T3 Code 코드베이스 내에서 개선 사항을 식별하고 제안하는 다양한 모델의 능력을 평가했습니다.
Astra는 가장 새롭고 철저한 개선 사항을 식별하며 뛰어난 성능을 보였습니다. Grok 4.7은 놀랍게도 Astra 바로 뒤에서 제안의 타당성 면에서 좋은 성능을 보였습니다.
Fable 5.1은 제안 수가 적었지만 높은 품질을 유지했으며 도움이 되지 않거나 잘못된 경로를 생성하는 것을 효과적으로 피했습니다.
평가자는 또한 Gemini 37과 38 버전 간의 혼동에 대해서도 언급했습니다.
Grok 4.5와 관련된 경제적 이점은 더 이상 존재하지 않습니다. Grok 4.7은 경쟁 모델보다 느리고 비싸며 오류율이 높아서 미래 반복을 위한 '징검다리' 역할만 할 수 있음을 시사합니다.
Fable과 Astra는 AI 기술의 중요한 세대적 도약을 나타내며 새로운 성능 표준을 설정하고 있습니다.
Grok 4.7은 성능 면에서 '이전 세대'로 특징지어지지만 '현재 세대' 가격으로 책정되어 AI 기술이 계속 발전함에 따라 정당화하기 점점 더 어려워지고 있습니다. 진행자는 모델 효율성을 향상시키기 위한 미래 RL 개선을 희망하며, Cursor 생태계에 전념하는 사람들에게만 추천을 유보합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
Theo - t3․gg의 다음 영상도 받아볼까요?
Theo - t3․gg에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 6편 올렸어요.