OpenAI, 강력한 시장 경쟁자로 GPT-6.1 Soul 소개
생성자는 GPT-6.1 Soul이 Astra에 비해 놀랍도록 저렴하고 유능하며 현저히 더 나은 대안임을 언급하며, 경쟁 모델에 대한 이전 리뷰를 게시하기 어렵게 만들었습니다.
OpenAI의 최신 모델인 GPT-6.1 Soul은 다양한 애플리케이션에서 높은 성능, 신뢰성 및 극적으로 감소된 비용으로 경쟁자들에게 도전합니다.
생성자는 GPT-6.1 Soul이 Astra에 비해 놀랍도록 저렴하고 유능하며 현저히 더 나은 대안임을 언급하며, 경쟁 모델에 대한 이전 리뷰를 게시하기 어렵게 만들었습니다.
Terminal Bench 4 결과는 OpenAI의 새로운 모델인 GPT-6.1 Soul이 수동 테스트의 복잡성으로 인해 벤치마크에 대한 생성자의 회의론에도 불구하고 최첨단 점수를 기록했음을 나타냅니다.
Deep SWE 결과는 Astra와 동등한 성능을 훨씬 낮은 가격으로 보여주어 개발자에게 매력적인 옵션이 됩니다.
비용 비교는 극명합니다. GPT-6.1 Soul의 낮은 설정 비용은 21센트인 반면, Astra의 낮은 설정 비용은 1.46달러이며, 동일한 점수를 달성하는 Opus 5.5의 최대 설정 비용은 14.65달러입니다.
GPT-6.1 Soul은 성능 면에서 Opus와 동일한 점수를 기록하면서 73배 더 저렴하여 광범위한 채택에 중요한 요소가 됩니다.
이 모델은 GPT6보다 더 높은 지능을 보여주며, 이는 아키텍처 설계의 근본적인 변화를 시사합니다.
초당 토큰 수가 느리다는 것은 잠재적으로 더 큰 모델 크기를 나타내며, 이는 향상된 기능에 기여할 수 있습니다.
OpenAI의 이번 재계산은 Opus 5.5와 같은 경쟁자가 제공하는 높은 가치에 대응하여 수익 마진을 보호하기 위한 전략적 움직임일 가능성이 높습니다.
개편된 Pro 구독의 예상 월 사용량은 이제 약 9,000달러로, 사용자에게 제공되는 가치 제안을 조정합니다.
캐시 읽기 가격은 95% 인하되어 백만 개당 10센트가 되었으며, 이는 OpenAI가 표준 10% 캐시 읽기 가격 비율에서 벗어난 최초의 사례로, 특히 실제 에이전트 워크플로우를 목표로 합니다.
GPT-6.1 Soul로 실행된 가장 비싼 작업은 약 1.38달러가 소요되어 운영 효율성을 입증했습니다.
대조적으로, Opus 5.5로 실행된 가장 저렴한 작업은 5.12달러였으며, Opus 5.5가 실제 비용 면에서 약 4~5배 더 비싸다는 것을 보여주었습니다.
Astra는 매우 지능적이지만 예측할 수 없는 성능 스파이크로 인해 화자로 하여금 일관성 부족에 대한 불만으로 인해 일상적인 작업에 Opus 5.5로 전환하게 만들었습니다.
Soul 6.1은 덜 '스파이크'한 모델로 설명되며, Astra의 혁신적인 3D 기능만큼 정점이 높지 않음에도 불구하고 복잡한 작업에 대해 더 신뢰할 수 있고 안정적인 경험을 제공합니다.
Julius와 Ben과 같은 테스터들은 Soul 6.1이 Astra에 비해 '지루하게' 느껴지지만 작업을 일관되게 효과적으로 수행한다고 언급했습니다.
화자는 Soul 6.1을 성공적으로 배포하여 이메일 관리를 자동화하고 금융 송장을 처리하여 중요한 애플리케이션에서의 신뢰성을 강조했습니다.
이 모델은 Chrome 탭을 정리하고, 송금 세부 정보를 채우고, 간과된 송장과 잠재적인 오류를 정확하게 식별하는 기능을 시연했습니다.
이러한 수준의 자동화 신뢰성은 Astra와 같은 모델에서 종종 관찰되는 일관성 없는 성능과 대조될 때 특히 두드러집니다.
GPT-6.1 Soul은 OpenAI 모델의 '로트와일러' 특성을 유지하며 코드 버그를 찾아내는 심층적인 기능을 보여줍니다.
orchestrator v2 감사에서 Soul 6.1은 Astra(83.8)와 Grock 4.7(80.7)을 모두 능가하여 T3 코드 개선에서 87.4점을 달성했으며, 더 많은 토큰을 소모했음에도 불구하고 철저함을 보여주었습니다.
T3 코드 개선 작업 비용은 Soul 6.1의 경우 2.15달러로 Opus 5.5의 5.00달러, Sonnet 5.5의 거의 9.00달러에 비해 현저히 낮았습니다.
Soul 6.1은 Opus 5.5 및 Sonnet 5.5와 경쟁할 수 있는 성능 수준을 보여주며 시장에서 강력한 경쟁자로 자리매김합니다.
Soul 6.1 실행 비용은 불과 7달러로, Sonnet 5.5의 15달러, Opus 5.5의 50달러보다 현저히 낮아 매우 비용 효율적입니다.
Soul 6.1은 이전 모델보다 토큰 낭비가 적어 효율적임을 입증했지만, Opus 5.5는 장기적인 무인 개발 작업에 여전히 우위를 유지합니다.
Soul 6.1의 컨텍스트 관리 효율성은 화자의 세션에 대한 예상 비용을 5,700달러에서 1,550달러로 크게 줄였습니다.
이러한 효율성은 6.1의 경우 요청당 평균 110,000개의 토큰을 읽는 것으로 더욱 입증되며, Sonnet 5의 360,000개 토큰에 비해 상당한 개선으로, 부풀려진 시스템 프롬프트에 대한 재정적 우려를 줄입니다.
테스트 결과 라우터는 작업의 복잡성에 관계없이 요청의 60%를 Deepseek 4.1 Flash로 무분별하게 전송하여 GPT-6 Astra를 직접 사용하는 것보다 더 높은 비용을 초래했습니다.
근본적인 결함은 추론 능력과 컨텍스트가 부족한 모델이 최적의 라우팅 결정을 내리기 위해 주어진 문제의 난이도를 정확하게 평가할 수 없다는 것이었습니다.
화자는 고수준 작업을 위한 주 모델로 Opus 5.5를 활용하여 더 넓은 전략적 기능을 위한 강점을 활용할 계획입니다.
Sonnet 6.1은 자세한 조사 작업, 버그 분류 및 코드베이스에 대한 심층 분석에 특별히 위임되어 코드 검토 및 개발을 위한 전문적이고 효율적인 워크플로우를 생성합니다.
이 모델은 고품질 3D 그래픽과 복잡한 식물 세부 정보를 생성했지만, 과도하고 불필요한 텍스트로 인해 용납할 수 없을 정도로 혼란스러운 사용자 인터페이스를 생성했습니다.
AI 생성 게임의 움직임 역학 및 프레임 속도는 Opus 또는 Sonnet으로 생성된 버전에 비해 현저히 떨어지는 느낌을 주어 사용자 경험 품질의 퇴보를 나타냅니다.
CLI를 통한 Blender를 사용한 강력한 3D 모델링 기능에도 불구하고 AI는 프런트엔드 구성 요소에 대한 디자인 감각이 떨어져 사람의 개입이 필요합니다.
화자는 기능적이고 매력적인 프런트엔드를 만들기 위한 모델을 원한다면 현재 모델의 결함으로 인해 다른 곳에 자금을 할당해야 한다고 강조했습니다.
게임 데모 생성 비용은 약 5달러로, 게임 개발 경제에 임박한 변화를 시사합니다.
업계는 AI 모델의 3차원 공간 및 필요한 도구에 대한 향상된 이해를 통해 주문형으로 몇 분 안에 전체 게임 생산을 가능하게 할 수 있는 중요한 임계점에 도달하고 있습니다.
이러한 개선된 이해는 기존 게임 개발 워크플로우를 근본적으로 변화시킬 중요한 순간을 의미합니다.
저자는 이 모델을 Lakebed와 같은 내부 프로젝트에 배포했으며, Fable과 Opus가 놓쳤던 T3 코드의 버그를 효과적으로 식별했습니다.
이 모델은 정교한 코드 분석과 컴퓨터 사용의 조합을 활용하여 높은 정확도로 회귀를 감지합니다.
저자는 코드 검토를 위해 Soul 6.1을 크게 신뢰하지만, 현재는 프로덕션 수준 코드를 작성하는 데는 신뢰하지 않습니다.
이는 Soul 6.1을 개발 워크플로우 내에서 품질 보증 및 버그 감지를 위한 귀중한 도구로 자리매김합니다.
저자는 각 모델의 고유한 강점을 활용하여 Soul 6.1과 Claude Opus를 함께 사용하는 것을 선호합니다.
Opus는 솔루션 구현을 위한 주요 코딩 협력자로 선호되며, 더 즐겁고 막히지 않는 개발 경험을 제공합니다.
Soul 6.1은 감사 및 상세 조사에 탁월하며, Opus가 생성한 코드를 효과적으로 검토하고 세부적인 문제까지 파고들어 견고한 전문 워크플로우를 생성합니다.
이 출시는 현대 AI 도구의 경쟁력 있는 가격과 높은 가치를 강조하며, AI 소프트웨어의 현재 '보조금 시대'에서 벗어날 가능성을 시사합니다.
기능에도 불구하고 저자는 여전히 Opus가 전반적으로 우수한 협력자라고 생각하며, 특정 작업 요구 사항에 따라 AI 도구의 미묘한 통합을 제안합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
Theo - t3․gg의 다음 글도 받아볼까요?
Theo - t3․gg에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 8편 올렸어요.