Claude Sonnet 5.5, B티어로 상당한 도약 예상
Sonnet 5는 이전에 F-티어로 분류되었지만, Sonnet 5.5는 B티어에 도달할 것으로 예상됩니다. 이 모델의 가격은 Opus 5.5의 약 절반 수준이 될 것으로 예상됩니다.
브리지마인드는 NerfBench 출시와 플랫폼의 중요한 업데이트를 통해 진화하는 AI 환경을 탐색하는 동시에 Claude Sonnet 5.5의 기능을 분석하고 급변하는 기술 변화에 적응하고 있습니다.
Sonnet 5는 이전에 F-티어로 분류되었지만, Sonnet 5.5는 B티어에 도달할 것으로 예상됩니다. 이 모델의 가격은 Opus 5.5의 약 절반 수준이 될 것으로 예상됩니다.
창작자는 잠재적인 연결을 위해 Open Router 사람들과 대화하는 것을 포함하여 수익화 전략을 적극적으로 추진하고 있습니다.
이러한 수익화 노력의 목표는 프로젝트에 자금을 조금 더 잘 지원할 수 있도록 하는 것입니다.
브리지마인드는 Rust 애플리케이션에만 집중하기로 결정했으며, 이는 플랫폼의 아키텍처적 전환을 의미합니다.
이 결정에는 Mac에 사용되었던 이전 Swift 기반 리포지토리에서 벗어나는 것이 포함됩니다. 이 전환의 주요 동기는 두 개의 리포지토리를 관리하고, 둘 다 최신 상태로 유지하며, 각 리포지토리에서 발생하는 버그의 어려움입니다.
Rust 애플리케이션에 대한 모노-레포 접근 방식은 효율성과 안정성을 향상시켜 Windows 및 Linux 사용자에게 전반적인 사용자 경험을 향상시키고, Mac 사용자는 추후 적용될 것으로 예상됩니다.
호스트는 OpenAI의 다가오는 개발자 데이에 대한 기대를 표명했지만, 발표가 에이전트 모드를 넘어 확장되기를 바랍니다.
소문에 따르면 Grokbot의 잠재적 경쟁자인 'O'의 출시가 언급됩니다.
호스트는 발표가 에이전트 중심 모델에만 국한되지 않기를 바랍니다.
Nerf Bench는 성능, 토큰, 비용의 세 가지 측정 기준을 측정하여 전력량을 계산합니다.
테스트 결과 Claude Opus 5.5는 99.2%의 전력으로 실행되고 GPT6 Astra는 102.8%의 전력으로 실행되는 것으로 나타났으며, 두 결과 모두 정상적인 편차 범위 내에 있는 것으로 간주됩니다.
이 도구는 일주일에 세 번 모델을 테스트하고 미래에 추가 모델을 포함하는 것을 목표로 합니다.
브리지벤치는 최근 스트림에서 2,27명의 활성 사용자를 기록했습니다.
호스트는 전날 2,200명의 사용자가 있었다고 보고했습니다.
호스트는 플랫폼의 현재 사용자 수에 만족감을 표했습니다.
Gemini 4 Pro의 200만 토큰 컨텍스트 창에 대한 X 게시물이 110만 조회수를 기록했음에도 불구하고, 호스트는 팔로워 수가 적다는 이유로 출처의 신뢰성에 의문을 제기합니다.
호스트는 작성자의 적은 팔로워 수와 그러한 유출에 대한 자신의 경험을 인용하며 유출의 진위 여부에 대해 회의적인 입장을 표명했습니다.
새로운 Gemini 모델은 10월에 출시될 것으로 예상되지만, 호스트는 시청자들에게 2월 이후로 큰 업데이트가 없었다는 점을 상기시켰습니다.
이 사람은 유출 정보를 가지고 있을 수도 있지만, 제 경험상으로는 사실일 가능성이 낮다고 봅니다. 음, 이건 가짜 같지만, 유행하고 있습니다.
Supabase가 사용하기는 더 쉽지만, AWS에 비해 장기적인 보안에 대한 불확실성을 표명합니다.
AWS Cognito는 인증 및 보안을 위한 강력한 시스템으로 강조되며, 특히 HIPAA 준수 인프라를 찾는 사람들에게 권장됩니다. 이전에 HIPAA 준수 스타트업을 관리했던 호스트는 그 목적으로 AWS에 의존했다고 설명했습니다.
일부 경쟁 모델보다 느림에도 불구하고 Opus 5.5는 정확성과 복잡한 문제를 처리하는 능력 때문에 게임 체인저로 간주됩니다.
2022년 말 이후 AI 발전 속도가 가속화되었으며, Opus 5.5와 같은 모델은 한때 불가능했던 작업을 이제는 수행할 수 있습니다.
예를 들어, GPT-6는 각 작업에 대해 답변에 약 11,000토큰, 추론에 추가 17,000토큰을 사용합니다.
반면 Opus 5.5는 전반적으로 더 적은 토큰을 출력하여 우수한 효율성을 보여주지만, 속도가 우선시되는 매우 복잡한 작업에서는 더 느릴 수 있습니다.
제작자는 월간 클리핑 비용이 500달러에서 약 5달러로 줄어들어 99.5%의 비용 절감 효과를 보였다고 보고했습니다.
이 도구는 또한 Jev를 아키텍처에 성공적으로 통합하여 사용자에게 기능성과 효율성을 향상시켰습니다.
Bridgebench 및 NerfBench와 같은 제품에 대한 전략적 마케팅은 사용자 확보 및 팔로워 증가에 큰 영향을 미칩니다.
X에서 제작자는 하루 만에 2,000명의 팔로워를 확보했으며, 이는 이전에 조회수가 높았던 날에 314명의 신규 팔로워만 얻었던 것과 비교할 때 7배 증가한 수치입니다.
이러한 급증은 Bridgebench 및 NerfBench가 제공하는 독특한 유용성 덕분이며, 이러한 마케팅 노력은 연간 반복 수익(ARR) 및 사용자 참여도 증가에 가시적으로 기여하고 있습니다.
브리지마인드는 현재 베타 단계에 있는 새로운 애플리케이션인 브리지버스를 출시하여 사용자가 가상 환경을 탐색할 수 있도록 했습니다.
베타 버전에서는 피부색 및 액세서리 변경을 포함한 캐릭터 커스터마이징이 가능하며, 기본적인 상호 작용 요소도 시연됩니다.
브리지버스의 향후 계획에는 선글라스를 쓴 독일 셰퍼드 '빅 티(Big T)'와 같은 '브리지 펫' 통합이 포함되어 가상 세계 내에서 상호 작용 및 사용자 참여도를 높일 것입니다.
이 라이브 중계는 호스트가 이벤트에서 공개되는 새로운 모델에 대한 즉각적인 반응을 제공하고 실시간 테스트를 수행할 수 있도록 할 것입니다.
공동 스트림은 OpenAI의 최신 발전에 대한 집단적 관찰 및 분석을 위한 역동적인 플랫폼을 제공하여 커뮤니티의 참여를 유도하는 것을 목표로 합니다.
Sonnet 5 및 Opus 5와 같은 이전 반복 모델들은 '완전히 실패작'으로 묘사되어 성능 부족의 역사를 강조했습니다.
새로운 Sonnet 5.5는 Opus 5.5에서 관찰된 주목할 만한 도약과 유사하게 상당한 성능 도약을 이룰 것으로 예상되며, 초기 과대 광고가 부족할 것으로 예상됨에도 불구하고 경쟁력 있고 저렴한 옵션이 될 가능성이 있습니다.
이전에 예정되었던 커뮤니티 프로젝트 공유 행사는 가족 비극으로 인해 취소되어 그 발전이 지연되었습니다.
브리지마인드 커뮤니티가 확장됨에 따라 프로젝트 공유 행사는 참가자들이 자신의 작업을 진정으로 공유하기보다 제품을 마케팅하는 플랫폼으로 점점 더 변모했습니다.
커뮤니티가 작았을 때 만연했던 진정한 공유에서 대본에 기반한 마케팅 중심의 프레젠테이션으로의 이러한 변화는 협력적인 기술적 호기심이라는 원래의 의도를 약화시켰습니다.
프로젝트 공유 행사의 목적은… 사람들이 대본을 따르고 광고를 내보내기 위한 것이 아닙니다. 자신이 하고 있는 일을 진정으로 공유하기 위한 것입니다. 그렇죠?
발표자는 시장 검증을 보장하기 위해 마케팅을 나중에 고려할 것이 아니라 처음부터 제품 개발에 통합해야 한다고 주장했습니다.
현재 발표자는 Mac에서 실행되는 Swift 애플리케이션을 사용하고 있으며, Windows 사용자는 Rust 애플리케이션에 더 빨리 액세스할 수 있다고 언급했습니다.
제안된 비서는 가상 사무실의 문간에 물리적으로 나타나 사용자와 상호 작용하고 작업 공간 내의 다양한 에이전트를 관리할 것입니다.
이 비서는 지정된 사무실 내의 모든 작업 및 에이전트의 전체 컨텍스트를 유지하여 포괄적인 관리 기능을 제공하도록 의도되었습니다.
이 시스템은 GPT Live를 통합하여 사용자가 자연어를 통해 비서와 통신하고 사무실 기능을 조정할 수 있도록 할 것입니다.
분당 1센트인 11 Labs V4 Turbo는 분당 5센트인 GPT Live보다 훨씬 저렴합니다.
발표자는 현재 음성 AI의 가격 모델이 비싸서 다양한 애플리케이션에서 활용이 제한될 수 있다고 말했습니다.
이 비서는 음성 기반 조정을 가능하게 하여 입구의 주 AI가 다른 전문 에이전트에게 작업을 지시합니다.
개발자는 이 시스템을 다양한 자율 사무실 작업을 자동화하고 간소화하기 위한 중앙 제어 지점으로 구상하고 있습니다.
한때 최첨단 모델이었던 Fable 5로 돌아가는 것은 오늘날에는 잘못된 방향으로 나아가는 것처럼 느껴질 것입니다.
AI 개발의 빠른 반복 속도로 인해 이전 주력 모델은 빠르게 구식처럼 느껴집니다.
발표자는 현재 AI 환경의 가속도에 대한 불신을 표명하며, 한 달 전만 해도 프론티어로 간주되었던 모델이 잘못된 방향으로 나아가는 것처럼 느껴진다고 언급했습니다.
호스트는 AI 비서에게 음성 대화를 위한 직접 클릭 가능한 상호작용을 활성화하도록 지시했습니다.
이 기능은 양방향 통신을 보장하기 위해 GBT Live Voice 엔드포인트와 통합되어야 합니다.
호스트는 또한 에이전트가 시스템을 사용하는 방법에 대한 핸드오프 프롬프트를 요청하여 다른 AI 개체가 이를 활용할 수 있도록 했습니다.
호스트는 Bridgeverse의 출시 비디오 제작을 요청하며, 5개의 Opus 5.5 에이전트에게 프로젝트 실행을 지시했습니다.
비디오는 30초 길이로 모션 그래픽을 포함하고, 11 Labs와 통합하여 사람과 유사한 아바타가 말할 수 있도록 제작해야 합니다.
이 접근 방식은 여러 에이전트를 사용하여 출시 비디오 제작이라는 창의적인 작업을 처리합니다.
팀은 현재 환경 내 비디오 생성을 위해 HTML에서 3JS를 사용합니다.
시장 데이터에 따르면 Sonnet 5.5 출시 확률은 90%였습니다.
UI 디자인 벤치에서 무엇을 보고 싶으세요? 아이디어가 필요합니다. 아직 마음에 드는 아이디어를 보지 못했습니다.
호스트는 가상 오피스 내 에이전트 행동, 특히 에이전트들이 서로 겹쳐 서 있는 문제를 해결하고자 합니다.
목표는 에이전트들이 작업 시 물리적으로 컴퓨터 스테이션에 앉도록 하고, 더 많은 에이전트를 수용할 수 있도록 각 오피스에 더 많은 컴퓨터를 추가하는 것입니다.
호스트는 작업 상태가 기능적이며 에이전트들이 자신의 스테이션에 제대로 배치되도록 하고자 합니다.
초기 후원 자리는 월 1,500달러로 책정되었으며, 호스트는 입찰이 월 5,000달러에 이를 수 있을 것으로 예상하고 있습니다.
호스트는 Open Router를 잠재적인 후원 후보로 식별했습니다.
호스트는 초기 후원자가 콜드 아웃리치를 통해 올 가능성이 높다고 언급하며, 입찰 전쟁의 가능성에 대한 피드백을 인정했습니다.
호스트는 설치 과정에서 업데이트가 비활성화되어 어려움을 겪었으며, 'claude install 2.1.284' 명령을 여러 번 시도했습니다.
호스트는 모델 출시를 확인하고 기능을 테스트하기 시작했습니다.
출시 블로그 게시물은 Claude Sonnet 5.5가 에이전트 코딩 작업에서 Opus 5.5를 능가한다고 강조합니다.
블로그 게시물은 새 모델이 이전 버전보다 30% 더 빠르게 작동하고 최대 30% 더 저렴하다고 언급합니다.
블로그에 따르면 Sonnet 5.5는 고강도 Frontier Code 작업에서 Sonnet 5보다 10점 더 높게 평가되며, 향상된 도구 호출 일괄 처리를 제공합니다.
배포를 통해 웹 인터페이스 내에서 Sonnet 5.5의 접근성이 확인되어 즉시 테스트할 수 있었습니다.
호스트는 모델의 존재를 확인하고 잠재적인 창의적 작업을 위한 테스트 프롬프트를 로드할 준비를 시작했습니다.
제가 가지고 있어요, 여러분. 좋아요, 완벽해요. 좋아요, 저희 테스트 프롬프트를 줘봅시다.
스트리머는 이 벤치마크 결과에 불신을 표명했습니다.
예상치 못한 성능으로 인해 모델의 기능에 대한 즉각적인 재평가가 이루어졌으며, 이는 이전 Sonnet 5 반복 모델의 성능을 초과했습니다. 개발자는 이 결과를 X에 공유하며 Sonnet 5.5가 Fable 5.1을 능가한다고 강조했습니다.
Sonnet 5 및 Fable 5.1에 대한 성능 도약으로 이러한 발전을 철저히 분석하기 위한 새로운 전용 스트림을 고려하게 되었습니다.
스트리머는 Claude Sonnet 5.5가 Fable 5.1을 능가할 뿐만 아니라 5분의 1 가격으로도 능가한다는 주장에 회의적인 입장을 표명하며 즉각적인 테스트를 요청했습니다.
설정된 벤치마크와 성능을 비교하기 위해 '호러 하우스' 및 '마인크래프트 클론' 프롬프트를 사용한 초기 테스트가 시작되었습니다.
Cursor Bench를 통한 토큰 사용량 및 속도 분석 결과 Sonnet 5.5가 Opus 5.5에 비해 더 많은 토큰을 소비하는 것으로 나타났습니다.
토큰을 많이 소비하는 특성에도 불구하고 모델의 이러한 초기 테스트 성능은 비용 효율성 주장을 검증하기 위해 모니터링되고 있습니다.
테스트 결과 Sonnet 5.5를 최대 노력으로 실행하면 Fable 5.1과 비슷한 비용이 발생하여 예상되는 비용 절감 효과가 상쇄되는 것으로 나타났습니다.
반대로, Sonnet 5.5에서 '매우 높음' 노력 설정을 사용하면 성능을 유지하면서 더 나은 비용 효율성을 제공합니다.
Sonnet 5.5의 최대 및 매우 높음 노력 수준 간의 성능 차이는 Opus 5.5에서 관찰된 것과는 현저하게 다릅니다.
최대 노력 설정은 더 느리고 더 많은 토큰 소비로 이어지는 것으로 나타났습니다.
이 모델은 생성된 환경 내에서 복잡한 게임 레이아웃과 정교한 객체 상호 작용을 성공적으로 생성했습니다.
이러한 성능은 Sonnet 5.5의 효율성을 강조하며, 특정 창의적 벤치마크에서 이전 모델 반복보다 우수한 성능을 보였습니다.
공포 게임 생성 과정은 이전 Fable 5.1 테스트보다 빨랐으며, 모델의 향상된 속도를 보여줍니다.
음, 이것은 GBT6 Astra보다 낫습니다.
호스트는 Claude Sonnet 5.5의 '최대' 노력 설정이 현재 대부분의 개발 작업에 비효율적이라고 제안했습니다.
최대 설정으로 인해 상당한 지연이 발생하여 슈팅 게임 프로젝트가 42분 동안 멈춰 있었습니다.
호스트는 '높음' 또는 '매우 높음' 노력 계층으로 전환했으며, 이는 속도와 유용성의 더 나은 균형을 제공한다고 생각했습니다.
호스트는 '최대' 노력 설정이 과도하다고 판단한 후 Sonnet 5.5의 실용적인 유용성을 평가하기 위해 보다 표준적인 워크플로우로 전환했습니다.
효율적인 노력 계층을 사용하여 BridgeMind 웹사이트 재구축 프로젝트에 Sonnet 5.5를 통합하는 데 중점을 둡니다.
호스트는 일부 교육 주장에 회의적인 입장을 표명했지만, 실제 애플리케이션에서 새 모델의 속도와 반응성에 여전히 감명을 받았습니다.
회사는 비디오 콘텐츠 클리핑을 위해 설계된 새로운 오픈 소스 도구인 BridgeClip을 출시했습니다.
BridgeClip은 Opus Clip과 같은 상업용 대안보다 95-99% 저렴하다고 보고되었습니다.
브리지마인드는 10월 초까지 Bridgebench.ai에서 50% 할인을 계속 제공하며, 주요 업데이트는 최근 Windows 사용자에게 배포되었고 Mac 사용자는 당일 늦게 받을 예정입니다.
BridgeMind 1에 통합된 Bridgeverse는 11 Labs V4 음성 모델을 활용하여 코딩 에이전트를 위한 시뮬레이션된 사무실 환경을 생성하고 사용자 상호 작용을 향상시킵니다.
사용자는 음성 명령을 통해 에이전트를 관리하고, 가상 데스크와 상호 작용하며, 라이브 터미널에 액세스하여 개발 프로세스를 간소화할 수 있습니다.
이 플랫폼은 XP 및 연속 기록과 같은 게임화 요소를 통합하여 개발자의 동기를 부여하고 코딩 경험을 더욱 흥미롭게 만듭니다.
Bridgeverse의 모든 작업 공간은 방으로 표현되며, 각 코딩 에이전트에게는 책상이 할당되며, 사용자는 'E'를 눌러 즉시 라이브 터미널에 액세스할 수 있습니다.
'헤드폰 모드'를 활성화해도 문제가 해결되지 않았으며, 사용자는 최근 업데이트가 문제를 해결하지 못했다고 경고했습니다.
제작자는 마이크 문제를 해결하기 위해 핸드오프 프롬프트가 있는 Opus 5.5 하위 에이전트를 시작하기로 결정했습니다.
Dev Day 행사 라이브 스트림을 통해 커뮤니티와 소통하고 발표 내용에 대한 실시간 업데이트를 제공할 예정입니다.
이 행사는 AI 커뮤니티에 중요한 순간이 될 것으로 예상되며, 현재 개발 동향 및 벤치마크에 영향을 미칠 수 있는 새로운 모델 및 기능을 도입할 가능성이 있습니다.
'매우 높음' 사고 모드에서 Sonnet 5.5는 Opus 5.5의 66,000토큰과 비교하여 74,000토큰을 사용했으며, 이는 효율성이 적용된 추론 강도에 크게 영향을 받는다는 것을 시사합니다.
이 특정 작업에서 모델의 성능은 Opus 5.5보다 현저히 우수하여 더 효과적이고 기능적인 사용자 인터페이스를 제공했습니다.
그러나 이 일회성 생성은 49분 동안 총 177달러의 상당한 비용이 들었습니다.
호스트는 최대 사고 노력이 이 특정 애플리케이션에 대해 Opus 5.5보다 더 나은 결과를 낳았음을 확인했습니다.
앤트로픽은 Sonnet 5.5를 강화된 추론 기능으로 구성했으며, 호스트는 이것이 벤치마크에서 Opus 5.5보다 우수한 성능을 보이는 이유라고 생각합니다.
이러한 높은 추론은 종종 높은 출력 토큰 사용량으로 이어져 Fable 5.1에서 관찰된 것과 유사한 상당한 비용을 초래합니다.
Sonnet 5.5는 좀비 게임의 UI 생성과 같은 특정 작업에서 뛰어나지만, 더 복잡한 게임 로직에서는 어려움을 겪으며, 이는 다양한 애플리케이션 유형에 걸쳐 성능이 다양함을 나타냅니다.
Sonnet 5.5는 이전 모델인 Sonnet 5에는 없었던 실용적인 사용 사례를 제공합니다.
호스트는 자신의 AI 생성 프로젝트가 'AI 슬롭'이라는 비판에 대해 자신의 사업이 24만 7천 달러의 매출을 올리고 있음을 강조했습니다.
복잡한 작업을 관리하기 위해 개발자들은 100만 토큰 컨텍스트 창을 활용하고 있다고 호스트는 설명했습니다.
그는 긴 처리 시간에 대한 불만을 표명하며, 한 작업이 1시간 40분이나 걸렸다고 언급했으며, 이는 Opus 5.5의 2시간 렌더링 시간과 비교했습니다.
생성 과정은 250달러의 비용이 들었고 상당한 대기 시간이 소요되었습니다.
호스트는 생성된 게임이 현재까지 만들어진 가장 완전한 버전이라고 언급했습니다.
호스트는 자신의 개인 X 계정에 시연을 공유할 계획을 발표했습니다.
모델의 기능은 매우 인상적이지만, 호스트는 '최대 노력' 설정과 관련된 느린 렌더링 시간이 여전히 절충점이라고 강조했습니다.
호스트는 낮은 노력 수준에서는 Sonnet 5.5 사용에 대해 불확실했지만, 최대 노력 기능은 집중적인 추론이 필요한 작업에 강력한 경쟁자가 된다고 언급했습니다.
이는 시간 투자가 증가하더라도 최대 컴퓨팅 성능 및 품질을 요구하는 워크플로우에서 Sonnet 5.5의 잠재적 사용 사례를 나타냅니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
BridgeMind의 다음 글도 받아볼까요?
BridgeMind에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.