3가지 새로운 AI 모델 출시: Opus 5.5, GPT-6 Sol, GPT-6 Luna
이 모델들은 성능과 비용 효율성에 중점을 두고 코딩 및 지식 작업의 일상적인 도구로 자리매김하고 있습니다.
Anthropic과 OpenAI의 새로운 AI 모델이 블라인드 테스트에서 놀라운 강점과 약점을 보여주며 일상 생산성에 대한 기대를 재편합니다.
이 모델들은 성능과 비용 효율성에 중점을 두고 코딩 및 지식 작업의 일상적인 도구로 자리매김하고 있습니다.
이 확장은 새로운 모델의 정교함과 에이전트 능력이 증가함에 따라 인정된 주관성에도 불구하고 블라인드 테스트와 LLM 심사위원을 활용하여 이를 다룹니다.
새로운 AI 모델은 비용 절감뿐만 아니라 출력 생성, 토큰 사용 및 전반적인 속도 개선을 우선시합니다.
예를 들어, Opus 5.5는 현재 GPT-6 Soul보다 두 배 비싸지만, 부실한 캐시 관리로 인한 예상치 못한 비용을 방지하기 위해 캐시된 입력 최적화에 상당한 초점을 맞추고 있습니다.
위험하다고 판단되는 요청을 차단하거나 등급을 낮추도록 설계된 이 모델은 광범위한 외부 평가를 거쳐 내장된 사이버 및 바이오 보안 제약 조건을 통합합니다.
이 모델은 사이버 또는 바이오 작업에서 위험하다고 판단되는 요청을 적극적으로 차단하거나 등급을 낮추어 보수적인 특성을 반영합니다.
그러나 이러한 보수성은 모델이 특정 작업을 거부하게 만들 수 있으며, 이는 진행자가 지적한 동작입니다.
리뷰어의 경험에 따르면 GPT 모델, 특히 GPT-6 Sol은 Claude 모델에 비해 훨씬 빠른 성능을 보입니다.
Claude 3.5의 감소된 내레이션은 처리 상태에 대한 불확실성을 유발할 수 있지만, GPT 모델은 속도를 유지하면서 적절한 수준의 내레이션을 제공합니다. 이는 Claude의 '고노력' 백그라운드 처리로 인한 느린 속도와 대조됩니다.
프론트엔드 및 백엔드 코딩, 에이전트 워크플로우, 크리에이티브 기능과 같은 새로운 범주가 추가되었으며, OpenAI, Anthropic, Grock, Muse의 모델이 평가 중입니다. 에이전트 개성 등 특정 작업 요구 사항에 따라 다양한 선호도가 예상됩니다.
모델 B, C, E, G와 같은 이름이 공정성을 보장하는 블라인드 테스트 동안, 모델 B는 캘린더 초대장이 포함된 읽기 쉬운 이메일을 생성하여 최고 점수를 받았습니다.
Grock으로 식별된 모델 C는 낮은 토큰 사용으로 인해 혼란스럽고 문맥이 부족한 응답을 생성하여 비판을 받았습니다.
리뷰어는 또한 과도하게 대시를 사용하는 모델에 대한 불만을 표명하며 이를 '엉성하다'고 불렀습니다.
제 Grockbot은 토큰을 너무 적게 사용하여 대체 무슨 의미인지 이해하기 거의 불가능합니다. 저는 이게 싫어요.
리뷰어는 작문 작업에서 AI 모델을 주관적으로 채점했습니다. 짧지만 이해하기 쉬운 출력에 모델에 3점을, 불필요한 정보를 올바르게 생략한 모델에 4점을 부여했습니다.
Luna는 명시적인 이메일 작성 규칙을 세심하게 준수하여 최고 점수 5점을 받았습니다.
이 평가 과정은 수신자가 효율성과 명확성을 위해 작업 출력을 검토하는 실제 시나리오를 반영했습니다.
평가는 색상 사용, 빈 상태 처리 및 레이아웃에 대한 모델 출력을 비판했으며, 리뷰어는 일반적인 원샷 프롬프트에 의존하기보다는 내재된 디자인 패턴과 약점을 밝히기 위해 블라인드 테스트를 수행했습니다.
Grock이라고 생각해요. 아마 Grock일 거예요. 모르겠어요. 이것도 우리가 할 또 다른 일이죠. 이런 것들을 블라인드 테스트하는 거예요.
소비자 중심 디자인은 자주 숲 녹색과 세이지 팔레트에 의존하지만, 이러한 선택은 SaaS 제품 표준에 필요한 전문적인 세련미가 부족한 경우가 많습니다.
많은 소비자 중심 디자인은 낮은 텍스트 무게와 중복된 레이아웃 선택으로 인해 '엉성하다'고 분류되었으며, 종종 Claude Artifacts를 연상시키는 영감 없는 템플릿으로 기본 설정되어 일관되고 창의적인 디자인의 부족을 나타냅니다.
모델은 기능적인 SVG 일러스트레이션 생성에 향상된 숙련도를 보여주며, 이는 그 능력의 주목할 만한 발전입니다.
그러나 리뷰어는 모델이 모서리에 원을 일관되게 배치하는 반복적이고 답답한 디자인 패턴을 발견했으며, 모델 H는 우수한 SVG 정밀도와 전반적인 시각적 매력으로 두각을 나타냈습니다.
개발 도구용 앱 디자인은 종종 과도한 정보 밀도로 인해 사용성과 명확성이 저해되는 문제에 직면합니다.
더 높은 평가를 받은 모델은 더 깔끔하고 간단하며 읽기 쉬운 인터페이스를 생성하여 칭찬받았으며, 기존의 다크 모드 미학에서 벗어난 창의적인 디자인에 추가 점수가 주어졌습니다.
각 모델이 코드를 성공적으로 감사하고 사양에 따라 백엔드 기능을 구축했지만, 출력의 깊이는 상당히 다양하여, 스피커는 기술적 가독성을 확인하기 위해 '판사로서의 LLM'을 활용하게 되었습니다.
모델이 출력을 제시하는 방식에서 상당한 차이가 관찰되었으며, 메시지는 극도로 간결한 것부터 매우 상세한 것까지 다양하여 PR 설명 및 기술 사양의 가독성에 영향을 미쳤습니다.
'판사로서의 LLM' 방법론은 코드의 정확성을 확인하는 데 사용될 것이며, 효과적인 의사소통을 위한 명확한 표현의 중요성을 강조합니다.
정보 전달의 품질은 백엔드 코드와 사양을 얼마나 쉽게 이해하고 감사할 수 있는지에 직접적인 영향을 미칩니다.
평가 기준은 정보를 주요 문제와 잠재적 충돌로 효과적으로 분류하여 가독성과 유용성을 향상시키는 모델을 선호했습니다.
모델들은 문서, 마이크, 버그를 포함한 특정 SVG를 생성하도록 요청받았으며, 품질은 다양하게 나타났습니다.
모델 H는 우수한 상세 렌더링으로 최고 점수를 받았으며, 특히 선인장이 아닌 마이크와 명확하게 유사한 적절한 그림자가 있는 마이크를 생성했습니다.
초기 예측에 따르면 Claude/Opus 5.5가 프론트엔드 작업에서 탁월할 수 있으며, Soul은 글쓰기에서 선호될 수 있습니다. 리뷰어는 또한 3D 바비 패션 비디오 게임을 포함하는 개인 벤치마크인 그녀의 '바비 벤치'를 참조합니다.
GPT-6 Astra와 GPT-6 Soul은 개인적인 선호도와 캐릭터 SVG 작업에 선호되는 반면, Opus 5.5는 가장 광범위한 작업에서 가장 높은 점수(4점 및 5점)를 받았습니다.
Opus 5.5는 에이전트 작업 및 장기 실행 워크플로우에 가장 효과적인 것으로 특별히 언급되는 반면, GPT-6 모델은 제품 요구 사항 문서(PRD) 생성에서 가독성과 단순성으로 칭찬받아, 낮은 성능으로 인해 Fable은 호스트의 워크플로우에서 제외되었습니다.
GPT6 Astra와 GPT6 Soul이 제 마음을 사로잡았어요. 음, 좋아요. Astra와 GPT6가 너무 좋아요. 그리고 Opus 5.5가 제 한 주를 승리로 이끌었다고 하네요.
Opus 5와 5.5는 지나치게 장황하고 수다스럽다는 비판을 계속 받고 있으며, 간결성을 줄이기 위한 노력에도 불구하고 간결성 문제가 지속되고 있음을 나타냅니다.
대조적으로 Astra와 Soul은 캐릭터 SVG 생성에서 우수한 성능을 보였으며, Claude Opus는 B2B 갱신 작업에 대한 선호도를 유지하여 호스트의 선호도와 LLM 심사위원이 제시한 순위 사이에 불일치가 있음을 보여주었습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
How I AI의 다음 글도 받아볼까요?
How I AI에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 3편 올렸어요.