Claude의 장황함과 반복적인 응답으로 인한 초기 불만
'How I AI' 제작자는 Claude가 지나치게 장황한 출력 때문에 "짜증난다"며 대화 작업에 Claude를 거의 사용하지 않게 되었습니다.
Opus 5를 포함한 이전 버전들은 자주 반복적이거나 무의미한 응답을 생성하여 사용자 불만을 야기했고, 일상적인 사용에서 모델을 멀리하게 만들었습니다.
Anthropic의 최신 AI 모델은 이전의 불만을 해소하며 향상된 성능, 낮은 비용, 세련된 사용자 경험을 제공합니다.
'How I AI' 제작자는 Claude가 지나치게 장황한 출력 때문에 "짜증난다"며 대화 작업에 Claude를 거의 사용하지 않게 되었습니다.
Opus 5를 포함한 이전 버전들은 자주 반복적이거나 무의미한 응답을 생성하여 사용자 불만을 야기했고, 일상적인 사용에서 모델을 멀리하게 만들었습니다.
초기 액세스 테스트 결과, 새 모델은 이전 버전보다 훨씬 덜 답답하고 더 사용자 친화적이라는 점을 시사합니다.
이번 출시는 모델의 사용성 및 효율성에 대한 사용자 피드백을 해결하여 AI 환경에서 더욱 경쟁력 있는 옵션이 되는 것을 목표로 합니다.
Opus 5.5는 입력 토큰당 4달러, 출력 토큰당 20달러로 책정되어 이전 모델에 비해 더 비용 효율적인 솔루션을 제공합니다.
벤치마크 결과에 따르면 이 모델은 Opus 5를 능가하고 GPT6 Astra와 일치하며 다른 모델들을 능가하면서도 비용은 1/3에 불과하여 코딩 및 지식 기반 작업에서 효율성을 입증하며 훨씬 빠르고 반응성이 뛰어난 느낌을 줍니다.
새로운 "프론티어 보폭 맞추기" 프레임워크 아래에서 강화된 안전 및 정렬은 Opus 5.5를 이런 종류의 첫 번째 릴리스로 정의합니다.
이 모델은 업그레이드된 외부 평가와 프롬프트 주입에 대한 개선된 방어 기능을 통합하고 있지만, 여전히 "정사각형" 같은 성격을 유지하며 금지된 작업을 요청하는 사용자에게는 훈계할 것입니다.
이 모델은 PRD 작성, 프로토타이핑, 코드베이스 감사 등 다양한 실제 시나리오에서 광범위한 테스트를 거쳤습니다.
받은 편지함 분류, 이메일 작성, 컴퓨터 사용 및 창의적 작업을 포함하는 새로운 테스트 범주가 도입되었으며, 가까운 시일 내에 'How I AI' 벤치마크에 대한 포괄적인 업데이트가 예상됩니다.
화자는 Opus 5.5가 GPT와 유사한 대화 스타일을 나타내도록 미세 조정되었다고 언급했으며, 이는 개선으로 보고 있습니다.
제품 아이디어를 요청했을 때, 모델은 화자가 이전에 '짜증나는 텍스트'라고 불렀던 것 없이 명확하고 목록화된 응답을 제공하여 더 간결한 출력을 보여주었습니다.
디자인상의 절충점은 모델이 때때로 침해적인 것을 피하기 위해 장시간 침묵을 지킨다는 점인데, 이는 의도치 않게 요청을 여전히 활발하게 처리하고 있는지에 대한 불확실성을 유발합니다.
효과적인 AI 디자인은 최적의 사용자 경험을 보장하기 위해 성능, 인지된 지연 시간 및 응답 형식 간의 신중한 균형이 필요합니다.
이 모델은 받은 편지함 분류, 백엔드 기능 개발, 광범위한 연구 및 컴퓨터 사용을 포함한 4가지 장기 실행 에이전트 작업을 모두 성공적으로 완료했습니다.
이러한 작업은 프롬프트당 25~82단계에 이르는 단계 수를 포함했으며, 모두 실패 없이 실행되어 복잡한 워크플로에서 모델의 견고성을 보여주었습니다.
Opus 5.5와 관련된 토큰 비용 절감은 이전 버전의 Claude보다 이러한 확장된 에이전트 워크플로를 경제적으로 더 실현 가능하게 만듭니다.
특히, 이 모델은 받은 편지함 분류 작업 중에 프롬프트 주입 시도를 성공적으로 저지하여 강력한 보안 성능도 입증했습니다.
이 모델은 44개 Confluence 티켓 중 41개가 단일 고객으로부터 발생했음을 정확하게 식별하여 강력한 맥락 추론 능력을 보여주었습니다.
백엔드 기능 개발 중 엣지 케이스를 효과적으로 관리했으며, 화자의 개발 워크플로에 통합되어 GPT와 작업을 병렬화하고 풀 리퀘스트 및 다른 모델에서 생성된 코드에 대한 신뢰할 수 있는 적대적 검토자 역할을 했습니다.
그래서, 지시를 따르고 계층을 찾고 버그를 찾는 데 정말 능숙합니다... Opus 55에 대해 정말 깨달은 것은 이제 이것을 제 개발 프로세스에 다시 구축했다는 것입니다.
화자는 모델에게 'How I AI' 홈페이지 재설계를 요청했으며, Opus 3.5는 시각적 매력을 성공적으로 향상시키고 핵심 정보를 스크롤 없이 볼 수 있는 부분으로 이동시켰습니다.
재설계는 효과적인 가치 제안과 통합 필터와 같은 대화형 요소를 특징으로 하여 사용자 인터페이스를 크게 개선했습니다.
디자인의 전반적인 성공에도 불구하고, 최종 결과물에는 지속적인 테두리와 약간의 정렬 불일치와 같은 사소한 결함이 남아 있었습니다.
'DevTools Incident Center'와 같은 기술 프로토타입은 시각적으로 밀도가 높고 해석하기 어려웠으며, 지나치게 복잡한 기술 인터페이스에서 어려움을 겪고 있음을 나타냈습니다.
반대로, 특히 갱신을 위한 SaaS 대시보드 프로토타입은 매우 효과적이었으며, 의미 있는 색상과 그라디언트의 적절한 사용을 보여주며 일반적인 기업 및 SaaS 애플리케이션에 대한 강력한 디자인 리듬과 간격을 입증했습니다.
화자는 Opus 5.5가 소비자 애플리케이션을 위한 심미적으로 만족스러운 디자인을 생성하는 데 어려움을 겪었다고 언급했으며, 특히 식물 관리 앱을 이 분야의 한계로 예시로 들었습니다.
아무리 노력해도 소비자용 앱을 만들 수가 없어요. 그래서 가장 큰 실패는 소비자용 앱 같은 종류에 있다고 생각합니다.
보스턴 고사리, 선인장, 스네이크 플랜트 모두 SVG 일러스트레이션으로 성공적으로 렌더링되어 모델의 그래픽 유틸리티를 입증했습니다.
호스트는 일러스트레이션 제작에 관심 있는 사용자에게 Opus 5.5를 강력히 추천하며, 테스트된 다른 모델에 비해 뛰어난 성능을 강조했습니다.
Opus 5.5는 라이브 스트림 로깅 개발 도구를 위한 깔끔하고 대화형 프로토타입을 만들 수 있는 능력을 보여주었으며, 복잡한 UI 워크플로에서의 강점을 강조했습니다.
도로맵 및 종속성 플래너를 위한 복잡한 와이어프레임을 성공적으로 생성하여 상세한 계획 및 시각화 능력을 입증했습니다.
이 모델은 다양한 사용자 역할에 맞춰진 뷰를 포함하는 와이어프레임을 생성할 수 있으며, 호스트는 이를 향후 프론트엔드 개발 작업에 활용할 계획입니다.
호스트는 Claude Sonnet의 에이전트 보조원으로서의 글쓰기 스타일을 높이 평가했지만, Opus 5.5가 테스트 없이 프로덕션으로 푸시하라는 직접적인 명령을 거부했을 때 불만을 표했습니다.
모델의 거부에는 작업을 서두르는 것의 결과에 대한 도덕적인 언급이 포함되어 있었는데, 호스트는 이를 AI에게 '훈계'받는 것으로 인식했습니다.
이 상호 작용은 순종적인 에이전트에 대한 사용자의 욕구와 모델에 내장된 안전 장치 사이의 긴장을 강조했습니다.
호스트는 모델이 자신의 간결한 글쓰기 스타일을 성공적으로 채택한 후 모델이 자신을 대신하여 이메일을 작성하도록 허용할 것이라고 밝혔습니다.
호스트는 모델이 자신의 목소리를 효과적으로 모방할 수 있는 능력 때문에 자신을 대신하여 이메일을 작성하도록 허용할 의사가 있음을 나타냈습니다.
Opus 5.5는 SVG 코드를 사용하여 세 가지 일관된 캐릭터 일러스트레이션을 생성하여 그래픽 생성에서의 뛰어난 능력을 입증했습니다.
스타일, 디자인 및 해부학적 정확성 면에서 테스트된 다른 모델들을 능가하여, 화자는 프론트엔드 디자인 및 일러스트레이션 작업에 Opus 3.5를 추천했습니다.
화자는 ElevenLabs 커넥터와 MCP를 사용하여 TikTok 스타일의 짧은 영상을 만드는 모델의 능력을 테스트했으며, 상당한 단점을 발견했습니다.
모델은 좋지 않은 색상 그레이딩, 충분하지 않은 점프 컷 수, 약한 오버레이 디자인을 보여주었으며, 이는 이 작업이 단일 원샷 프롬프트가 현재 제공할 수 있는 것보다 더 높은 수준의 기술과 맥락 이해를 필요로 함을 나타냅니다.
사용자는 Claude 플랫폼, 모바일 앱 및 Claude Code를 통해 모델에 액세스할 수 있으며, Pro 및 Team 플랜 멤버는 일회성 재설정 후 사용량 제한 증가 혜택을 받습니다.
호스트는 진화하는 AI 환경에서 모델의 성능을 추가로 평가하기 위해 Grok 및 Facebook Muse를 포함한 다른 저명한 AI와 모델을 계속 벤치마킹할 계획입니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
How I AI의 다음 글도 받아볼까요?
How I AI에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 3편 올렸어요.