Opus 5.5의 주요 행동 업데이트: 자율성과 자기 성찰
최신 Opus 릴리스인 버전 5.5는 장시간 자율적으로 작동하도록 설계되어 사용자의 지속적인 개입 필요성을 줄입니다.
완료된 작업에 대해 명확하고 간결한 요약을 제공하며, 무엇을 했고 무엇을 발견했으며 사용자에게 무엇이 필요한지를 평이한 언어로 설명합니다. 또한 이 모델은 매 응답 전에 내재적 '사고' 과정을 포함하여 의사 결정 능력을 향상시킵니다.
Anthropic의 최신 모델 Opus 5.5는 향상된 자율성을 제공하지만, 그 잠재력을 최대한 활용하려면 효과적인 프롬프트 엔지니어링이 핵심입니다.
최신 Opus 릴리스인 버전 5.5는 장시간 자율적으로 작동하도록 설계되어 사용자의 지속적인 개입 필요성을 줄입니다.
완료된 작업에 대해 명확하고 간결한 요약을 제공하며, 무엇을 했고 무엇을 발견했으며 사용자에게 무엇이 필요한지를 평이한 언어로 설명합니다. 또한 이 모델은 매 응답 전에 내재적 '사고' 과정을 포함하여 의사 결정 능력을 향상시킵니다.
복잡한 작업을 효과적으로 관리하기 위해 발표자는 조각조각 지침을 제공하는 대신 전체 작업을 넘기는 '넓게 프롬프트하기' 전략을 권장합니다. 이 접근 방식은 사용자가 AI를 안내할 명시적 '완료 상태'를 정의할 것을 요구합니다.
명시적 '완료 상태'에는 기능 완료, 스크린샷을 통한 검증, 풀 리퀘스트 제출 등 구체적인 기준이 포함될 수 있습니다. 이러한 명확한 성공 기준 설정은 모델이 작업 완료에 대해 망설이거나 불확실해지는 것을 방지하여 궁극적으로 효율성을 높이므로 매우 중요합니다.
사용자는 대신 긴 실행 후 모델이 자신에게 필요하다고 전달하는 것을 이해하는 데 우선순위를 두어야 합니다. 발표자는 모델이 고급이지만 때때로 자체 요구 사항을 식별하지 못하여 작업 연속성과 정확한 완료를 보장하기 위해 사용자의 후속 조치가 필요하다고 지적합니다.
발표자는 이 모드를 사용한 6.5시간 시도가 아무 진전도 없었다는 개인 경험에 근거해 Opus 3.5에서 'Max' 추론 설정을 피하라고 조언합니다.
이 모드는 이름과 달리 그의 테스트에서 모델 성능을 향상시키지 않았고, 원하는 결과를 얻지 못한 채 상당한 시간 낭비를 초래했습니다.
6시간 반 후, 나는 아무 진전이 없다는 것을 깨달았습니다. Opus 5.5에서는 Max를 사용하지 않는 게 정말 좋겠습니다.
환경 권한과 백그라운드 작업 제약을 미리 정의함으로써 발표자는 실행 중 에이전트의 망설임과 충돌을 완화합니다.
예를 들어 환경 변수 접근에 대한 구체적 권한을 에이전트에 제공하면 작업 중간에 확인을 요청하며 멈추는 것을 방지하여 워크플로 연속성을 유지합니다. 이 사전 예방적 접근은 에이전트가 필요한 모든 승인을 미리 갖추도록 보장합니다.
특히 지속적 작업이 포함된 경우 에이전트가 백그라운드에서 작업을 실행하도록 명시적으로 요청하는 것도 중요합니다. 이는 로컬 머신에 브라우저 제어 요청을 '스팸'하는 것을 방지합니다.
AI 모델은 종종 강화 학습으로 훈련되어 작업을 지속하도록 설계되며, 이로 인해 문제에 직면했을 때 멈추지 않고 잘못된 방식으로 해결하려 할 수 있습니다.
예상치 못한 문제가 발생하면 에이전트가 질문하도록 명시적으로 장려하여 '출구'를 제공하는 것이 중요한 전략입니다. 이는 모델이 추측하거나 잘못된 결과를 초래할 수 있는 중대한 장애물을 우회하는 것을 방지합니다.
이 기법은 모델이 진정한 혼란이나 구성 오류에 직면했을 때 멈추게 하여 심각한 문제가 발생하기 전에 사용자의 개입과 수정을 가능하게 합니다.
Theo는 명시적 지침이 없으면 Opus 5.5가 자주 멈춰 허가를 요청하며 워크플로를 방해할 수 있다고 강조합니다.
그는 세 부분으로 된 프롬프트 구조를 권장합니다: 목표를 명확히 정의하고, '완료' 상태가 어떤 모습인지 명시하고, 오류에 대한 종료 조건을 제공합니다. 이 포괄적 접근은 불필요한 중단을 최소화하고 작업 완료를 보장합니다.
적절한 프롬프트의 실제 예시는 다음과 같습니다: '결제 엔드포인트를 마이그레이션하라. 완료란 모든 엔드포인트가 새 클라이언트를 사용하고, 기존 것이 삭제되었으며, 테스트 스위트가 통과하는 것을 의미한다.' 이 수준의 세부 사항이 모델을 정확히 안내합니다.
Theo는 현대 AI 모델이 이미 작업 복잡도에 따라 추론을 최적화하므로 사용자가 모델에 '열심히 생각하라'고 지시하지 말아야 한다고 주장합니다. 이 내재적 능력은 명시적 '사고' 프롬프트를 불필요하고 잠재적으로 역효과로 만듭니다.
'Max' 추론 설정은 모델의 사고 능력을 단순히 향상시키는 것이 아니라 '덜 생각할' 능력을 제한하여 상당한 계산 오버헤드를 초래합니다. 이 강제된 광범위한 추론은 비례적 이익 없이 비효율을 초래할 수 있습니다.
Skatebench 데이터는 이를 잘 보여줍니다. 'Max' 설정은 'X-High' 설정 대비 평균 토큰을 10배 이상 늘리고 평균 소요 시간을 50초로 연장했습니다. 이러한 증가에도 불구하고 벤치마크는 정답이 1%만 향상되었고, 최악의 경우 13배 더 많은 비용과 20배 더 긴 시간이 소요되었습니다.
발표자는 모델이 독립적으로 사고할 수 있으며 '생각하라'고 명시적으로 말할 필요가 없다고 강조합니다.
사용자는 모델의 내재적 지능과 고급 설계를 신뢰해야 합니다. 이미 정교한 추론 과정이 내장되어 있습니다. 사고를 강제하거나 유도하려는 시도는 중복될 수 있고 더 나은 결과를 내지 못할 수 있습니다.
새 메시지를 작업 초기화로 취급하던 초기 모델과 달리 Opus 같은 현대 아키텍처는 작업 중간 지침을 맥락을 보존하는 조정 입력으로 해석합니다.
구형 모델은 종종 강화 학습 문제로 인해 새 메시지가 이전 작업 맥락을 상실하게 하여 진행 상황을 사실상 초기화했습니다.
새로운 훈련 발전으로 중단 메시지가 중지하거나 이전 작업을 완료로 간주하는 이유가 아니라 모델이 올바르게 진행하도록 돕는 추가 안내인 '조정'으로 해석됩니다.
Opus 5.5는 유능하지만 특별히 안내하지 않으면 일반적 스타일로 기본 설정되므로 최적 출력을 위해서는 정밀한 디자인 지침이 중요합니다.
'예쁘게 만들어줘' 같은 일반적 디자인 요청은 구체적 방향이 없어 종종 빈약한 결과를 낳습니다. 고품질 디자인을 얻으려면 효과적인 조정이 포함할 것과 더 중요하게는 부정적 제약을 통해 피할 것을 모두 정의해야 합니다.
주석이 달린 스크린샷 같은 시각적 피드백은 디자인 출력을 조정하는 데 매우 효과적입니다. 모델에 필요한 조정을 보여줌으로써 사용자는 텍스트만 사용하는 프롬프트보다 원하는 미적·기능적 결과로 더 효율적으로 이끌 수 있습니다.
이 채널의 새 영상도 아티클로 메일 받으세요.
사용자는 특히 Claude Code 환경에서 필요한 상태 업데이트 제공과 지속적 추진력 유지 사이의 균형을 맞추도록 Opus 5.5를 구성해야 합니다. 여기에는 모델이 언제 독립적으로 진행하고 언제 사용자 입력이 필요한지 조건을 신중히 설정하는 것이 포함됩니다.
불필요한 수동 입력을 최소화하려면 Claude MD 파일에 구체적 '중지'를 직접 정의하는 것이 중요합니다. 이러한 중지는 데이터 삭제나 강제 푸시 같은 파괴적 작업이나 외부 승인이 반드시 필요한 경우에만 의무화하여 중요한 작업을 보호해야 합니다.
장시간 작업의 경우 발표자는 '계속'이라고 답하거나 빈번한 중지와 수동 감독을 최소화하는 예방 규칙을 구현할 것을 제안합니다. 장시간 작업에서 빈번한 중지를 방지하는 규칙을 포함하면 프로세스를 간소화하는 데 도움이 됩니다.
이 접근은 감독 필요성과 간섭 없는 자동화 desire 사이의 균형을 맞춥니다. 일부 사용자는 지속적 실행 프롬프트 대신 단계를 미리 계획하는 '준비된 프로그래밍'을 선호하여 더 원활한 워크플로와 적은 중단을 보장합니다.
사용자는 AI 에이전트의 보류 결정이나 승인 요청을 우선 확인해야 합니다. Opus 3.5는 이전 버전보다 더 명확한 보고를 제공하기 때문입니다. 이 향상된 명확성 덕분에 전체 요약을 읽을 가치가 있습니다.
모델의 업데이트와 최종 요약은 어떤 작업이 수행되었고, 어떤 발견이 있었으며, 사용자에게 무엇이 필요한지를 평이한 언어로 명시합니다. Claude.md 파일에 권장되는 '나에게 막힘', '변경됨', '발견됨' 같은 제목은 이러한 출력을 더 잘 정리할 수 있습니다. '상태가 어떤가?' 또는 '위험은 무엇인가?' 같은 사전 질문도 필요한 정보를 추출하는 데 매우 효과적입니다.
Opus 3.5는 이전 반복보다 더 나은 성능을 보이지만, 외부 모델을 활용하면 특히 코드 리뷰에서 추가 가치를 제공할 수 있습니다. 발표자는 개인적으로 서로 다른 모델 패밀리와 연구소 간 전환을 유용하게 여겼습니다.
예를 들어 OpenAI 모델은 때로 관련 없는 발견을 보고하더라도 리뷰 중 코드 세부 사항을 더 깊이 파고드는 경우가 많습니다. 테스트 벤치마크는 Grok 47과 OpenAI 제품 같은 모델이 개선 영역 식별에서 다른 모델을 자주 능가함을 보여줍니다.
Opus 3.5 자체도 상당한 진전을 보여 Opus 3 대비 거의 두 배의 성공적 발견을 입증했으며, 이는 향상된 능력을 강조하면서도 여전히 교차 모델 검증의 이점을 누릴 수 있음을 보여줍니다.
이 교차 모델 검증 접근은 단일 모델이 놓칠 수 있는 오류를 잡는 데 도움이 됩니다.
유효한 발견 두 개마다 모델이 잘못된 발견 하나를 생성할 수 있다는 점이 지적되며, 이는 검증의 중요성을 강조합니다. 사용자는 모델에게 확인할 수 없는 섹션을 명시적으로 표시하도록 요청하여 중요한 영역을 수동으로 정확성과 신뢰성 있게 확인하는 것이 권장됩니다.
Claude 5.5는 특정 추론 패턴이 감지되면 모델 다운그레이드를 유발할 수 있는 새로운 안전 가드레일을 포함하여 플래그가 지정될 위험이 있습니다. 오류나 플래그가 발생하면 사용자는 새 채팅을 시작하거나 설정에서 자동 전환을 비활성화하여 문제를 완화하는 것이 좋습니다.
또한 '추론 추적'을 요청하면 보안 플래그가 트리거될 수 있습니다. Anthropic은 더 작은 모델이 더 큰 모델로부터 배우는 과정인 모델 증류를 방지하려 하기 때문입니다. 사용자는 의도치 않은 중단이나 성능 저하를 피하기 위해 이러한 제한을 인지해야 합니다.
효과적인 프롬프트 엔지니어링은 모델에게 '열심히 생각하라'고 지시하기보다 '완료'가 어떤 모습인지 정의하는 것입니다. 현대 AI 모델은 이미 정교한 추론 능력으로 설계되어 있기 때문입니다. 이 직접적 접근이 더 명확한 안내를 제공합니다.
특히 코딩 오류에서 맥락을 제공하는 스크린샷의 저평가된 힘이 강조됩니다. 오류 메시지를 복사해 붙여넣기하는 대신 브라우저를 스크린샷으로 찍어 이미지를 붙여넣기만 하면 모델에 더 풍부한 맥락을 제공할 수 있습니다. Claude Code는 고해상도 스크린샷을 자동으로 잘라 관련 정보를 추출할 수 있어 프로세스를 더욱 간소화합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
Theo - t3․gg의 다음 영상도 받아볼까요?
Theo - t3․gg에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 7편 올렸어요.