에이전트의 세 가지 핵심 구성 요소: 하네스, 모델, 컨텍스트
Jump to 0:11해리슨 체이스는 인텔리전스에 대해 이야기할 때 보통 에이전트에 대해 논하며, LangChain에서는 에이전트가 세 가지 주요 부분으로 구성된다고 설명했다. 이 세 가지는 모델과 컨텍스트를 조율하는 하네스를 포함한다. 그는 진정한 인텔리전스를 소유하고 싶다면 이 세 가지 부분을 모두 소유해야 한다고 강조했다.
LangChain의 해리슨 체이스 CEO는 에이전트의 핵심 요소와 맞춤형 하네스 구축 기준을 제시하며, 모델, 컨텍스트, 하네스 설계 및 평가의 중요성을 강조했다.
Want the next one from this channel too?
해리슨 체이스는 인텔리전스에 대해 이야기할 때 보통 에이전트에 대해 논하며, LangChain에서는 에이전트가 세 가지 주요 부분으로 구성된다고 설명했다. 이 세 가지는 모델과 컨텍스트를 조율하는 하네스를 포함한다. 그는 진정한 인텔리전스를 소유하고 싶다면 이 세 가지 부분을 모두 소유해야 한다고 강조했다.
모델 소유의 중요한 부분은 모델을 필요에 따라 전환할 수 있는 유연성이다. 해리슨 체이스는 과거 클라우드에 구애받지 않고 클라우드를 전환할 수 있었던 개념과 같이, 모델에서도 종속성을 피하고 가장 효율적인 모델을 사용할 수 있도록 전환 가능성이 중요하다고 설명했다. 그는 이를 통해 특정 모델에 대한 의존도를 낮추고 최적의 성능을 확보할 수 있다고 덧붙였다.
에이전트는 작업을 수행하기 위해 다양한 행동을 취해야 한다. 특히 외부 시스템과의 상호 작용이 필수적이며, 이 과정에서 더 많은 컨텍스트가 생성된다. 해리슨 체이스는 이 생성된 컨텍스트가 에이전트 루프에 다시 공급될 수 있다고 설명했다. 그는 하네스가 이 모든 과정을 함께 조율하는 역할을 한다고 강조했다.
대부분의 에이전트는 루프에서 실행되는 LLM(거대 언어 모델)이 도구를 호출하는 간단한 아키텍처를 따른다. 해리슨 체이스는 어떤 요청이 들어오면 LLM이 생성을 수행하고, 이 생성에 도구 호출이 포함될 수 있다고 설명했다. 만약 도구 호출이 있다면, 해당 도구를 호출하고 그 결과를 LLM으로 다시 전달하는 방식이다. 그는 이것이 오늘날 거의 모든 에이전트의 핵심 아키텍처라고 강조했다.
기본적인 핵심 루프 외에도 특정 하네스에서 다양한 단계에서 많은 작업을 수행할 수 있다. 해리슨 체이스는 LangChain이 매우 기본적인 하네스인 반면, Deep Agents는 Claude 코드의 모델에 구애받지 않는 더 범용적인 버전이라고 설명했다. Deep Agents는 파일 시스템 연결, 기술 보유, 서브 에이전트 포함 등 더 많은 기능을 수행하며, 이는 기본적인 하네스 위에 구축되었지만 레버를 사용하여 맞춤 설정된 방식이다. 그는 에이전트가 호출되기 전이나 각 모델 호출 전에 특정 코드 스니펫을 실행하거나, 모델 호출 및 도구 호출을 래핑하는 방식으로 이 핵심 단순 루프를 '미들웨어 구성'이라는 개념을 통해 강력하게 맞춤 설정할 수 있다고 말했다.
미들웨어 개념을 통해 핵심 루프를 수정하여 에이전트의 다양한 기능들을 사용자 정의하고 확장할 수 있다. 해리슨 체이스는 에이전트가 여전히 루프에서 실행되고 동일한 단순 아키텍처를 따르지만, 이 방법을 통해 샌드박스, 파일 시스템, 서브 에이전트, 메모리에 접근할 수 있다고 설명했다. 또한, 컨텍스트가 너무 길면 모델 호출 이전에 요약하는 기능을 추가할 수 있으며, 컨텍스트 오프로딩과 같이 큰 도구 호출을 처리하는 방식도 미들웨어 개념을 통해 핵심 루프에 추가할 수 있다고 덧붙였다.
에이전트가 실행되는 하네스를 커스터마이징하는 또 다른 방법은 더 명시적인 인지 아키텍처를 사용하는 것이다. 해리슨 체이스는 2023년과 2024년에 많은 사람들이 이 방식으로 에이전트를 구축했다고 설명했다. 당시에는 모델이 루프에서 실행될 만큼 충분히 좋지 않았기 때문에, 특정 작업을 수행하게 하려면 매우 맞춤화된 인지 아키텍처가 필요했다는 것이다.
자체 하네스를 구축할지, 아니면 기성 하네스를 사용할지에 대한 질문은 업계의 큰 미해결 과제 중 하나이다. 해리슨 체이스는 Claude Code나 Claude Agent SDK(Anthropic 모델용), Codex(OpenAI 모델용)처럼 많은 기성 하네스가 특정 모델과 함께 작동한다고 언급했다. 그의 대답은 일반적으로 모델이 훈련된 데이터 분포에 가까울수록 기성 하네스가 더 좋을 것이라는 것이다. 그러나 분포에서 점점 멀어지기 시작하면 하네스를 어떤 식으로든 조정하고 싶을 것이라고 조언했다.
Deep Agents는 커스터마이징 가능한 하네스로서 '모델 프로필'이라는 개념을 사용한다. 해리슨 체이스는 파일 편집과 같이 모델의 분포 내에 있는 작업의 경우, 사용되는 모델에 따라 다른 파일 편집 구현 사이를 전환한다고 설명했다. 그는 이러한 방식이 작업이 분포 외에 있을 때는 전체 하네스를 커스터마이징하지만, 모델 레이어에 가능한 한 가까이 분포 내의 작은 부분들을 유지하는 예시라고 보았다.
해리슨 체이스는 평가와 관찰 가능성이 에이전트 시스템에서 매우 중요하다고 강조했다. 그는 모델, 하네스, 컨텍스트 등 에이전트의 모든 부분을 실험할 때, 시스템 내부에서 무슨 일이 일어나는지 파악하고 이를 평가할 수 있기를 원할 것이라고 설명했다. 이러한 도구들은 사용자 정의 하네스뿐만 아니라 사용자 정의 모델에도 유용하게 사용될 수 있다고 덧붙였다.
에이전트 벤치마크는 시스템의 성능 회귀를 정의하고 포착하는 데 사용될 수 있다. 해리슨 체이스는 이러한 벤치마크를 통해 하네스를 조정하거나 모델을 조정함으로써 '힐 클라이밍(hill climbing)' 방식으로 성능을 개선할 수 있다고 설명했다. 이는 에이전트의 지속적인 발전을 위한 핵심적인 접근 방식이다.
Harbor는 에이전트 실행을 검증하는 테스트 스크립트를 제공한다. 해리슨 체이스는 이 테스트 스크립트가 코드 실행, 단위 테스트 실행, 다른 LLM을 심사관으로 활용, 심지어 에이전트를 심사관으로 실행하는 등 다양한 작업을 수행할 수 있다고 설명했다. 이는 기본적으로 테스트에서 에이전트의 점수가 어떻게 매겨지는지를 정의한다. 그는 instruction.md가 에이전트에게 주어지는 프롬프트이며, Harbor의 핵심은 샌드박스에서 실행될 수 있도록 묶인 작업들을 정의하고 에이전트에 대해 많은 작업을 실행한 다음, 모델과 하네스로 구성된 에이전트의 수행 능력을 점수 매기는 것이라고 덧붙였다.
Harbor를 통해 얻은 결과는 LangSmith와 통합되어 에이전트 성능을 비교하고 추적하는 데 사용된다. 해리슨 체이스는 LangSmith가 평가 및 관찰 가능성을 위해 구축된 플랫폼으로, 다양한 실험 결과를 시각적으로 확인할 수 있다고 설명했다. 그는 Harbor와의 통합을 통해 피드백 점수(이 경우 단일 보상 함수)뿐만 아니라 지연 시간과 토큰 사용량도 추적할 수 있다고 언급했다. 이는 에이전트를 벤치마킹할 때 정확도 외에 지연 시간과 비용까지 고려해야 하므로, 이 모든 요소를 추적하는 것이 중요하기 때문이라고 강조했다.
LangSmith는 에이전트의 관찰 가능성을 위한 사용자 친화적인 시각화 도구를 제공한다. 해리슨 체이스는 이는 클로드 코드와 유사하게 에이전트 경로를 나타내며, 일부 도구 호출을 숨겨 훑어보기 쉽게 만든다고 설명했다. 그는 요즘 대부분의 에이전트 경로는 '궤적' 형태로 제공되는데, 이는 기본적으로 클로드 코드가 실행되는 메시지 목록으로 생각할 수 있다고 언급했다. 즉, 사용자 메시지를 입력하면 여러 도구 호출을 거쳐 응답하는 메시지 궤적이 에이전트의 핵심 부분이 되어가고 있다는 것이다. 그러나 그는 이러한 궤적만으로는 완벽한 디버깅이 어렵기 때문에, LangSmith는 전체 추적 기능을 제공하여 특정 항목을 클릭하면 모델 내부에서 정확히 무슨 일이 일어나는지 볼 수 있게 한다고 강조했다. 이러한 종류의 관찰 가능성은 에이전트 시스템에서 발생하는 일을 이해하는 데 매우 중요하다고 덧붙였다.
에이전트를 지속적으로 개선하는 기본 과정은 비교적 간단해 보인다. 해리슨 체이스는 에이전트를 만들고 실행한 다음, 많은 추적(trace) 데이터를 수집하고 이를 큐레이션하며, 큐레이션된 데이터로 실험을 실행하는 단계를 설명했다. 그러나 그는 이 과정이 겉보기와 달리 그 이면에는 많은 복잡성이 숨어 있다고 지적했다.
해리슨 체이스는 LangSmith Engine을 소개하며, 이 엔진이 추적 데이터를 기반으로 에이전트를 자동으로 개선하는 역할을 한다고 설명했다. 이 엔진은 기본적으로 추적 데이터 위에 작동하는 에이전트이며, 추적을 큐레이션하고 실험을 실행하여 에이전트의 세 가지 핵심 요소(하네스, 모델, 컨텍스트) 중 하나에 대한 수정 사항을 제안한다. 그는 LangSmith Engine이 주로 하네스 엔지니어링에 중점을 둔다고 밝혔다.
그는 LangSmith Engine의 작동 방식을 더 자세히 설명하며, 이 엔진이 다양한 종류의 실험을 수행한다고 언급했다. 예를 들어, 프롬프트를 변경하거나, 도구 설명을 변경하거나, 모델을 전환하는 등의 실험을 자동으로 실행할 수 있다. 그는 이 엔진이 이러한 변경 사항이 에이전트 성능에 미치는 영향을 평가하고, 어떤 변경 사항이 가장 효과적인지 식별하는 데 도움을 준다고 강조했다. 궁극적으로 이 엔진의 목표는 에이전트 개발자가 수동으로 수행해야 했던 반복적인 개선 작업을 자동화하여 효율성을 높이는 것이다.
해리슨 체이스는 LangSmith Engine이 수집된 추적 데이터에서 패턴을 식별하고, 잠재적인 개선 지점을 찾아내어 자동화된 실험을 통해 검증하는 과정을 거친다고 설명했다. 예를 들어, 특정 유형의 작업에서 에이전트가 자주 실패하거나 비효율적인 경로를 따르는 경우, 엔진이 이를 감지하고 해당 부분에 대한 하네스 또는 모델 변경을 제안할 수 있다. 이러한 제안은 실제 데이터 기반으로 이루어지므로, 개선의 신뢰성이 높다는 장점이 있다.
마지막으로 그는 LangSmith Engine이 에이전트 개발 프로세스를 더욱 민첩하고 데이터 중심으로 만들 수 있다고 강조했다. 개발자는 엔진이 제공하는 보고서와 권장 사항을 바탕으로 에이전트를 신속하게 반복하고 최적화할 수 있으며, 이는 특히 복잡하고 빠르게 변화하는 에이전트 환경에서 경쟁력을 유지하는 데 필수적이라고 덧붙였다.
LangSmith Engine은 자체적으로 개발한 엔진 에이전트를 통해 슬랙과 연동되어 자신에 대한 보고서를 자동으로 전송한다. 해리슨 체이스는 이 방식을 통해 LangChain 팀이 직접 엔진을 사용하고 테스트하여 그 성능과 효율성을 검증한다고 설명했다.
해리슨 체이스는 하네스가 미래에 하나의 형태로 수렴될지, 아니면 모든 회사가 자신에게 최적화된 방식으로 다양하게 운영될지에 대한 질문에 답했다. 그는 하네스 기술 발전 방향에 대한 흥미로운 논점을 제시하며, 이는 에이전트 개발 커뮤니티에서 중요한 화두임을 시사했다.
해리슨 체이스는 작업의 데이터 분포에서 벗어날수록 하네스를 더 많이 커스터마이징하고 싶어 할 것이라고 강조했다. 이는 예측 가능성과 제어를 위해서도 중요하며, 특히 금융 서비스 분야와 같이 높은 예측 가능성을 요구하는 고객들에게는 필수적이라고 설명했다. 그는 Deep Agents와 같은 범용 에이전트가 일부 고객에게는 너무 '무서운' 방식으로 느껴질 수 있으며, 이들은 더 통제 가능한 맞춤형 인지 아키텍처를 선호한다고 덧붙였다.
이러한 맞춤형 하네스는 특정 도메인이나 작업 환경에 특화된 로직과 규칙을 내재하여, 에이전트의 행동을 더욱 세밀하게 제어할 수 있게 한다. 이는 일반적인 LLM 기반의 에이전트가 보여줄 수 있는 예측 불가능성을 줄이고, 기업의 규정 준수 및 보안 요구사항을 충족시키는 데 중요한 역할을 한다. 따라서 에이전트가 복잡하거나 민감한 환경에서 작동해야 할 때, 자체 하네스 구축의 가치가 더욱 커진다고 볼 수 있다.
결론적으로, 작업의 특성이 일반적인 모델의 학습 분포에서 크게 벗어나거나, 높은 수준의 제어 및 예측 가능성이 요구되는 경우, 기업은 기성 하네스 대신 자체 맞춤형 하네스를 구축하는 것을 고려해야 한다. 이러한 접근 방식은 특정 비즈니스 요구사항에 완벽하게 부합하는 에이전트 시스템을 구현하는 데 필수적이다.
모델 랩들은 모두 코딩에 능숙해지는 방향으로 수렴할 것이며, 하네스 또한 그 길을 계속 간다면 코딩에 매우 능숙해지는 방향으로 수렴할 것이라고 해리슨 체이스는 전망했다. 그러나 그는 동시에 아주 작은 차이점들이 존재할 것이라고 덧붙였다. 예를 들어, OpenAI와 Anthropic은 파일을 편집하는 방식이 꽤 다르며, 이러한 차이점은 현재는 작은 부분에서 가장 구체적으로 나타난다고 설명했다. 그는 만약 한 랩이 생명공학 분야에 특화된다면 그 하네스는 바이오 에이전트 작업에 매우 능숙해질 것이고, 그렇게 되면 하네스 자체는 서로 달라지기 시작할 것이라고 예측했다.
Answers come from the transcript, with the exact spot cited.
Want the next one from this channel too?
When Tech Bridge publishes, we'll write it up like the one you just read and email it to you.
{channel} published 21 in the last 7 days.
We skip Shorts. You can unfollow any time.
Anthropic Unveils Claude's Unified Memory 2.0Tech Bridge7 hours ago · 10:04 · 30 views · Created 7 hours ago
Bill Gates Warns of AI's Unprepared EraTech Bridge9 hours ago · 1:51 · 24 views · Created 9 hours ago
Claude's Memory Feature: More Harm Than Help?Tech Bridge13 hours ago · 38:08 · 33 views · Created 13 hours ago