터미널에서 소프트웨어 팩토리 플랫폼으로 진화한 Warp
Suraj Gupta는 최신 터미널을 중심으로 하는 에이전트 개발 환경으로 시작한 Warp에서 하네스 개발을 이끌고 있습니다.
Warp는 이제 포괄적인 클라우드 에이전트 플랫폼 구축으로 초점을 확장하여 고급 소프트웨어 팩토리의 생성 및 운영을 용이하게 하는 것을 목표로 합니다.
Suraj Gupta는 Warp의 오픈소스 플랫폼이 발전하는 팩토리 아키텍처를 통해 AI 에이전트 성능, 비용 효율성 및 사용자 제어를 어떻게 향상시키는지 상세히 설명합니다.
Suraj Gupta는 최신 터미널을 중심으로 하는 에이전트 개발 환경으로 시작한 Warp에서 하네스 개발을 이끌고 있습니다.
Warp는 이제 포괄적인 클라우드 에이전트 플랫폼 구축으로 초점을 확장하여 고급 소프트웨어 팩토리의 생성 및 운영을 용이하게 하는 것을 목표로 합니다.
엔지니어링 팀은 제품 구축에서 이슈 분류부터 프로덕션 배포까지 프로세스를 관리하는 종단 간 팩토리를 구축하고 유지 관리하는 것으로 전환하고 있습니다.
핵심 과제는 이러한 팩토리가 시간이 지남에 따라 자율적으로 개선되어 더욱 효율적이고 빨라지도록 하는 것이며, 이는 엔지니어의 역할을 제품 구축자에서 팩토리 설계자 및 유지 관리자로 재정의합니다.
스킬은 에이전트의 절차적 기억 역할을 하지만, 운영 환경이 변함에 따라 악화될 수 있으므로 지속적인 개선이 필요합니다.
'내부 루프 에이전트'는 주로 이슈 분류와 같은 특정 작업을 실행하는 역할을 합니다.
'외부 루프 에이전트'는 내부 루프 에이전트의 성능을 관찰하고, 실수를 분석하며, 인간 피드백을 통합하여 스킬을 지속적으로 개선하여 관련성과 최신성을 유지하도록 합니다.
Warp는 자체 클라이언트 저장소를 관리하기 위해 내부 팩토리를 활용하며, 이 팩토리는 오픈소스화되었습니다.
이 팩토리에는 새로운 GitHub 이슈를 자동으로 처리하고, 누락된 정보나 잠재적 중복을 식별하며, 각 새 제출에 의해 트리거되는 반복 가능한 워크플로를 생성하는 분류 에이전트가 포함되어 있습니다.
이 피드백은 내부 루프 스킬의 효과를 향상시키기 위해 주기적으로 업데이트되도록 합성됩니다.
모든 업데이트는 에이전트 성능 저하를 방지하기 위해 인간 검토가 필수적인 단계로 Git 풀 리퀘스트를 통해 면밀히 추적되어 완전한 관찰 가능성과 책임성을 보장합니다.
에이전트는 이전에 처리했던 이슈에 대한 컨텍스트를 다시 수집하느라 불필요한 토큰을 자주 소모합니다.
이를 해결하기 위해 영구 메모리는 개별 에이전트에 특화된 사실 저장소 역할을 하여 중요한 정보를 보존합니다.
스킬 개선과 유사하게, 외부 루프 에이전트는 내부 루프 에이전트의 작업에서 학습 및 결과를 추출하여 이 메모리 저장소를 채우며, 인간은 정확한 제어를 위해 이 메모리를 버전 관리, 편집 또는 삭제할 수 있고, 에이전트는 검증을 위해 특정 메모리를 원래 실행으로 다시 추적할 수 있습니다.
Sentry 에이전트는 새로운 이슈를 분류할 때 저장된 메모리 저장소를 효과적으로 사용합니다.
의사 결정 과정에서 어떤 특정 메모리에 액세스하고 활용했는지 명시적으로 보고하여 투명성을 보장하고 에이전트가 분석 중에 지역 최적점에 갇히는 것을 방지합니다.
Warp Zone 및 독점 시스템은 자동으로 지식을 생성하면서도 사용자가 저장된 데이터를 검토, 편집, 버전 관리 또는 삭제할 수 있는 완전한 제어권을 유지하여 추적성을 보장하는 영구 메모리의 이점을 얻습니다.
메모리는 사용자에게 자동으로 생성되며, 사용자는 이러한 저장된 메모리를 검토, 편집, 버전 관리 또는 삭제할 수 있는 완전한 제어권을 유지하여 완전한 추적성 및 감독을 보장합니다.
Opus와 같은 복잡한 모델을 간단한 분류 또는 CI 작업에 사용하면 높은 비용이 발생하므로, Warp는 파레토 효율성을 최적화하기 위해 '자동 모델'과 사용자 지정 구성 파일을 제공합니다.
Warp는 파레토 효율성을 평가하는 '자동 모델'을 제공하여 사용자가 특정 작업에 가장 최적의 모델을 선택하도록 안내하고, 사용자가 구성 파일을 통해 사용자 지정 라우팅 규칙을 정의하여 특정 작업을 적절한 모델에 할당할 수 있도록 합니다.
예를 들어, 데이터베이스 마이그레이션은 GLM으로 라우팅되고 문서 작업은 Quen으로 라우팅되어 비용 효율적이고 효율적인 자원 할당을 보장합니다.
현재 규칙 기반 라우팅은 과학이라기보다는 예술에 가깝지만, Warp는 사용자가 특정 기준과 구성을 정의할 수 있도록 고객 대면 평가를 개발하고 있습니다.
이는 내부 'best-at-k' 테스트를 통해 효율적인 작업-모델 페어링이 확인된 후 제품에 통합된 통찰력을 바탕으로 특정 사용자 정의 워크플로에 가장 적합한 모델에 기반한 자동 모델 라우팅을 가능하게 할 것입니다.
Warp는 일반적인 온라인 벤치마크를 넘어 사용자가 고유한 소프트웨어 문제와 관련된 지표를 정확하게 정의할 수 있도록 고객 대면 평가 프레임워크를 적극적으로 개발하고 있습니다.
이 시스템은 Haiku, GLM, Opus와 같은 다양한 AI 모델 간의 직접적인 비교를 용이하게 하여 맞춤형 구성 매개변수 및 특정 워크플로를 기반으로 성능을 분석합니다.
내부 테스트 결과 GLM이 UI 관련 작업에 매우 효과적이며 Opus를 사용하는 것보다 더 높은 효율성을 보여주었고, 팀은 이 정교한 라우팅 기능을 Warp 제품에 직접 통합하여 더 많은 고객이 활용할 수 있도록 할 계획입니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 35편 올렸어요.