AI 엔지니어링에 대한 현장 CTO의 관점
원본 영상 0:13Braintrust의 현장 CTO인 Ameya Bhatawdekar는 자신과 회사를 소개했습니다. Braintrust는 AI 팀을 위해 특별히 설계된 평가 및 관찰 플랫폼으로, AI 엔지니어링의 복잡성을 해결하는 것을 목표로 합니다.
Braintrust의 현장 CTO인 Ameya Bhatawdekar는 AI 모델의 급속한 발전이 평가 전략 및 시스템 아키텍처의 전면적인 재정비를 어떻게 필요하게 만드는지 설명합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
Braintrust의 현장 CTO인 Ameya Bhatawdekar는 자신과 회사를 소개했습니다. Braintrust는 AI 팀을 위해 특별히 설계된 평가 및 관찰 플랫폼으로, AI 엔지니어링의 복잡성을 해결하는 것을 목표로 합니다.
Bhatawdekar는 AI 데모를 만드는 것은 간단하지만, 이를 생산 품질로 확장하는 것은 상당한 도전 과제라고 언급했습니다. 이러한 어려움은 AI 모델의 빠른 진화, 변화하는 사용자 행동, 끊임없이 변하는 데이터 환경으로 인해 빈번한 조정 및 업데이트가 필요하다는 점에서 비롯됩니다.
그는 이러한 빠른 속도 때문에 생산 준비된 AI 애플리케이션을 유지하는 것이 지속적인 노력이 필요하다고 지적했습니다.
AI 모델은 향상된 도구 사용, 확장된 컨텍스트 창, 보안 코드 실행과 같은 새로운 기능을 통합하며 빠르게 발전하고 있습니다. Bhatawdekar는 이러한 발전이 점진적인 개선이 아니라 모델이 달성할 수 있는 것을 근본적으로 변화시키는 '계단식 변화'라고 강조했습니다.
결과적으로, 전통적인 반복 개발 방법론은 더 이상 충분하지 않으며, 이러한 중요한 모델 변화는 새로운 기능을 효과적으로 활용하기 위해 AI 시스템의 체계적인 재플랫폼화를 필요로 합니다.
이전 AI 시스템은 오래된 모델 기능의 한계와 제약에 대한 특정 가정하에 설계되고 구축되었습니다. 고급 기능을 갖춘 새로운 모델이 등장함에 따라 이러한 기존 아키텍처는 종종 제약이 되어 개발자가 새로운 잠재력을 완전히 활용하는 것을 방해합니다.
개선된 도구 호출과 같은 기능을 제대로 통합하고 이점을 얻기 위해 개발자는 단순히 구성 요소를 업데이트하는 대신 전체 시스템을 재설계해야 하는 경우가 많습니다.
새로운 모델 기능의 도입은 AI 시스템 내에서 새로운 실패 가능성 영역을 필연적으로 생성합니다. 따라서 평가 전략은 아키텍처 변경과 동시에 진화해야 하며, 아키텍처 자체는 기본 모델 업데이트에 의해 구동됩니다.
이러한 역동성은 평가가 정적으로 유지될 수 없음을 의미합니다. 각 아키텍처 변화로 인해 도입되는 새로운 복잡성과 잠재적 취약성에 적응해야 합니다.
아키텍처 진화를 설명하기 위해 SRE(사이트 신뢰성 엔지니어링) 에이전트가 실용적인 예시로 소개되었습니다. 이 에이전트는 정보를 읽을 뿐만 아니라 배포 롤백 또는 문제 에스컬레이션과 같은 작업을 수행하고 시스템을 업데이트할 수 있습니다.
읽기 및 쓰기 도구를 모두 갖춘 이 SRE 에이전트는 AI 아키텍처가 새로운 기능에 어떻게 적응해야 하는지 분석하고 시연하는 데 유용한 모델 역할을 합니다.
약 3년 전, 상당수의 AI 애플리케이션은 단일 프롬프트가 단일 모델 호출로 이어지는 매우 간단한 아키텍처로 시작했습니다. 이 기초적인 설정은 단일의 명확한 입력이 모델로 직접 들어가 단일 출력을 생성하는 가장 간단한 접근 방식을 나타냅니다.
이 초기 세대의 AI 시스템은 사용자 쿼리 또는 지시가 단일 프롬프트 내에 캡슐화되어 모델이 복잡한 중간 단계나 다중 모델 오케스트레이션 없이 해당 응답을 생성하도록 처리하는 직접적인 상호 작용을 중심으로 설계되었습니다.
기본 작업에는 효과적이었지만, 이 간단한 아키텍처는 정교한 추론이나 다중 도구 통합보다는 직접적인 입력-출력 관계에 초점을 맞춘 AI 애플리케이션 개발의 초기 단계를 보여주었습니다.
AI 시스템이 특정 사용 사례에 맞게 더 복잡한 그래프 기반 아키텍처를 통합하도록 진화함에 따라 새로운 실패 지점이 나타났습니다. 이러한 시스템 복잡성 증가는 전반적인 오케스트레이션을 넘어선 평가 범위의 변화를 필요로 했습니다.
이제 평가는 개별 노드의 성능 추적, 재시도 루프 모니터링, 복잡한 오케스트레이션 동작 관찰을 포함하여 포괄적인 시스템 신뢰성을 보장해야 합니다.
2025년 후반에는 도구 호출 및 계획 기능의 상당한 개선으로 인해 많은 정적 그래프 기반 AI 시스템이 취약하고 비효율적이 되었습니다. 이러한 경직된 아키텍처는 종종 새롭고 더 고급 모델 기능을 완전히 활용할 수 없었습니다.
모델이 실행 중 자기 성찰 및 자체 수정 기능을 얻으면서 미리 정의된 유연하지 않은 그래프 구조의 제약을 뛰어넘기 시작했습니다.
ReAct 스타일 루프의 부활로 AI 모델은 실행 경로의 높은 분산에도 불구하고 사용자 의도를 자율적으로 안정적으로 달성할 수 있게 되었습니다. 높은 분산은 동일한 입력이 다른 처리 궤적으로 이어질 수 있음을 의미하며, 이는 새로운 평가 접근 방식을 필요로 합니다.
단일 평가 결과에 초점을 맞추는 대신, 평가 단위는 평가의 통계적 분포를 분석하는 것으로 바뀌었습니다. 이를 통해 다양하고 예측 불가능한 시나리오에서 에이전트의 성능을 보다 강력하게 이해할 수 있습니다.
높은 분산 및 에이전트 시스템의 문제를 해결하기 위해 pass@k 및 pass-wedge-k와 같은 새로운 지표가 필수적이 되었습니다. Pass@k는 동일한 평가로 k번 시도했을 때 작업이 최소 한 번 성공하는지 여부를 결정하여 시스템의 역량을 측정합니다.
반대로, pass-wedge-k는 k번의 평가 인스턴스에서 일관된 성공률을 계산하여 신뢰성을 평가합니다. 이러한 지표는 AI 시스템 성능에 대한 보다 포괄적인 시각을 제공하여 잠재력과 일관성 사이의 균형을 맞춥니다.
AI 시스템은 루프에서 실행되는 단순한 모델에서 포괄적인 제품 시스템으로 전환되는 중요한 아키텍처 변화를 겪고 있습니다. 최신 AI 애플리케이션은 세션 간 컨텍스트를 유지하기 위한 영구 메모리 시스템을 통합하여 사용자 경험과 연속성을 향상시킵니다.
또한, 이러한 시스템은 모델 생성 코드의 안정적인 실행을 가능하게 하는 강력한 샌드박스를 통합하여 기능과 상호 작용 기능을 안전하게 확장합니다. 기술 디렉토리 및 상징적 지시어의 포함은 모델 기능을 확장하고 모델이 특정 도구 또는 지식을 효율적으로 액세스하고 활용할 수 있는 구조화된 방법을 제공합니다.
이전 세대의 AI 평가 방법을 계속 사용하는 것은 필연적으로 현대의 복잡한 시스템에 대한 부분적인 평가만 초래할 것입니다. 새로운 아키텍처는 이전 지표 및 테스트 접근 방식으로는 효과적으로 포착할 수 없는 완전히 새로운 취약점 표면을 도입합니다.
이러한 평가 범위 격차는 정교한 AI 시스템의 중요한 취약점이나 성능 문제가 간과되어 신뢰할 수 없거나 성능이 저하된 배포로 이어질 수 있음을 의미합니다. 포괄적인 유효성 검사를 보장하려면 평가 전략이 현대 AI 아키텍처의 증가하는 복잡성과 진화하는 기능에 지속적으로 적응해야 합니다.
아키텍처 발전과 보조를 맞춰 평가 방법론을 업데이트하지 못하면 시스템이 예상치 못한 실패에 취약해지고 개발자가 AI 제품을 완전히 이해하고 최적화하는 것을 방해합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 24편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.
KV Cache-Aware Routing and P/D Disaggregation on KubernetesAI Engineer1시간 전 게시 · 21:47 · 조회 93 · 1시간 전 생성
The Death of Developer Advocates: How AI Agents Are Reshaping DevRelAI Engineer22시간 전 게시 · 18:16 · 조회 88 · 22시간 전 생성
Cloudflare Leverages AI Agents to Double GTM Team EfficiencyAI Engineer22시간 전 게시 · 19:15 · 조회 12 · 22시간 전 생성