Weights & Biases, 자체 강화 AI 에이전트 ARIA 출시
Aysola의 발표는 에이전트가 자체 강화하고 스스로 연구를 수행할 수 있게 하는 평가 프레임워크에 중점을 두었습니다.
그는 강력한 테스트에 필요한 도구 호출 및 벤치마크의 고유한 변동성으로 인해 에이전트 하네스를 구축하는 데 따르는 중요한 과제를 강조했습니다.
ARIA 에이전트는 프로덕션 데이터를 평가 작업으로 전환하여 디버깅 및 최적화를 자동화하고 지속적인 개선 주기를 생성합니다.
Aysola의 발표는 에이전트가 자체 강화하고 스스로 연구를 수행할 수 있게 하는 평가 프레임워크에 중점을 두었습니다.
그는 강력한 테스트에 필요한 도구 호출 및 벤치마크의 고유한 변동성으로 인해 에이전트 하네스를 구축하는 데 따르는 중요한 과제를 강조했습니다.
Aysola는 벤치마크, 평가, 에이전트 구성이 모두 공변량(covariant)이며, 이는 상호 의존적이고 함께 변화한다는 의미라고 지적했습니다. 이는 AI 에이전트 성능을 안정적으로 평가하는 데 근본적인 과제를 제시합니다.
그는 '시뮬레이션-실제' 격차를 해소하기 위해 프로덕션 및 오프라인 환경 모두에서 측정하는 것의 중요성을 강조하면서 동적 시스템에서 실제 성능을 검증하기 위한 강력한 측정의 필요성을 강조했습니다.
Weights & Biases Weave는 ARIA 에이전트 개발 내에서 프로덕션 및 오프라인 추적 모두에 중요한 관찰 가능성 플랫폼 역할을 합니다.
팀은 프로덕션 추적을 활용하여 오프라인 언덕 오르기(hill climbing)를 수행함으로써 에이전트가 자체 개선 플라이휠을 통해 오류를 자율적으로 해결하고 성능을 지속적으로 개선할 수 있도록 합니다.
Aysola는 W&B 아티팩트로 기록된 코드베이스를 가져와 오프라인 평가 프레임워크 내에서 훈련 작업을 시작하는 ARIA의 기능을 시연했습니다. 이를 통해 에이전트는 프로덕션 추적을 자율적으로 검토하고 언덕 오르기를 위한 새로운 작업을 생성할 수 있습니다.
에이전트는 프로덕션 추적을 오프라인 평가 프레임워크로 전송하고, 문제를 디버깅하고, 후보 솔루션을 벤치마킹하여 자체적으로 새로운 변형을 개발합니다.
CI 작업은 시스템 안정성을 보장하기 위해 7주 동안 에이전트 성능을 지속적으로 추적합니다.
시스템은 후보 변형을 현재 프로덕션 버전과 체계적으로 모니터링하여 다양한 작업에서 성능 지표를 유지하고 개선하는 것을 목표로 합니다.
팀은 최신 모델의 고급 기능으로 인해 기존 강화 학습보다 프롬프트 엔지니어링을 우선시하며, 시뮬레이션 환경 내에서 소프트웨어 에이전트의 특정 기술 구축에 중점을 둡니다.
연구 및 프로덕션 환경 간의 편차를 방지하기 위해 4시간 동기화 프로세스를 통해 프로덕션 및 시뮬레이션 모두에서 '바이트 단위로 동일한' 에이전트 버전을 사용하여 일관성을 보장합니다.
원활한 실험을 촉진하기 위해 연구 및 프로덕션 코드베이스는 정확히 동일한 로깅 프레임워크를 공유합니다.
내부 '실행 평가' 명령은 광범위한 점수 궤적을 생성하는 데 사용되며, 이를 통해 에이전트 성능에 대한 자세한 분석이 가능합니다. 핵심 아이디어는 방대한 양의 추적을 생성하여 새로운 성능 패턴을 식별하는 것입니다.
ARIA는 자체 롤아웃을 자율적으로 검토하여 성공과 실패를 식별할 수 있으며, 프롬프트 또는 기타 조정을 통해 피드백을 강화하여 동작을 정렬합니다.
Weights & Biases는 모델에 구애받지 않는 소프트웨어 스택을 활용하여 핵심 추론 모델과 기본 모델을 모두 지원합니다. 구성은 YAML 정의를 통해 관리되어 빠르고 병렬적인 변형을 용이하게 합니다.
주요 목표는 실험 볼륨을 크게 늘려 성능 개선에 대한 심층적인 통찰력을 얻고, 에이전트가 자체 연구 루프를 구축할 수 있는 유연한 샌드박스를 제공하는 것입니다.
평가 프로세스는 YAML 구성으로 시작하는 DAG(Directed Acyclic Graph) 패턴을 따릅니다. 환경은 현실적인 테스트 조건을 보장하기 위해 프로덕션 데이터로 채워지며, 이는 테스트 충실도를 유지하는 데 중요합니다.
GPU 실행 시뮬레이션과 같은 리소스 집약적인 작업에는 병렬화가 필요합니다. YAML에 인코딩되지 않은 런타임 구성은 구성에 핫 패치되며, 에이전트는 프로덕션과 동일한 환경에서 작동합니다.
우리는 이러한 시뮬레이션 환경을 생성하기 위한 좋은 패턴을 만들고 싶습니다. 그래서 전통적인 기계 학습 맥락에서 생각할 수 있는 비교적 모델에 구애받지 않는 DAG를 가지고 있습니다.
Weights & Biases는 평가와 프로덕션 성능 간의 격차를 효과적으로 해소하기 위해 측정의 견고성을 우선시합니다. ARIA 에이전트는 규범적 채점(작업 통과 여부 결정)과 상대적 채점의 두 가지 패턴을 사용하여 자체적으로 채점합니다.
상대적 채점은 에이전트의 질문 방식이 전반적인 성능을 향상시키는지 평가하는 등 다양한 상호 작용 스타일을 A/B 테스트하는 데 특히 유용합니다.
작업은 정확한 시뮬레이션에 중요한 특정 시작 및 종료 조건을 설명하는 YAML 사양으로 정확하게 정의됩니다. 이러한 시뮬레이션은 간단한 텍스트 지침과 복잡한 다중 턴 상호 작용을 모두 포함합니다.
언어 모델은 사용자 페르소나를 시뮬레이션하는 데 사용되어 팀이 특정 질문 시퀀스를 테스트할 수 있도록 합니다. 시스템은 현재 수준별로 분류된 886개의 작업을 관리하며, 이 모든 작업은 제품 팀의 감사를 받아 품질과 관련성을 유지합니다.
프로덕션 추적은 ARIA 에이전트의 실제 동작 패턴을 이해하는 데 필수적입니다. '평가 플라이휠' 원칙은 모든 프로덕션 성공 또는 실패가 에이전트 프레임워크의 새로운 작업으로 전환되어야 한다고 규정합니다.
이 지속적인 피드백 루프는 에이전트가 프로덕션 및 오프라인 데이터 추적 모두에서 학습하여 반복하고 개선할 수 있도록 합니다.
ARIA는 라이브 프로덕션 추적을 자율적으로 캡처하여 프레임워크에 기록합니다. 그런 다음 에이전트는 Weights & Biases Agent Factory(WBAF)를 사용하여 이러한 프로덕션 추적을 회귀 작업으로 전환하며, 이는 Aysola에 의해 시연되었습니다.
한 예에서 ARIA는 샌드박스 환경 내에서 'weave.log' SDK 호출 누락을 특정 버그로 식별했습니다. 그런 다음 에이전트는 제안된 수정의 효과를 검증하기 위해 다양한 변형을 테스트하는 언덕 오르기를 수행했습니다.
이 자율 프로세스를 통해 에이전트는 이전 프로덕션 버전과 직접적으로 성능 개선 사항을 벤치마킹하여 디버깅 및 최적화 주기를 간소화합니다.
이제 엔지니어는 클라우드 코드에서 오프라인 벤치마크를 수동으로 작성할 필요 없이 플랫폼 내에서 직접 에이전트 개선 사항을 관리할 수 있습니다. 이 플랫폼은 프로덕션 추적 및 오프라인 평가 모두에 대한 통합된 관찰 가능성을 제공하여 개발 프로세스를 간소화합니다.
이 새로운 워크플로를 통해 개발자는 수동 코딩 작업에 얽매이지 않고 아키텍처 설계 및 시스템 보호 장치에 더 많은 시간을 할애할 수 있습니다. Aysola는 Claude를 코딩에 사용하여 8개월 동안 수동으로 코드를 작성하지 않았다고 언급했습니다.
ARIA의 자가 수정 메커니즘은 식별된 SDK 오류를 완화하기 위해 특정 시스템 프롬프트를 주입하거나 기존 기술을 업데이트하는 것을 포함합니다. 에이전트의 성공적인 수정은 후보 변형의 성능을 프로덕션 메트릭과 비교하여 검증됩니다.
프로세스 흐름은 프로덕션 추적 추출, 시나리오 시뮬레이션, 에이전트 벤치마킹, 그리고 개선 패턴 정의를 포함합니다. 이 시스템은 개발자가 에이전트가 시간이 지남에 따라 진화하고 개선되는 미묘한 '회색 영역'을 다듬을 수 있도록 지원합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 37편 올렸어요.