반영적 최적화: 텍스트 피드백으로 AI 에이전트 자가 개선
Lakshya A. Agrawal은 수조 개의 토큰이나 수십만 번의 롤아웃과 같은 방대한 데이터 세트가 필요한 기존 AI 훈련의 한계를 해결하기 위해 반영적 최적화를 개발했습니다.
경사 하강과 같은 기존 방법은 일반적으로 수조 개의 토큰 또는 수십만 번의 롤아웃과 같은 방대한 데이터 세트가 필요하며, 이는 리소스 집약적입니다.
Lakshya A. Agrawal은 최소한의 데이터로 AI 에이전트 성능을 크게 향상시키는 새로운 반영적 최적화 방법인 GEPA를 소개합니다.
Lakshya A. Agrawal은 수조 개의 토큰이나 수십만 번의 롤아웃과 같은 방대한 데이터 세트가 필요한 기존 AI 훈련의 한계를 해결하기 위해 반영적 최적화를 개발했습니다.
경사 하강과 같은 기존 방법은 일반적으로 수조 개의 토큰 또는 수십만 번의 롤아웃과 같은 방대한 데이터 세트가 필요하며, 이는 리소스 집약적입니다.
현재 AI 개발은 도메인별 데이터의 제한된 가용성으로 인해 상당한 제약에 직면해 있습니다.
많은 에이전트 워크플로우에는 느리고 비용이 많이 들거나 오래 실행되는 도구 호출이 포함되어 있어 기존 온라인 강화 학습에 필요한 수십만 번의 롤아웃을 실제 제품 응용 프로그램에 적용하기가 비실용적입니다.
GRPO와 같은 검증된 보상을 사용하는 강화 학습은 복잡한 에이전트 추적을 단일 O(1) 점수로 단순화하여 중요한 진단 정보를 간과합니다.
이 접근 방식은 사고의 흐름, 도구 호출, 상호 작용 추적에 포함된 오류 메시지와 같은 귀중한 맥락을 효과적으로 무시하여 포괄적인 학습을 방해합니다.
GEPA는 언어 모델을 사용하여 전체 롤아웃을 분석하고, 0 또는 1의 보상 신호가 아닌 전체 텍스트 피드백을 검토하여 성공과 실패를 모두 식별합니다.
이 반영적 프로세스는 중간 출력을 통합하고 회사 지식 기반에서 데이터를 검색하는 것과 같은 외부 도구 호출을 용이하게 하여 수많은 경사 조정 대신 단일 자연어 프롬프트 업데이트를 통해 상당한 행동 변화를 가능하게 합니다.
GEPA는 진화 루프와 파레토 기반 후보 선택 전략을 통합합니다.
시연에서 GEPA는 단 3개의 데이터 포인트를 사용하여 단 한 번의 반성 라운드 후에 GRPO의 성능 향상을 두 배로 달성했으며, GRPO는 유사한 결과를 얻기 위해 25,000번의 롤아웃이 필요했습니다. Qwen 38B 모델은 외부 전문가의 지침 없이 독립적으로 최적화되었습니다.
복잡한 워크플로우에 대한 정확하고 상세한 지침을 생성함으로써 GEPA는 모호한 감성 프롬프트에 의존했던 이전 프롬프트 최적화기를 개선합니다.
이 자동화는 멀티 홉 질문 답변과 같은 작업을 위해 30분에서 1시간 이내에 문제 사양을 발견하여 인간 팀이 개선하는 데 몇 주가 걸리는 수동 프롬프트 엔지니어링을 대체합니다.
GEPA는 GPT-4.1 mini를 성공적으로 최적화하여 수학 작업에서 GPT-4.1의 성능을 능가했으며, AMD의 NPU XDNA2에서 기존 에이전트의 성능을 4.25%에서 30.52%로 7배 향상시켰습니다.
이 시스템은 또한 레거시 라이브러리인 ADF.h가 새 하드웨어와 호환되지 않는다는 것을 성공적으로 식별하여 GPT-4조차 어려움을 겪었던 희소 문서 문제를 해결하는 능력을 보여주었습니다.
GEPA 알고리즘은 도메인별 피드백을 수집하고 대규모 언어 모델(LLM)을 사용하여 개선을 반복함으로써 프롬프트를 개선합니다.
최고의 단일 후보만 유지하고 종종 지역 최적화에 갇히는 표준 루프 방법과 달리 GEPA는 파레토 풀을 유지하여 적어도 하나의 훈련 예제에서 잘 수행되는 모든 후보를 보존하여 보다 균형 잡힌 검색 프로세스에 기여합니다.
이 전략은 4개의 벤치마크에서 GEPA 성공의 절반 이상을 차지하며, 훨씬 더 높은 점수로 수렴함으로써 루프 기반 방법의 두 배에 달하는 성능 향상을 달성할 수 있도록 합니다.
GEPA는 기존 벤치마크에 최적화된 모델에서도 약 10%의 성능 향상을 지속적으로 달성하여 강력한 기능을 보여줍니다.
이 최적화 프레임워크는 질문 답변, 지침 따르기, 주장 검증, 수학과 같은 다양한 분야에 걸쳐 매우 다재다능하게 적용할 수 있으며 Python 또는 JavaScript 에이전트 코드와 같은 모든 텍스트 채점 가능 아티팩트를 개선하는 데 사용할 수 있습니다.
이 API는 평가자의 피드백과 컴파일러 오류 또는 프로파일러 로그와 같은 실행 가능한 부가 정보를 받아 LLM이 더 나은 후보를 생성할 수 있도록 하면서 지역 최적화를 피하기 위해 파레토 풀을 유지하며, CUDA 커널 코드, 숫자 값, 클라우드 스케줄링 정책과 같은 다양한 응용 프로그램에 적용할 수 있습니다.
이 API는 문서, 컴파일러 오류 또는 도구 호출 메시지를 포함할 수 있는 부가 정보에 대한 개방형 사전을 지원하여 지정된 목표를 기반으로 최적화된 솔루션 검색을 자동화합니다.
Optimize Anything 프레임워크를 사용하여 GEPA는 4줄짜리 Python 프로그램을 16번의 반성 라운드를 거쳐 RKGI 문제에 대한 6단계 에이전트로 변환했습니다.
이 에이전트는 Gemini Flash의 RKGI 정확도를 32.5%에서 89.5%로 크게 높였으며, 규칙 유도, 코드 합성 및 디버깅을 자율적으로 수행합니다.
또한 GEPA로 생성된 2단계 에이전트는 MATH-500 벤치마크에서 GPT-4o mini의 성능을 20% 향상시켰습니다.
GEPA는 궤적을 기반으로 최적화하여 특정 코드 저장소에 대한 에이전트 기술을 향상시켜 상당한 개선을 가져옵니다.
Go 저장소 문제 해결에서 GPT-4o mini의 성능은 24%에서 93%로 거의 세 배 증가했으며, 이 최적화된 기술은 Claude 3.5 Sonnet으로 성공적으로 이전되어 100% 문제 해결을 달성했습니다.
GEPA의 GSkill은 실행 및 문제 해결 시간을 거의 50% 단축하여 토큰 사용량을 절약했습니다.
GSkill은 저장소 구성, 테스트 케이스 호출 방법, 기능 구현 위치 및 빌드 시스템 세부 정보와 같은 중요한 도메인 정보를 내장하여 이를 달성하며 GEPA 저장소 내에서 오픈 소스로 제공됩니다.
인터페이스는 단일 문제, 다중 작업 검색 및 일반화의 세 가지 고유한 모드를 용이하게 하여 사용자가 특정 커널 튜닝에서 복잡하고 새로운 배포 쿼리에 이르는 작업을 처리할 수 있도록 합니다.
여기에는 직접 최적화를 위한 단일 문제 모드, 관련 문제에 대한 정보 전송을 가능하게 하는 다중 작업 검색 모드, 새로운 배포 쿼리에 대비하기 위해 기존 데이터에 대한 훈련을 위한 일반화 모드가 포함됩니다.
Optimize Anything은 광범위한 도메인에서 사용되어 다용성과 영향을 입증했습니다.
전문가 휴리스틱에 비해 클라우드 스케줄링 비용을 40% 절감하고 선도적인 모델의 OCR 오류율을 약 35% 감소시켰습니다.
Databricks는 GPT-4 120B를 튜닝하여 Claude Opus보다 훨씬 낮은 비용으로 뛰어난 성능을 발휘하도록 함으로써 배포된 에이전트의 성능에서 90배의 비용 절감을 달성했으며, 이는 프롬프트 최적화가 고급 모델에서 훨씬 더 효과적이라는 것을 나타냅니다.
이 프로세스는 인간 주석을 사용하여 LLM-as-a-judge 프롬프트가 최적화되고, 이는 에이전트를 반복적으로 개선하여 빠르고 느린 학습 접근 방식을 통해 모델 가중치와 프롬프트 하니스의 지속적인 개선 및 공동 최적화를 가능하게 하는 데이터 플라이휠을 구축합니다.
GEPA는 현재 Dropbox 및 Shopify와 같은 회사에서 프로덕션 환경에 배포되어 있으며, OpenAI는 또한 자체 개선 AI 시스템 구축을 위한 방법론을 강조하고 있습니다.
이 시스템은 하드 종속성이 전혀 없어 기존 프레임워크 또는 모델에 간단하게 통합할 수 있으며, 사용자가 도메인별 부가 정보를 활용하여 기술 문제를 최적화 작업으로 구성하도록 권장합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 87편 올렸어요.