Gemini Interactions API 및 관리형 에이전트 소개
이 새로운 도구들의 주요 목표는 AI 에이전트의 진화하는 기능과 레거시 API 구조로 인해 발생하는 제약 사이의 점점 커지는 격차를 해소하는 것입니다.
Google DeepMind가 AI 에이전트 개발을 간소화할 새로운 도구를 발표했습니다. 이 도구는 진화하는 AI 기능과 레거시 API 구조로 인한 문제를 해결합니다.
이 새로운 도구들의 주요 목표는 AI 에이전트의 진화하는 기능과 레거시 API 구조로 인해 발생하는 제약 사이의 점점 커지는 격차를 해소하는 것입니다.
초기 모델 상호 작용은 주로 단순하고 단일 턴 메시지-응답 주기로 이루어졌으며, 이는 간단했지만 범위가 제한적이었습니다.
함수 호출의 도입으로 모델은 예측 가능한 JSON 구조를 생성할 수 있게 되어 데이터 추출 및 특정 작업과 같은 더욱 정교한 작업을 수행할 수 있게 되었습니다.
최신 AI 에이전트는 장기간에 걸쳐 추론하고, 여러 도구를 활용하며, 출력에 대해 비판적으로 성찰하고, bash와 같은 광범위한 실행 환경으로 특수 도구를 넘어 환경과 동적으로 상호 작용하도록 진화했습니다.
발표자는 단 2분 만에 프레젠테이션 노트를 위한 모바일 반응형 웹사이트를 만들어 AI Studio의 효율성을 시연했습니다.
AI Studio는 Gemini 3.5 Flash와 같은 모델의 매개변수 튜닝 및 테스트를 위한 간소화된 사용자 인터페이스를 제공하며, Google은 음성-음성 번역과 같은 고급 기능을 포함하여 실험을 위한 풍부한 무료 티어를 제공합니다.
오늘 제 발표 자료는 실제로 AI 스튜디오에서 코딩되었습니다. 이 발표 2분 전에 작업을 마쳤습니다.
Google의 현재 AI 모델은 Gemini 1.5 Flash와 같은 경량 단위부터 고도로 복잡한 연구 에이전트에 이르기까지 다양하며, 통합 관리에 어려움을 줍니다.
다양한 API 엔드포인트와 깊게 중첩된 데이터 구조의 존재는 이전에 첫 번째 파티 통합을 방해했으며, Interactions API 개발의 동기가 되어 전체 Google 생태계에서 Gemini의 유틸리티를 통합하게 되었습니다.
이전에는 '사고 서명'의 수동 관리가 취약하여, 사소한 오류라도 모델의 캐시를 무효화할 수 있었습니다.
새로운 API는 이 수동 프로세스를 단일 상호 작용 ID로 대체하며, 이는 여러 턴에 걸쳐 컨텍스트를 자동으로 유지하여 최신 Gemini 시리즈 모델에서 일관된 성능을 유지하는 데 중요한 기능입니다.
데모는 단일 사진에서 다른 세계 각지에 있는 사람의 변형을 생성하는 API의 기능을 보여주었습니다.
Interactions API는 초기 요청에서 여러 에이전트 호출을 생성하고, 공유 컨텍스트와 이미지를 유지하면서 Gemini 1.5 Flash에서 새로운 Omni 모델과 같은 모델 간의 원활한 전환을 가능하게 합니다.
레거시 API 엔드포인트는 종종 출력을 검색하기 위해 복잡하고 깊이 중첩된 개체를 탐색해야 했습니다.
새로운 시스템은 'output.type' 식별자를 사용하여 반환 데이터를 명확하게 표시함으로써 구문 분석을 간소화하고 개발자가 응답 양식 및 생성 구성을 조정하기만 하면 오디오에서 이미지 생성으로 모드를 전환할 수 있도록 합니다.
새로운 API는 개발자가 내장 도구와 사용자 지정 도구를 혼합하여 사용할 수 있도록 하여 에이전트 기능의 유연성을 향상시킵니다.
예시에서는 React 애플리케이션의 최신 보안 보고서를 검색하기 위해 Google Search를 활용하는 에이전트를 시연하여 외부 도구 통합을 보여주었습니다.
모델은 URL을 통해 웹사이트에서 정보를 검색하는 컨텍스트 도구를 사용하여 정적 훈련 데이터를 넘어 기능을 확장할 수 있습니다.
'파일 사고' 함수와 같은 사용자 지정 도구는 단일 API 호출 내에서 자율적인 추론을 허용하여 모델이 필요한 정보를 결정하고 독립적으로 응답을 생성할 수 있도록 합니다.
이는 레거시 출력 배열을 엄격한 식별자로 대체하여 각 단계에서 모델 출력 및 함수 호출을 명확히 하고 오디오 및 비디오와 같은 콘텐츠 유형을 명시적으로 추적하여 다중 모드 파이프라인을 용이하게 합니다.
관리형 에이전트는 영구적인 원격 샌드박스를 제공하여 개발자가 인프라를 수동으로 관리할 필요 없이 자율적인 저장소 분석과 같은 작업에 집중할 수 있도록 합니다.
이 시스템은 환경 ID와 상호 작용 ID를 사용하여 상태 지속성을 보장하며, 샌드박스 내에서 다양한 API 호출에 걸쳐 컨텍스트를 유지합니다.
Google Cloud Storage 버킷, GitHub 저장소 및 인라인 파일에서 소스 로딩을 지원하여 플랫폼은 모델이 API 호출 전반에 걸쳐 설치된 패키지 및 파일을 유지하도록 합니다.
지속성은 모델이 설치된 패키지 및 생성된 파일을 후속 API 호출에 걸쳐 유지할 수 있도록 하여 수백만 토큰의 거대한 코드베이스 분석과 같은 고난이도 작업을 가능하게 합니다.
개발자는 튜닝된 기술을 단일 폴더로 패키징하여 업로드할 수 있으며, 로컬 테스트 완료 후 기본 인프라를 관리하거나 하네스를 미세 조정할 필요가 없습니다.
이 시스템은 GitHub 토큰과 같은 토큰을 런타임에 헤더에 동적으로 삽입하여 모델이 원시 자격 증명에 직접 접근하는 것을 방지하고 프롬프트 주입으로 인한 위험을 완화합니다.
특정 파일 및 네트워크 소스 세트를 고정하여 에이전트를 생성할 수 있으며, 이는 채팅을 통해 반복적으로 개선할 수 있는 고도로 맞춤화된 구성을 허용합니다.
사용자는 저장소 또는 샌드박스 비용 없이 최대 1000개의 명명된 에이전트를 관리할 수 있으며, 요금은 모델 사용량에만 기반하므로 유연하고 확장 가능한 에이전트 배포가 가능합니다.
Google DeepMind는 또한 기존 코딩 에이전트를 새로운 API 구조로 마이그레이션하는 것을 용이하게 하기 위해 새로운 'interactions API' 기술을 제공하며, Gemini 2.0 및 2.5 Flash와 같은 진화하는 모델 버전과의 호환성을 보장하기 위해 지속적인 유지 보수 및 평가를 수행합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 29편 올렸어요.