Imagen 3 및 Omni Flash, Gemini API 업데이트와 함께 출시
또한 이 회사는 Interactions API에 Omni Flash를 출시했으며, 이는 프로그래밍 방식 비디오 생성 및 편집 기능을 제공하여 Gemini 및 오픈 소스 Gemma 모델을 포함한 Google의 AI 모델 제품군을 더욱 확장합니다.
Google DeepMind가 자율 AI 에이전트를 위한 관리형 샌드박스를 포함한 새로운 Gemini Interactions API를 도입하여 개발 및 배포를 간소화합니다.
또한 이 회사는 Interactions API에 Omni Flash를 출시했으며, 이는 프로그래밍 방식 비디오 생성 및 편집 기능을 제공하여 Gemini 및 오픈 소스 Gemma 모델을 포함한 Google의 AI 모델 제품군을 더욱 확장합니다.
대규모 언어 모델(LLM) 분야는 주로 기본적인 텍스트 완성에 중점을 둔 2018-2019년 BERT 및 GPT와 같은 초기 모델을 넘어 상당한 변화를 겪었습니다.
명령 튜닝의 도입으로 모델이 사용자 질문에 직접 답할 수 있게 되었으며, ChatGPT의 턴 기반 대화 방식에 의해 이 기능이 더욱 보편화되었습니다.
오늘날의 개발은 몇 시간에서 며칠에 이르는 장기간 동안 생각하고, 기능을 사용하며, 복잡한 작업을 자율적으로 실행할 수 있는 '블랙 박스' 목표 지향 에이전트 생성에 중점을 둡니다.
이 API는 멀티모달 입력을 지원하여 에이전트가 문자열 및 미디어 데이터를 포함한 다양한 데이터 유형을 기본 모델 및 고급 에이전트 모두를 위한 통합 인터페이스를 통해 처리할 수 있도록 합니다.
클라이언트 측 부담을 줄이기 위해 서버 측 상태 관리를 통합하고, HTTP 연결 시간 초과 없이 비디오 생성과 같은 작업을 처리하기 위해 비동기식 '장기 실행 작업'을 도입합니다.
이제 서버는 이전 입력을 연결하여 컨텍스트를 관리하여 모델이 상호 작용 전반에 걸쳐 상태를 유지하고 텍스트, 오디오용 Gemini TTS, 이미지 생성과 같은 다양한 모달리티를 지원하도록 합니다.
이러한 아키텍처 변화는 시스템이 함수 호출 및 도구 실행을 처리할 수 있도록 하여 모델이 Google 검색과 같은 작업을 독립적으로 수행할지 여부를 결정할 자율성을 부여합니다.
전통적인 LLM 제공업체는 '사용자-모델' 턴 구조에 의존하는 경우가 많으며, 이는 최신 AI 에이전트의 복잡한 추론 및 도구 호출 기능을 처리할 때 문제를 야기합니다.
필립 슈미트(Philipp Schmid)는 '사용자' 역할 내에서 함수 출력을 반환하는 것의 개념적 어색함을 강조했습니다. 이 정보는 인간 사용자로부터 오는 것이 아니라 환경에서 발생하기 때문입니다. Gemini API는 각 작업에 고유한 유형이 할당되는 '단계의 동기식 타임라인'을 채택하여 이를 해결하고 확장성을 향상시킵니다.
Google은 Project Astra를 위해 원래 개발된 백엔드 아키텍처를 활용하여 Gemini API 에이전트에 관리형 샌드박스 환경을 통합했습니다.
Google은 에이전트가 상태 비저장 및 영구적인 클라우드 환경 내에서 코드를 실행하고, 종속성을 설치하고, 파일을 생성할 수 있도록 인프라 관리 부담을 덜어줍니다.
이러한 관리형 샌드박스는 다중 턴 상호 작용 전반에 걸쳐 상태를 유지하여 에이전트가 이전 단계의 정보를 활용하여 후속 작업을 알려줄 수 있도록 합니다.
동일한 환경에서 작동하는 여러 에이전트는 공유 파일 시스템에 액세스하여 다른 보조 에이전트가 시작한 작업을 선택하고 계속함으로써 효과적으로 작동할 수 있습니다.
이 설정은 모델에 GCS 버킷 또는 GitHub 리포지토리와 같은 적절한 도구 및 데이터 소스가 갖춰져 있다면 다른 에이전트가 시작한 작업을 원활하게 계속할 수 있는 보조 에이전트를 생성할 수 있도록 합니다.
또한 'agents.md' 파일이 있는 경우 해당 내용이 시스템 명령에 추가되어 에이전트가 수동 구성 업데이트 없이 자신의 기능과 컨텍스트를 인식하도록 합니다.
환경 ID 시스템을 활용하여 개발자는 Agents API를 통해 Kubernetes 또는 Terraform과 같은 복잡한 인프라와 독립적으로 기본 에이전트를 정의합니다.
개발자는 CLI 도구 설치 및 무결성 검사 실행을 포함한 환경 스캐폴딩을 한 번 수행하여 환경 ID를 얻을 수 있습니다. 이 ID는 사전 로드 및 사전 구성된 환경에서 자동으로 생성되는 새 에이전트를 생성하는 데 사용할 수 있어 일관성과 효율성을 보장합니다.
이 CLI는 Nano, Flash 또는 Omni와 같은 다양한 모델을 호출하여 자산을 생성하고 에이전트 시스템의 반복적인 개선을 촉진합니다. GitHub 리포지토리는 상호 작용 및 에이전트 API 모두에 대한 전용 스킬을 제공합니다.
Google I/O에서 시연된 'AI 토크 라디오' 애플리케이션은 관리형 에이전트를 활용하여 선형 팟캐스트가 아닌 여러 사람의 대화와 토론을 시뮬레이션하는 동적 라디오 콘텐츠를 제작합니다.
이 시스템은 라디오 세그먼트를 위해 자율적으로 연구를 수행하고, 음성, 음악 및 시각적 썸네일을 생성합니다.
시연 중 논의된 예시 주제는 일반적인 '시리얼 먼저 vs. 우유 먼저' 논쟁이었으며, 이는 에이전트가 미묘한 토론에 참여할 수 있는 능력을 보여주었습니다.
이것은 당신이 듣는 팟캐스트와 같지 않습니다. 정말로 여러 사람이 추론하고 의견을 공유하는 것과 같습니다.
Gemini용 토크쇼 라디오 애플리케이션과 같은 도구를 사용자 지정하려면 개발자는 AI Studio의 '빌드' 섹션에 제공된 오픈 소스 갤러리를 탐색할 수 있습니다.
사용자는 토크쇼 라디오 애플리케이션과 같은 기존 애플릿을 리믹스하여 특정 요구 사항에 맞게 사용자 지정할 수 있습니다. 이러한 애플릿은 오픈 소스이므로 기본 코드 구조를 완전히 투명하게 볼 수 있습니다.
Gemini 에이전트는 파일 집합, 특히 환경 시작 시 로드되는 시스템 명령이 포함된 'agents.md' 파일로 구성되며, 연구, 스크립트 작성, 음악 생성 및 음성 합성 등 에이전트의 핵심 작업을 정의합니다.
스킬은 Python 파일로 구현되어 Gemini 에이전트가 Interactions API를 통해 다른 모델을 호출할 수 있도록 하여 에이전트 동작에 모듈식 및 확장 가능한 접근 방식을 제공합니다.
'반중력 에이전트' 템플릿은 샌드박스 환경 내에서 에이전트 기능을 포괄적으로 테스트하기 위한 6가지 사전 구성된 설정을 제공합니다.
이 샌드박스는 에이전트가 bash 명령을 실행하여 Ubuntu 버전, vCPU 수 및 메모리와 같은 호스트 시스템 세부 정보를 식별하고 상세한 운영 컨텍스트를 제공할 수 있도록 합니다.
사용자는 에이전트가 생성한 파일을 다운로드하거나 API를 통해 상호 작용할 수 있으며, 시스템은 클라이언트 측 함수 호출 관리의 필요성을 제거하고 서버 측에서 에이전트 루프를 관리합니다.
관리형 에이전트를 사용하면 단일 API 호출이 프로세스를 트리거한 후 모든 것이 원격 샌드박스 내에서 실행됩니다.
이 환경은 원격 및 로컬 MCP 서버 모두에 대한 연결을 지원하며, 이러한 에이전트를 구축하고 배포하기 위한 포괄적인 문서는 Gemini API '에이전트' 섹션에서 확인할 수 있습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 69편 올렸어요.