FriendliAI의 에이전트 추론 집중
이 회사는 AI 애플리케이션의 성장하는 부문에 더 빠르고 저렴하며 안정적인 서비스를 제공하는 것을 목표로 합니다.
FriendliAI는 자사의 추론 클라우드가 AI 에이전트에 최적화된 방식과 오픈 웨이트 모델에 대한 비용 효율성 및 성능을 강조합니다.
이 회사는 AI 애플리케이션의 성장하는 부문에 더 빠르고 저렴하며 안정적인 서비스를 제공하는 것을 목표로 합니다.
FriendliAI는 서울대학교 연구팀에서 시작되었으며, 강력한 연구 지향적 정체성을 유지하고 있습니다. 이 회사는 이제 업계 표준이 된 추론 최적화 기술인 지속적 배치를 개척했으며, Orca 작업은 널리 사용되는 오픈 소스 프레임워크인 3LM에 영감을 주었습니다. 샌프란시스코에 본사를 두고 서울에 팀을 둔 FriendliAI는 AI 에이전트의 기하급수적인 성장과 오픈 웨이트 모델의 성숙에 발맞춰 프론티어 추론을 확장하기 위해 전 세계적으로 운영됩니다.
AI 에이전트는 소프트웨어 운영 및 지식 작업 전반에 걸쳐 폭발적인 채택을 경험하고 있습니다. 오픈 웨이트 모델은 이제 성능 면에서 폐쇄형 프론티어 모델과 경쟁할 정도로 최고 수준의 역량에 도달하여 에이전트의 경제성을 높이고 있습니다. 이를 통해 훨씬 낮은 토큰 비용으로 오픈 모델에서 최고 품질의 에이전트를 실행할 수 있습니다. 예를 들어, 오픈 웨이트 모델인 GLM 5.2가 타워 디펜스 게임 작업을 완료하는 것을 보여주며, 실제 에이전트 워크플로우에 대한 역량을 입증했습니다.
GLM 5.2와 같은 오픈 웨이트 모델과 Anthropic의 Opus 4.8과 같은 폐쇄형 모델이 타워 디펜스 게임 구축에 대해 동일한 결과를 내지는 않지만, 둘 다 많은 에이전트 워크플로우에 유용한 수준으로 작업을 완료합니다. 중요한 차이는 경제성에 있습니다. Opus 4.8은 약 1.50달러가 들었지만, FriendliAI의 GLM 5.2는 27센트로 약 5.6배 저렴했습니다. 이는 오픈 웨이트 모델이 최고 수준의 에이전트를 훨씬 저렴한 비용으로 제공할 수 있다는 가능성을 보여주지만, 에이전트의 총 비용은 모델 비용을 넘어섭니다.
추론 스택은 기존 채팅 사용과 크게 다른 에이전트 워크로드를 지원하도록 발전해야 합니다. 채팅에서는 사용자가 질문을 하고 즉각적인 답변을 받는 단일 요청이 기본 단위이며, 지연 시간은 응답 속도로 정의됩니다. 그러나 에이전트는 수많은 모델 및 도구 호출을 포함하고 시간이 지남에 따라 자율적으로 실행될 수 있는 작업을 수행합니다. 사용자는 개별 요청의 지연 시간보다 전체 작업 완료를 우선시하므로 종단 간 작업 완료를 위한 최적화가 필요합니다.
이 채널, 다음 영상도 놓치지 마세요
새 영상이 올라오면 지금처럼 읽기 좋은 아티클로 정리해 이메일로 보내 드려요.
에이전트 워크플로우는 여러 작업으로 구성된 세션으로 이루어지며, 각 작업은 일반적으로 루프에서 실행됩니다. 이 루프는 계획(종종 LLM 호출)으로 시작하여 도구 호출을 포함할 수 있는 실행으로 이어집니다. 그런 다음 에이전트는 결과를 관찰하고 컨텍스트에 추가하며 작업이 완료될 때까지 주기를 반복합니다. 이 과정은 LLM 추론과 비LLM 도구 실행 간의 끊임없는 전환을 포함하며, 에이전트가 하위 에이전트를 생성하고 병렬로 실행하는 복잡성이 추가됩니다.
관찰된 중요한 패턴은 연속적인 에이전트 단계가 종종 상당한 접두사를 공유한다는 것입니다. 이 공유 접두사를 반복적으로 재계산하는 것은 계산 자원을 낭비하며, 에이전트 추론에서 주요 최적화 기회를 강조합니다. 이는 에이전트가 매우 토큰 집약적이며, 증가하는 컨텍스트 창을 효율적으로 처리해야 함을 의미합니다.
심층 연구와 같은 장기적 작업은 에이전트 추론의 복잡성을 보여줍니다. 예를 들어, FriendliAI에서 GLM 5.2를 사용하여 VLM에서 코드와 함께 스펙 디코딩 프레임워크를 설명하는 작업은 여러 단계를 거쳐 진행되었습니다. 각 단계는 수많은 추론 및 도구 호출을 수행하는 하위 에이전트로 구성되며, 수십 또는 수백 단계의 추론으로 몇 분 또는 몇 시간 동안 실행될 수 있습니다. 이 과정 전반에 걸쳐 공유 컨텍스트는 지속적으로 확장되며, 사용자의 주요 관심사는 개별 토큰 또는 코어 지연 시간이 아니라 전체 작업의 완료입니다.
에이전트 추론의 과제에는 시간 경과에 따른 컨텍스트 증가, 모델 코어와 도구 작업의 인터리빙, 고정된 요청 속도 계획을 방해하는 가변적인 모델 코어 수가 포함됩니다. 중요한 성능 지표는 단일 요청 지연 시간에서 종단 간 작업 지연 시간으로 전환되며, 이는 에이전트 추론이 채팅과 근본적으로 다르다는 것을 의미합니다. FriendliAI는 이 종단 간 작업 지연 시간을 최적화하는 데 중점을 두어 에이전트 워크플로우를 위해 프론티어 추론 클라우드를 재구축함으로써 이러한 과제를 해결합니다.
FriendliAI는 에이전트 추론의 핵심 과제를 해결하기 위해 에이전트 워크플로우에 특별히 맞춰 추론 스택을 계층별로 구축했습니다. 이 아키텍처는 접두사 캐싱, 키-값(KV) 캐시 관리, 캐시 인식 라우팅, 에이전트 인식 최적화라는 네 가지 핵심 기둥을 중심으로 구축되었습니다. 이러한 기둥 아래에는 긴 컨텍스트를 위한 희소 어텐션, 오류 감소 기술, 고속 커널, 복원력 있는 서비스와 같은 모델 계층 최적화도 전체 성능 향상을 위해 통합되어 있습니다.
에이전트 단계는 종종 큰 접두사를 공유하므로 접두사 캐싱이 중요합니다. FriendliAI는 이러한 접두사에 대한 키-값 쌍을 한 번 계산하고 캐시할 수 있습니다. 후속 단계에서는 이 캐시된 KV 데이터를 재사용하여 새 접미사만 처리하므로, 프리필을 재계산하는 것보다 훨씬 저렴합니다. 이 방법은 첫 토큰까지의 시간을 단축하고 전체 계산을 줄여주며, 더 긴 에이전트 작업에 더 유용합니다. 이를 위해서는 검소한 메모리 관리로 각 GPU에 더 많은 활성 컨텍스트를 채우고, 메모리 공간을 줄이기 위한 KV 연속화, GPU 메모리, 호스트 메모리 및 디스크 전반에 걸친 계층적 캐싱을 활용하는 효과적인 KV 캐시 관리가 필수적입니다.
FriendliAI는 분산 캐싱을 사용하여 GPU 한계를 넘어 캐싱 기능을 확장하여 접두사를 단일 인스턴스 내에서뿐만 아니라 여러 복제본에 걸쳐 서비스할 수 있습니다. 전역 클러스터 규모에서는 라우팅이 중요합니다. 단순한 로드 밸런서는 요청을 균등하게 분산할 수 있지만 캐시 지역성을 파괴할 수 있습니다. FriendliAI의 캐시 인식 라우터는 필요한 접두사를 이미 캐시에 가지고 있는 시스템 부분으로 요청을 지능적으로 전달하여 콜드 프리필을 캐시 히트로 변환합니다. 이 전략은 Task A에 대한 모든 요청을 최적의 캐시 지역성을 위해 동일한 부분으로 라우팅하는 예시와 같이, 효율적인 캐시 활용을 유지하면서 어떤 단일 부분도 병목 현상이 되지 않도록 방지합니다.
에이전트 추론의 다음 개척지는 에이전트 인식 최적화입니다. 이는 각 LLM 호출을 독립적으로 취급하는 것을 넘어섭니다. 현재 시스템은 종종 더 큰 에이전트 프로그램 내에서 개별 LLM 코어의 역할을 이해하지 못한 채 스케줄링합니다. 그러나 옵티마이저에게 에이전트 수준 컨텍스트를 제공함으로써 FriendliAI는 더 정보에 입각한 결정을 내릴 수 있습니다. 여기에는 올바른 작업을 선점하고, 예상되는 다음 단계를 위해 컨텍스트를 추측적으로 미리 채우거나, 에이전트의 전체 진행 상황 및 요구 사항에 따라 더 나은 캐시 제거 결정을 내리는 것이 포함됩니다. 궁극적인 목표는 개별 호출을 빠르게 보이게 하는 것만이 아니라 종단 간 작업 지연 시간을 줄이는 것입니다.
이러한 최적화 통합은 상당한 성능 향상으로 이어집니다. FriendliAI는 Kilo Code와 함께 GLM 5.2 모델을 사용하여 간단한 모바일 게임을 만드는 것을 시연했습니다. 동일한 작업을 실행했을 때 FriendliAI의 모델 API는 잘 알려진 추론 제공업체에 비해 종단 간 작업을 훨씬 빠르게 완료했습니다. 이러한 효율성은 FriendliAI의 에이전트 중심 클라우드 설계 덕분이며, 이는 보다 견고한 프로덕션 에이전트 스택을 제공합니다. 선호하는 에이전트와 FriendliAI에서 제공되는 GLM 5.2, Minimax, Kimi와 같은 오픈 웨이트 프론티어 모델을 결합함으로써 사용자는 향상된 경제성과 함께 최고 수준의 기능을 얻을 수 있습니다.
품질, 속도, 안정성 및 비용의 이러한 조합은 에이전트를 프로덕션 환경에서 진정으로 유용하고 경제적으로 실현 가능하게 만듭니다. FriendliAI는 현재 AI 기반 스타트업부터 대규모 글로벌 기업에 이르기까지 다양한 팀을 프로덕션에서 지원하며, 그 다용도성과 영향력을 보여줍니다.
FriendliAI의 고객 기반에는 수백만 명에게 서비스를 제공하는 인기 있는 AI 코딩 도구인 Hilo와 전자, 헬스케어, 에너지 분야에 걸쳐 있는 글로벌 기업인 LG와 같은 다양한 회사가 포함됩니다. 다양한 사업에도 불구하고, 둘 다 빠르고 안정적이며 비용 효율적인 에이전트 추론을 필요로 합니다. Kilo Code의 한 후기에서는 지난 1년 동안 오픈 및 폐쇄형 모델 모두에 대해 여러 추론 제공업체를 테스트한 후, FriendliAI가 다른 타사 제공업체 및 직접 사용에 대한 GLM 5.2 사용 비교에서 뛰어난 성능을 보여주면서 스택의 핵심 구성 요소로 부상했다고 강조했습니다.
FriendliAI는 다양한 스택 요구 사항에 맞춰 유연한 소비 모델을 제공합니다. 모델 API는 서버리스 API를 통해 핵심 프론티어 오픈 웨이트 모델을 제공하여 가장 빠르게 시작할 수 있는 방법을 제공합니다. 격리된 배포 및 보장된 SLA가 필요한 프로덕션 워크로드의 경우 전용 엔드포인트를 사용할 수 있습니다. 또한 'Bring Your Own GPU'(BYOG) 옵션은 사용자가 자신의 인프라에서 FriendliAI의 추론 스택을 실행하여 세 가지 다른 배포 방법에서 동일한 견고한 성능을 보장합니다.
그는 에이전트를 구축하는 사람들이 몇 분 안에 friendly.ai에서 접근할 수 있는 FriendliAI에서 프론티어 오픈 웨이트 모델을 시도해 볼 것을 권장했습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 37편 올렸어요.
숏츠는 빼고 보내 드려요.