기업 AI 지출 급증, 엄격한 토큰 제한 강제
기업들은 AI 비용이 급증하는 것을 경험하고 있으며, 한 인도 기업은 한 달 동안 Anthropic 서비스에 5억 달러를 지출한 것으로 알려졌습니다.
Uber의 CTO도 그의 팀이 4개월 만에 1년치 Anthropic 예산을 모두 소진했다고 언급했으며, 이로 인해 많은 조직에서 이러한 증가하는 비용을 통제하기 위해 개발자에게 엄격한 토큰 제한을 부과하고 있습니다.
Cast AI의 김치 하네스는 인공지능(AI) 지출이 증가하는 상황에서 비용을 절감하고 개발자 효율성을 높이기 위해 모델을 동적으로 선택합니다.
기업들은 AI 비용이 급증하는 것을 경험하고 있으며, 한 인도 기업은 한 달 동안 Anthropic 서비스에 5억 달러를 지출한 것으로 알려졌습니다.
Uber의 CTO도 그의 팀이 4개월 만에 1년치 Anthropic 예산을 모두 소진했다고 언급했으며, 이로 인해 많은 조직에서 이러한 증가하는 비용을 통제하기 위해 개발자에게 엄격한 토큰 제한을 부과하고 있습니다.
Gemini 1.5 Flash는 100만 토큰당 3.5달러로 가격이 책정되어 있지만, 단일 작업에 75달러의 비용이 발생합니다. 연구자들은 이러한 불일치가 토큰 기반 예산 책정이 실제 운영 비용을 포착하지 못하는 이유를 상징한다고 지적했습니다.
예를 들어, Gemini 3 Flash는 100만 토큰당 3.5달러라는 겉보기에는 낮은 가격이지만 작업당 75달러의 높은 비용이 발생하며, Minimax 2.7은 100만 토큰당 1.5달러이지만 동일한 품질의 출력을 위해 작업당 148달러의 더 높은 비용이 발생하여 원시 토큰 가격이 운영 비용과 동일하지 않음을 보여줍니다.
Cast AI가 개발한 자동화된 하네스인 김치는 작업 결과에 따라 최적의 시기에 특정 작업에 가장 적합한 AI 모델을 동적으로 선택하여 효율성을 향상시킵니다.
3개월 동안 이 시스템은 총 토큰 사용량이 1.5배 증가했음에도 불구하고 총 코딩 비용을 2.5배 절감했으며, 이는 백그라운드 최적화를 통해 '무제한' 개발을 가능하게 하는 능력을 보여줍니다.
주목할 만한 변화는 6월 12일에 발생했습니다. 6월 3일에는 김치 2.6이 가장 인기 있는 선택이었지만, 6월 21일에는 Minimax 3가 최고 성능의 가장 많이 선택된 모델이 되어 시스템이 인간의 개입보다 빠르게 더 효율적인 모델을 식별하고 전환하는 능력을 보여줍니다.
자율 코딩 에이전트는 높은 출력 품질을 유지하면서 개발자에게 가장 비용 효율적인 토큰을 제공하기 위해 비용 관리를 최적화할 책임이 있습니다.
오픈 소스 솔루션인 김치 프레임워크는 개발자가 예산 제약 없이 효율적인 리소스에 접근할 수 있도록 보장함으로써 이러한 요구 사항을 해결합니다.
Cast AI는 약 6개월 전 자체 코딩 작업에서 클라우드 비용이 급증하는 것을 경험한 후 김치 하네스를 개발했습니다.
이 오픈 소스 플랫폼은 Pono SDK를 사용하여 각 프로세스에 가장 효율적인 모델을 선택함으로써 일반적으로 2~3시간마다 발생하는 장기 실행 작업을 자동화합니다.
엔지니어들은 '발효(Ferment)' 프로세스 내에서 채점 시스템을 사용하여 모든 단계에서 품질을 평가합니다. 이 프로세스는 작업을 마일스톤으로 나누고 2시간 이상 자율적으로 실행합니다.
이 플랫폼은 각 단계에서 출력 품질을 평가하기 위한 채점 시스템을 통합하여 작업이 사전 정의된 표준을 충족하도록 보장하며, 초기 품질이 불충분할 경우 상위 모델을 사용하여 작업을 다시 실행합니다.
이 반복적인 최적화는 토큰 사용량이 최종 결과의 필수 품질과 정확하게 일치하도록 보장하여 과도하게 지정된 작업에 불필요한 지출을 방지합니다.
김치 프로세스의 아티팩트는 최소 'B' 점수를 달성해야만 완료된 것으로 간주되며, 'A' 등급을 목표로 하는 옵션이 있어 강력한 품질 관리 메커니즘을 나타냅니다.
배포는 현재 '인간 참여(human-in-the-loop)' 안전 장치를 유지하기 위해 스테이징 환경으로 제한되어 있습니다. 이는 코드가 프로덕션으로 이동하기 전에 인간 검토를 보장하는 설계 선택을 반영하며, 향후 관찰 가능성 및 상태 확인을 기반으로 자동화된 프로덕션 배포 계획이 있습니다.
에이전트 공학은 방대한 코드 변경을 생성하며, 특히 기술적 지식이 부족한 인력이 개발 파이프라인에 통합되면서 검토가 점점 더 어려워지고 있습니다.
코드 검토는 이제 단순히 코드 라인을 분석하는 것이 아니라 에이전트에게 제공된 의도와 사양에 대한 이해를 요구합니다. 이 복잡성은 김치 텔레포트(Kimchi Teleport)에 의해 해결됩니다. 김치 텔레포트는 개발자가 SaaS 및 온프레미스 환경 모두에서 안전한 샌드박스를 실행할 수 있도록 합니다.
김치의 텔레포트는 코딩 작업을 Google Cloud와 같은 하이퍼스케일러 내에 호스팅된 원격 환경으로 오프로드하며, 로컬 랩톱이 닫히거나 오프라인 상태여도 지속적으로 작동하는 Kubernetes 컨테이너와 전체 개발 환경을 동기화합니다.
이 시스템은 코딩 세션에 대한 적절한 리소스 크기 조정 및 보안 규정 준수를 보장하며, 인간의 입력이나 사양 설명이 필요할 때만 개발자를 방해하여 중단 없는 워크플로를 촉진합니다.
Cast AI 엔지니어의 약 62%가 이제 코딩 작업에 텔레포트만 사용하고 있으며, 이는 상당한 채택률을 보여줍니다.
이 높은 사용률은 통근, 휴가 또는 오프라인 상태에서도 엔지니어가 코딩 진행 상황을 유지할 수 있도록 하여 전반적인 생산성과 유연성을 향상시키는 능력에 기인합니다.
엔지니어, 제품 관리자 및 동료들은 김치 스튜디오(Kimchi Studio) 내에서 진행 중인 작업을 검토합니다. 김치 스튜디오는 개발 수명 주기 초기에 잘못된 사양을 식별하여 낭비되는 노력을 방지하는 협업 인터페이스입니다.
이 플랫폼은 엔지니어, 제품 관리자 및 기타 이해 관계자가 김치 하네스에 의해 생성된 진행 중인 작업을 검토할 수 있도록 하여 개발 수명 주기 초기에 잘못된 요구 사항이나 사양을 식별함으로써 낭비되는 노력을 방지합니다.
이것은 세션 상태, 검토 및 백로그를 관리하기 위한 칸반(Kanban) 스타일 인터페이스를 제공하여 팀 전체에 코딩 세션을 시각화하고 공유하기 위한 중앙 집중식 그래픽 대시보드를 제공합니다.
핵심 김치 하네스는 완전히 오픈 소스이며, 모델 최적화 기능을 더 넓은 개발자 커뮤니티에 제공합니다.
그러나 김치 스튜디오와 텔레포트는 클라우드 호스팅 컨테이너 환경을 배포하기 위해 Google 계정이 필요하며, 설정 프로세스는 약 5분이 소요됩니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 28편 올렸어요.