브라이트데이터, 20,000개 팀과 주요 AI랩 70%를 고객으로 둔다
프리모르는 제품 마케팅 팀을 이끄는 발표자로, 브라이트데이터를 "웹 데이터 회사"라고 소개했다. 전 세계 20,000개 이상의 팀이 고객이며, 그 안에는 세계 최대 AI 연구소의 70% 이상이 들어 있다.
규모는 고객 수에 그치지 않는다. 하루 500억 개가 넘는 페이지와 HTML을 처리하고, 20페타바이트가 넘는 영상·음성·기타 미디어 데이터를 다룬다.
브라이트데이터의 오머 프리모르가 15,000개 질의를 기점으로 자체 구축이 임대를 앞지른다고 주장한 실험
프리모르는 제품 마케팅 팀을 이끄는 발표자로, 브라이트데이터를 "웹 데이터 회사"라고 소개했다. 전 세계 20,000개 이상의 팀이 고객이며, 그 안에는 세계 최대 AI 연구소의 70% 이상이 들어 있다.
규모는 고객 수에 그치지 않는다. 하루 500억 개가 넘는 페이지와 HTML을 처리하고, 20페타바이트가 넘는 영상·음성·기타 미디어 데이터를 다룬다.
브라이트데이터는 원래 고객이 웹에서 데이터를 추출하도록 돕는 일만 했다. 지식 노동을 수행하는 AI 에이전트가 등장하면서 이 회사의 시야가 달라졌다.
프리모르가 제시한 정의는 웹에서 필요한 정보를 찾아 맥락으로 쓰고, 작업을 계속 이어가는 것이다. 데이터 자체는 행동을 취하고 결론을 도출해 하위 애플리케이션으로 넘기는 과정의 한 단계에 불과하다는 설명이다.
브라이트데이터 자체 팀이 수행한 데이터 감쇠 분석에 따르면 웹은 지저분하고 비정형이며, 무엇보다 끊임없이 변한다. 소셜 미디어 데이터의 관련성은 하루도 안 되어 사라진다.
뉴스·금융·리테일 분야는 30일이 지나면 수집한 데이터가 대부분 더 이상 관련이 없다. 프리모르는 이 차트를 근거로 웹에서 맥락을 뽑아내는 일이 스냅샷도, 일회성 작업도, 월 단위 작업도 아니라고 말했다.
그의 결론은 이것이 지속적으로 유지해야 하는 진행형 과정이라는 점이었다.
The web is messy. It's unstructured. And most importantly, it changes all the time.
프리모르는 구글이 웹 검색의 대명사였던 지배력이 흔들리고 있다고 진단했다. 그는 "피가 물에 풀리면 상어가 몰린다"는 표현으로 최근의 움직임을 요약했다.
지난주 아마존은 자체 인덱스를 개발해 AgentCore에서 에이전트용 데이터와 맥락을 검색하는 기능을 열었다. 그보다 2주 앞서는 마이크로소프트가 세계 검색 트래픽의 1~2%를 차지해온 회사로서 Web IQ를 에이전트 개발·오케스트레이션 제품군 안에 다시 포장해 출시했다. 그가 보기에 이 공간은 갈수록 붐비고 있다.
프리모르가 든 예는 특정 웹사이트에서 오늘 아침 특정 운동화 한 켤레의 가격이다. 검색은 지난 6개월간 그 가격이 어떻게 변했는지, 어떤 할인이 있었는지는 알려주지 않는다.
브라이트데이터의 채용 공고는 검색할 수 있지만 그 추이가 시간에 따라 어떻게 변했는지, 인력 규모가 어떻게 바뀌었는지는 검색할 수 없다. 그가 보기에 그 정보는 당시에도 웹에 존재했다. 결론은 웹 검색이 뽑아낼 수 있는 것보다 웹 안에 훨씬 많은 맥락이 있다는 것이다.
I cannot really search for how has that price changed over the last six months, what discounts it had, right?
브라이트데이터는 이들을 사내에서 CaaS, 곧 Context-as-a-Service라고 부른다. 에이전트는 MCP, CLI, 또는 평범한 API로 이들 서비스에 접속한다.
목적은 데이터를 추출·검색해 에이전트가 지식 노동을 위해 추론할 수 있게 하는 것이다. 이들이 활동하는 영역으로는 이커머스, 여행, 금융, 시장조사, 인사, 부동산이 거론됐다. 이 회사들은 크롤링·검색·추출·색인을 넘어 지식 그래프를 구축해 여러 출처를 병합하고 개체를 중복 제거·보강한다. 프리모르는 이들을 아주 특정한 무언가에 특화된 검색엔진, 곧 수직형 검색엔진이라고 규정했다.
프리모르가 다시 열거한 분야는 금융, 시장조사, 리테일, 이커머스, GTM, 세일즈 인텔리전스다. 이 회사들은 모두 브라이트데이터의 스타트업 프로그램에 참여하고 있다.
빌더에게는 최대 20,000달러의 크레딧과 공동 마케팅이 제공된다. 그는 이 시장을 두고 "표면만 긁고 있는 것 같다"고 표현했다.
프리모르는 CaaS를 DaaS(Data-as-a-Service)의 진화로 보는 시각이 재미있다면서도, 어떤 면에서는 맞다고 인정한다. 다만 그것이 겨냥하는 필요는 매우 특정하다는 단서를 달았다.
그가 든 비유는 AI 검색엔진이 구글과 다른 지점이 곧 에이전트의 필요가 사람의 필요와 다른 지점이라는 것이다. 줌인포의 gtm.ai 관련 메시지도 이런 "간극"을 이해하고 있다는 점이 언급됐다.
So yeah, it's funny to think of Cass as an evolution of DAS and it is in a way, but it's catering for a very specific need.
실험에서 처음 측정한 항목은 커버리지였다. 프리모르에 따르면 "상당히 좋은 수렴이 있었다"며 대체로 잘 해냈다는 평가다.
다만 하위권에 그친 두 제품은 뒤에서 따로 다루기로 미뤘고, 검색은 일관됐다는 언급이 나왔다. 이 구간에서는 커버리지 수치가 제시되지 않았다.
두 CaaS 업체 외에 세 번째 제공자는 Unlocker와 보통의 구글 데이터를 뜻하는 SER이었다. 같은 작업을 구글에서 돌렸을 때 "정보 추출을 꽤 잘 해냈다"는 것이 프리모르의 평가다. 클라우드 자체 검색이라고 소개된 Native도 다른 제품들과 잘 수렴했다.
그는 두 CaaS 솔루션이 최하위로 나온 것이 처음에는 의외였다고 말했다. "기업들을 다 매핑하는 게 유일한 임무"라면 CaaS가 압도해야 마땅하다고 봤기 때문이다.
파고들어 이해한 이유는 이렇다. CaaS 업체는 자신이 수집한 개체 정보만 알기 때문에 그 범위를 벗어난 질문에는 데이터가 없다. 예컨대 최근 채용 데이터를 수집한 적이 없다면 그 정보는 결코 나오지 않는 반면, 검색은 계속 찾고 탐색할 수 있다. 프리모르는 CaaS 업체들이 이 실험에서 묻지 않은 다른 장점과 필드를 많이 갖고 있을 것이라고 인정했다. 그가 남긴 미해결 질문은 커버리지를 일반적으로가 아니라 "우리가 해야 할 특정 작업과 관련해" 어떻게 측정할 것인가였다.
비용 차트에서 구글을 포함한 대부분의 검색·CaaS 솔루션은 "거의 같은 비용으로 수렴"하며 중앙에 거대한 덩어리를 이뤘다.
문제는 왼쪽의 CaaS 수치가 서비스 자체, 곧 업체에 지불하는 금액만이라는 점이다. 다른 모든 검색 솔루션은 데이터를 구조화해 실제로 행동에 옮기고 검색 가능한 형태로 만들기 위한 상당한 토큰 소모가 추가로 필요했다.
Native는 같은 결과물을 내면서도 "터무니없이 비싸다"는 평가를 받았다. 오른쪽의 가장 비싼 CaaS는 "업계에서 단연 가장 비싼" 수준이라고 했지만 프리모르는 업체 이름을 밝히지 않았다. 별도의 저렴한 CaaS 한 곳은 품질도 가장 낮았는데, 그는 이를 더 낮은 품질의 데이터를 훨씬 싸게 제공하며 롱테일 사용자를 겨냥하는 틈새 사업자로 읽었다.
화면의 차트는 100회 전체가 아니라 레코드 하나에 대한 비용이다. 규모에 대한 질문은 "100만 건이 필요하면 어떻게 되는가"로 이어졌다.
100만 건은 맥락에 담기지 않는다. 그래서 그는 100만을 한 번의 실행이 아니라 질의 빈도로 다시 해석했다. 그가 설정한 인물은 사모펀드 실사를 위해 같은 기업들을 끊임없이 다시 들여다보는 시장조사 담당자다. 새 뉴스가 있는지, 무엇이 바뀌었는지, 누가 입사하고 퇴사했는지, 신규 채용이 있는지를 반복해서 묻는다.
그의 표현대로 "빈도가 비용을 죽인다"면, 이는 전통적 데이터 수집이 아니라 웹 맥락 엔지니어링의 문제가 된다. 같은 답이 돌아오고 아무것도 바뀌지 않아도 반복 질의는 첫 질의와 같은 비용이 든다. 토큰 비용은 시간이 지나도 줄지 않으며, 어느 정도 볼륨 요소는 있지만 평평해지지는 않는다.
프리모르는 이런 행태를 지식 노동에서의 "모서리 깎기"라고 이름 붙였다. 그가 든 예는 "이 회사를 매일 조사하지는 않고 일주일에 한 번, 한 달에 한 번만 보겠다"는 식의 절충이다.
결과도 마찬가지다. "모든 결과가 필요하지는 않으니 10개, 20개만 받겠다"고 줄인다. 그가 보기에 팀들은 이미 지식 노동을 할 준비를 갖췄지만, 비용을 의식하기 시작하면서 가치를 전부 뽑아내지 못하고 있다.
그가 든 구분은 소유와 임대다. 사용하는 맥락을 소유하는 것이 아니라 임대하고 있다는 점이 이 문제의 핵심이라는 것이다.
그의 실험 방법은 단순하다. 회사 이름 하나만 가지고, 그 외에는 아무것도 없이 구글에 돌린다.
목표는 해당 회사의 정보를 가진 여러 웹사이트에서 관련 항목과 관련 URL을 찾아내는 것이다. 이 발췌는 그가 절차를 설명하던 도중 문장이 끊긴다.
자체 구축 파이프라인의 커버리지는 "괜찮은 정도"였다. 놀랍지도, 앞서 본 것 중 최고도 아니었지만 견줄 만한 수준이었다.
이것이 하루짜리 실험이며 그보다도 못할 수 있다는 점을 프리모르는 거듭 강조했다. 아주 특정한 작업, 아주 제한된 맥락, 아주 제한된 상황이라는 경고를 두 번 반복한 뒤, 결론을 내릴 때는 조심하고 신중하게 접근하라고 당부했다.
AI 검색과 CaaS 같은 솔루션은 곧바로 연결해 쓸 수 있다는 점에서 매우 좋다고 프리모르는 인정했다. 조건이 붙는다. 지식 노동 수요가 지속적이고 일관되며 어느 정도 계속 확대·성장한다면 자체 구축을 고려할 방향이 된다는 것이다.
소유의 장점으로 그가 든 것은 앞단이 모두 선행 투자라는 점이다. 이후 에이전트가 수행하는 검색에는 추가 비용이 붙지 않아, 같은 질문을 반복해서 던지고 마음에 들지 않으면 백 번이라도 다시 물을 수 있다. 그가 "아마도 가장 중요한 것"이라고 부른 대목은 더 이상 모서리를 깎지 않아도 된다는 점이다. 여기에 자체 데이터를 연결할 수 있는 맞춤 비즈니스 로직이라는 이점도 있다는 점이 덧붙여졌다.
프리모르는 제시한 사례가 15,000건이 아니라 100만 건에 대한 질문이었다는 점을 상기시켰다. 이 효과는 크게 누적되며, 그래서 장기적 지평이 필요하다는 것이다.
그가 다시 꺼낸 근거는 웹이 계속 변한다는 사실과 앞서 본 데이터 감쇠다. 관심 있는 개체에 대해 질문을 계속 던지는 상황에서 이것이 장기적으로 어떻게 전개될지 생각해야 한다는 것이 그의 요청이었다.
일회성 작업이 아니라는 전제가 깔린다.
그가 명시한 예외도 분명하다. 일회성 질문이라면 AI 검색을 쓰라고 권한다. 반복해서 해야 하는 일이라면 누적 효과를 놓치고 손해를 보고 있을 가능성이 상당하다는 것이 그의 마무리였다.
Answers come from the transcript, with the exact spot cited.
Want the next article from AI Engineer?
When AI Engineer publishes, we'll write it up like the one you just read and email it to you.
AI Engineer published 87 in the last 7 days.
Akamai Functions Achieve Zero Cold Starts for AIAI Engineeryesterday · 22:37 · 205 views · Created yesterday
From Laptop to Pipeline: Scaling AI AgentsAI Engineeryesterday · 19:39 · 69 views · Created yesterday
Stop Prompting AI: Codify Rules InsteadAI Engineer2 days ago · 15:55 · 77 views · Created 2 days ago