비정형 데이터 중심의 지능형 문서 처리
Reducto는 비정형 이미지, PDF, 스프레드시트 등 사람들이 일상적으로 사용하는 다양한 형태의 다루기 어려운 데이터 소스를 처리하는 데 필요한 인프라 구축에 집중해 왔다.
이는 Harvey, Lagora, Brogo와 같은 AI 솔루션 및 글로벌 금융, 보험 기업들을 지원하며 수십억 건의 문서 처리 경험을 축적하는 기반이 되었다.
AI 에이전트가 단순 정보 합성에서 벗어나 실질적인 작업을 수행하는 시대로 진화한다.
Reducto는 비정형 이미지, PDF, 스프레드시트 등 사람들이 일상적으로 사용하는 다양한 형태의 다루기 어려운 데이터 소스를 처리하는 데 필요한 인프라 구축에 집중해 왔다.
이는 Harvey, Lagora, Brogo와 같은 AI 솔루션 및 글로벌 금융, 보험 기업들을 지원하며 수십억 건의 문서 처리 경험을 축적하는 기반이 되었다.
금융, 보험, 의료 등 전문 사무직 분야에서는 단순 정보 합성 제품을 넘어 문서 생성과 수정까지 수행하는 에이전트 도입이 활발하다.
이러한 변화는 금융, 보험, 의료와 같은 전문 사무직 분야에서 AI 도입을 가속화하고 있다.
에이전트는 단순 질문 답변을 넘어 문서 생성 및 수정 등 엔드 투 엔드(end-to-end) 작업을 지향한다.
에이전트가 파일 소스 전체에 걸쳐 여러 결정을 내리고 다양한 데이터 소스를 활용할 때, 잘못된 입력의 위험은 파이프라인 전체에 매우 광범위하게 퍼진다.
비정형적이고 분산되어 있으며 다중 모드 데이터를 파싱하고 추출하는 과정에서 정확도 문제가 발생하며, 데이터 맥락 추출과 상호작용의 중요성이 커지고 있다.
GDP PDF 벤치마크 결과에 따르면 최신 모델들조차 약 30% 수준의 점수를 얻는 등 PDF 문서 처리의 어려움이 크다.
PDF 파일 형식 자체가 매우 오래되었고 설계 당시의 맥락이 지금과는 완전히 다르기 때문에 시각적 맥락 인코딩이 어려우며, 복잡한 표, 병합 셀, 필기체 데이터 해석에 기술적 장벽이 존재한다.
필기체 인식 등 기존 OCR로 처리할 수 없던 롱테일 영역에서 VLM은 뛰어난 유연성을 나타낸다. 전통적 컴퓨터 비전이 여전히 매우 강력한 분야가 있다는 발견에 따라, 대규모 기업들은 효율성과 결정성을 높이고자 1억 개 미만 파라미터 모델을 CPU 기반 레이아웃 탐지에 우선 도입하고 있다. 여기에 의미론적 개념을 결합해 파이프라인 오류를 자가 수정하는 에이전트 방식까지 활용하는 추세다.
대규모 기업에서는 효율성과 결정성을 위해 전통적인 컴퓨터 비전을 여전히 활용하며, 특히 1억 개 미만의 파라미터 모델이 CPU 환경에서 레이아웃 탐지에 효율적이다.
의미론적 개념을 도입하여 파이프라인 오류를 자가 수정하는 에이전트 방식은 이러한 통합적인 접근에서 중요한 역할을 한다.
단순히 LLM에 문서를 보내는 프롬프트 방식으로는 오류 수정의 신뢰도가 낮아, 모델의 추론에만 의존하지 않고 토큰 수준의 편집을 적용하는 투기적 디코딩 방식과 유사한 접근이 필요하다.
CV 및 VLM 파싱 이후 검증 및 수정 단계를 거쳐 신뢰도를 확보하며, 사람이 읽었을 때의 정확한 내용을 반영하기 위해 숫자나 기호 등 세부 오류 수정에 집중한다.
임베딩 과정에서 자연어 표현을 병행해야 언어 모델이 원본 데이터를 기반으로 질문 의도를 정확히 파악할 수 있다.
임베딩 시 자연어 표현을 병행해야 언어 모델이 질문 의도를 효과적으로 파악할 수 있으며, 단순히 OCR 데이터를 Gemini에 보내 프롬프트를 작성하는 것만으로는 충분하지 않다.
잘 구조화된 파싱 데이터를 입력으로 제공하면 Gemini, Claude, GPT 등 다양한 모델의 성능이 일괄적으로 향상된다는 점이 벤치마크 테스트를 통해 입증되었다.
이러한 개선은 모델이 데이터 형식 표현 대신 실제 출력 내용 추론에 더 집중하게 함으로써 추론 토큰 절감과 응답 시간(Latency) 단축으로 이어진다.
방대한 데이터를 모두 모델에 입력하면 비용과 품질 저하 문제가 발생하므로, 관련성 있는 문서만 적절한 파이프라인으로 분류하는 것이 핵심이다.
수백 페이지의 우편물처럼 내용이 섞인 경우 초기 분류와 정렬이 선행되어야 훨씬 더 효율적인 처리가 가능하다.
비전 인코더만으로는 복잡한 선 그래프에서 세밀한 데이터 포인트를 추출하는 데 한계가 있다. 이를 극복하고자 특정 유형의 문제를 해결할 적절한 도구를 에이전트에 제공하는 방식이 고안됐다. 결과적으로 에이전트가 자체 코드 해석기를 통해 시각화와 오류 수정을 반복하며 수만 개 필드가 포함된 대규모 문서의 데이터 누락 문제를 해결한다.
에이전트가 자체 코드 해석기를 통해 시각화하고 오류를 수정하는 과정을 반복하여 세밀한 데이터를 정확히 추출한다.
수만 개의 필드가 있는 CBP 양식 등 대규모 문서에서 발생하는 데이터 누락 문제도 이러한 에이전트 기반 접근으로 해결하고 있다.
프론티어 모델은 높은 정확도를 보이지만 콘텐츠 누락으로 인한 재현율 저하 문제가 발생하며, 전문 문서 처리 서비스들은 정확도는 낮아도 재현율 격차를 좁히는 데 집중하고 있다.
에이전트 하네스를 통해서만 이러한 작업에서 정밀도와 재현율 모두에서 지역 최대 값을 찾을 수 있었다.
입력 파싱과 검색, 서식 지정 등 단계별 평가가 선행되어야 시스템의 신뢰성을 확보할 수 있다. 제품 개발 과정에서 모든 결정의 기반이 평가여야 한다는 점이 핵심 비중을 차지한다. 따라서 기성 데이터 세트 평가를 넘어 실시간 프로덕션 모니터링 체계를 구축하고, 전체 시스템이 에이전트 성능을 실질적으로 향상하는지 확인하는 작업이 필수적이다.
입력 파싱, 검색, 서식 지정 등 각 단계별 평가가 선행되어야 하며, 최종 목표는 전체 시스템이 상담원(에이전트) 성능을 향상할 수 있는지 여부이다.
많은 고객들이 상담원이 탐색하고 처리할 수 있는 파일 시스템을 구축하고, 상담원이 사용할 도구를 직접 결정하도록 하는 시스템을 선호하고 있다.
이는 상담원이 특정 문서의 필요 여부를 분류하고 메타데이터를 관리하며, 향후 문서 생성 기능 강화와 같은 기술 발전 방향을 제시한다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 83편 올렸어요.