2023년 초기 RAG 모델의 단순한 데이터 검색과 고정된 루프 방식
2023년 초기 RAG 모델은 개인 데이터 코퍼스 기반의 간단한 챗봇을 구축하는 수준에 머물렀다.
이는 문서를 청크로 나누고 임베딩한 뒤 벡터 데이터베이스에 저장하고, 단순히 상위 K개 결과를 검색하여 대규모 언어 모델(LLM)을 통해 결과를 생성하는 고정된 루프 방식이었다.
LlamaIndex가 AI 에이전트의 문서 이해와 활용을 위한 새로운 기술 패러다임을 제시한다.
2023년 초기 RAG 모델은 개인 데이터 코퍼스 기반의 간단한 챗봇을 구축하는 수준에 머물렀다.
이는 문서를 청크로 나누고 임베딩한 뒤 벡터 데이터베이스에 저장하고, 단순히 상위 K개 결과를 검색하여 대규모 언어 모델(LLM)을 통해 결과를 생성하는 고정된 루프 방식이었다.
어떤 키워드와 검색어를 쓸지 에이전트가 직접 판단함으로써, 상위 K개 검색 방식의 한계를 극복하고 복잡성을 내재화했다.
예를 들어, 에이전트가 어떤 키워드나 검색어를 사용해야 좋은 결과를 얻을 수 있을지 스스로 판단하고, 기본적인 수준의 검색 도구만으로도 반복 작업을 통해 문제를 해결할 수 있게 된다.
AI가 적절한 작업에 집중하도록 유도하는 추상화 수준이 향상되면서, 비기술 직무 종사자도 자연어로 런북과 목표를 정의할 수 있게 되었다.
이러한 변화는 비기술 직무 종사자도 자연어로 런북과 목표를 정의할 수 있게 하며, AI가 적절한 작업에 집중하도록 유도하는 추상화 수준을 향상시킨다.
이는 2023년에서 2025년 사이에 더욱 두드러질 것으로 예상된다.
아무리 똑똑한 에이전트라도 적절한 컨텍스트 없이는 진정한 가치를 창출할 수 없다.
이를 위해서는 Snowflake, S3, SharePoint, Box, Dropbox 등 조직 컨텍스트에 대한 광범위한 접근 권한이 필수적이며, 비정형 문서를 보편적인 컨텍스트 컨테이너로 활용하는 것이 중요하다.
문서 구문 분석 계층과 의미 및 저장 계층, 그리고 반복적 워크플로를 담는 에이전트 계층이 플랫폼의 핵심이다.
첫째, PDF, PowerPoint, Word 문서를 디지털화하고 마크다운 및 메타데이터로 변환하는 문서 구문 분석 계층, 둘째, 사람이 파일을 관리하듯 에이전트 인터페이스를 통해 문서를 조작하는 의미 및 저장 계층, 셋째, 송장이나 KYC(고객 알기)와 같은 반복적인 워크플로를 플랫폼 내에 인코딩하는 에이전트 계층이 그것이다.
PDF는 텍스트를 좌표값을 가진 개별 문자로 저장하여 인쇄에 최적화된 형식이기 때문에, AI 에이전트가 문자를 텍스트 블록으로 재구성하고 문맥을 파악하는 데 어려움을 겪는다.
특히 표는 구조가 아닌 선분과 텍스트의 집합으로 표현되며, 다단 레이아웃 문서의 경우 읽는 순서가 비논리적일 가능성이 있어 에이전트가 올바른 의미를 추론하기 어렵게 만든다.
따라서 어떤 문자나 도형이 무엇에 해당하는지 추론하는 데 큰 기술적 난제가 따른다.
문서 이해를 위한 파이프라인 기반 방식은 휴리스틱을 이용해 텍스트 클러스터링 및 표를 식별하지만, 비전 기반 모델(VLM)은 문서를 시각적으로 한 번에 변환하면서도 비용이 높고 텍스트 위주 페이지에서 오류가 발생할 수 있다.
파이프라인 방식은 PyPDF와 같은 도구를 사용하여 텍스트 블록을 구성하고 간단한 표를 식별하는 데 초점을 맞춘다.
따라서 파일 컨테이너와 바이너리 파일을 심층적으로 이해하는 파이프라인 방식과 비전 기반 방식을 결합하여 비용과 정확도 측면에서 최적점을 찾는 하이브리드 방식을 개발하는 것이 목표다.
AI 에이전트의 포괄적인 기업 문서 처리 능력을 평가하기 위해 ParseBench가 개발되었다.
이 벤치마크는 금융, 보험, 제조, 법률 등 다양한 분야의 복잡한 기업 문서 처리 역량을 측정하며, 기존 모델들의 한계를 보완하고자 2,000페이지 분량의 데이터셋을 활용한다.
표와 차트, 내용 충실도 및 의미론적 형식을 기준으로 삼아 AI 에이전트의 문서 이해도를 측정한다.
이는 표, 차트, 내용 충실도, 의미론적 형식을 기준으로 측정되며, parsbench.ai를 통해 50개 이상의 최첨단 오픈 웨이트 모델 및 OCR 솔루션이 벤치마킹되고 있다.
정확도와 비용의 균형을 맞추기 위해 파레토 곡선 상에서 높은 효율성을 확보해야 한다.
이는 다양한 유형의 문서 분포에 대응하기 위해 곡선의 모든 지점을 포괄해야 함을 의미하며, 벤치마크의 복잡성이 높아질수록 문서 이해는 여전히 해결해야 할 과제로 남아있다.
에이전트 전략은 사용 목적에 따라 고정밀 영역과 저비용 영역으로 나뉜다.
금융, 보험과 같은 규제 산업의 고정밀 영역에서는 재무 모델 오류 방지를 위해 비용을 감수하고 99%에서 100%에 가까운 정확도를 추구한다. 반면, 백만 개 이상의 문서를 색인화하는 저비용 영역에서는 에이전트의 깊은 분석을 통해 오류를 보정하는 확장 가능한 오프라인 인덱싱 구축이 중요하다.
VLM(가상 텍스트 머신)은 심층 분석에 유리하지만 실시간 처리를 위한 낮은 지연 시간 솔루션이 필요하다.
Rust 기반으로 개발된 오픈 소스 파서 'Light Parse'는 현재 가장 빠르고 정확한 마크다운 파싱을 제공하며, 에이전트 루프에서 Light Parse로 빠르게 문서를 스캔한 후, 표나 차트가 있는 복잡한 페이지에만 VLM 도구를 활용하는 하이브리드 방식이 도입된다.
이 방식은 비용 효율성을 높이고 빠른 응답 시간을 보장한다.
높은 정확도를 유지하며 상세 참조 정보와 신뢰도 점수를 제공하는 것이 대규모 파이프라인의 핵심이다.
이 시스템은 높은 정확도를 유지하며 원본 문서에 대한 상세 참조 정보와 신뢰도 점수를 제공하고, BM25, grep 등 확장된 도구 세트를 통해 검색 기능을 강화한다.
저희 기능의 대부분은 매우 높은 정확도를 유지 하면서 비용을 최소화 하는 데 중점을 두고 있습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 85편 올렸어요.