AI 에이전트를 지식 근로자로 재정의하기
그는 현재 에이전트가 지식 작업이 수반하는 전체 범위를 놓치는 경우가 많다고 강조합니다.
지식 작업은 본질적으로 모호한 정보를 처리하여 실행 가능한 결정이나 판단을 도출하는 것을 포함하며, 코딩은 훨씬 더 큰 도메인 내의 하나의 특정 응용 프로그램일 뿐입니다.
AI 에이전트는 코딩 작업을 넘어 지식 작업의 광범위하고 모호한 요구 사항을 처리하도록 발전해야 합니다.
그는 현재 에이전트가 지식 작업이 수반하는 전체 범위를 놓치는 경우가 많다고 강조합니다.
지식 작업은 본질적으로 모호한 정보를 처리하여 실행 가능한 결정이나 판단을 도출하는 것을 포함하며, 코딩은 훨씬 더 큰 도메인 내의 하나의 특정 응용 프로그램일 뿐입니다.
2022년 초기의 AI 에이전트는 주로 간단한 검색 증강 생성(RAG) 작업을 처리하여 기본적인 상식을 제공하고 진정한 도구 호출 기능이나 복잡한 조건부 논리가 부족했습니다.
이후 산업계의 초점은 주로 코딩 에이전트 개발로 옮겨갔고, 이는 지식 작업의 특정하고 제한된 형태를 보여주는 지배적인 응용 프로그램이 되었습니다.
이러한 유형의 작업은 모호하고 분산된 정보를 정확하고 실행 가능한 판단이나 결정으로 추출하는 복잡한 과정을 포함하며, 이는 전문가들에게 핵심적인 기능입니다.
서비스 경제는 변호사, 계리사, 연구원 등 다양한 역할을 포괄하는 지식 작업에 크게 의존하며, 이들 모두 정보를 전문적인 결과물로 변환합니다.
코드는 ID, 파일 경로, 키워드와 같이 내구성이 뛰어나고 구조화된 참조의 이점을 누리는 지식 작업의 독특한 하위 집합을 구성합니다.
이러한 본질적인 구조는 코드베이스 내에서 명확하고 쉽게 찾을 수 있는 단서를 제공하여 광범위하고 종종 모호한 법률 또는 학술 연구 분야에 비해 에이전트 처리에 더 적합합니다.
결과적으로 현재 에이전트의 강력한 프로그래밍 작업 기능은 지식 도메인의 근본적인 구조적 차이로 인해 심층 연구로 직접 연결되지 않습니다.
코딩 에이전트는 명확하게 정의된 기능과 명시적인 티켓 내에서 작동하여 작업에 대한 구조화된 환경을 제공합니다.
대조적으로 지식 작업은 본질적으로 명확한 기능 정의나 엄격한 구문 규칙이 부족하여 맥락과 해석이 중요합니다.
예를 들어, '30일'이라는 용어는 특정 맥락에 따라 마감일, 유예 기간 또는 보존 규칙을 의미할 수 있으며, 이는 지식 작업에 존재하는 모호성을 강조합니다.
지식 작업의 의미는 종종 암묵적이며 명시적인 지시 없이는 현재 AI 모델이 완전히 이해하기 어려운 심층적인 도메인 지식에 크게 의존합니다.
지식 작업에서 검색 프로세스는 미리 정의된 매개변수가 아닌 사용자 의도에서 시작되므로 보다 동적이고 적응적인 접근 방식이 필요합니다.
따라서 에이전트는 초기 작업 설명에 명시적으로 포함되지 않은 국제 규범 및 조건부 정보를 평가해야 합니다.
이러한 의미 기반 작업은 간단한 코드 실행보다 훨씬 더 복잡하며, 맥락과 뉘앙스에 대한 정교한 이해를 요구합니다.
'도구 루프'는 구전 전통에서 문자로 발전했으며, 알렉산드리아 도서관 목록으로 예시되고 현대 검색 엔진으로 정점을 찍으며 지식 접근 방식을 발전시켰습니다.
동시에 '조직 루프'는 개별 박식가에서 수도원 및 대학과 같은 구조화된 기관으로 발전하여 궁극적으로 오늘날의 전문 관료제로 이어졌습니다.
이 두 루프는 단일 자체 최적화 시스템으로 작동하며, 지식의 발전은 더 나은 도구의 생성을 촉진하고, 이는 다시 그 지식을 관리하기 위한 새로운 조직 구조와 역할을 필요로 합니다.
개선된 도구는 비용을 크게 절감하여 지식의 접근성을 높이고 달성할 수 있는 범위도 넓힙니다.
예를 들어, 알렉산드리아 도서관에서 원고를 찾는 데 목록이 없으면 몇 주가 걸릴 수 있지만 목록이 있으면 몇 분이면 되는 것처럼 도구가 효율성을 얼마나 극적으로 변화시키는지 보여줍니다.
향상된 접근성은 인간이 새로운 지식을 얼마나 자주, 쉽게 찾고 통합하는지에 직접적인 영향을 미쳐 더 큰 혁신과 발견을 촉진합니다.
기존 BM25 검색 방법은 무제한 검색 시도가 허용되더라도 정확한 정보를 검색하는 데 지속적으로 실패하며, 이는 효율성의 근본적인 병목 현상을 강조합니다.
OCR(광학 문자 인식) 텍스트에 대한 과도한 의존은 텍스트 변환 오류가 검색 프로세스 전체에 전파되므로 상당한 성능 병목 현상을 초래합니다.
결과적으로 현대 검색 도구는 이러한 본질적인 성능 한계를 극복하기 위해 표준 텍스트 기반 검색을 넘어 발전해야 합니다.
Jina와 Mixedbread가 개발한 도구는 완전한 멀티모달리티를 활용하여 시각적 및 의미론적 맥락을 통합하여 검색 기능을 향상시킵니다.
시각적 맥락의 통합은 검색 정확도를 크게 향상시켜 검색을 더 정확하고 포괄적으로 만듭니다.
우리는 PDF를 처리할 수 있는 모델을 가지고 있습니다. 우리는 비전을 가지고 있습니다. OCR 텍스트에 의존할 필요가 없습니다.
Mixedbread는 복잡한 쿼리를 더 작고 관리하기 쉬운 하위 작업으로 분해하는 분해된 에이전트 아키텍처를 도입하여 효과적인 인간의 문제 해결 전략을 반영합니다.
이 시스템에서 하위 에이전트는 독립적으로 정보를 검색한 다음 발견한 내용을 주 에이전트에게 요약하고, 주 에이전트는 이러한 요약을 종합하여 원래의 복잡한 질문에 답변합니다.
이러한 작업 분해 접근 방식은 정확도에서 3.5% 향상을 보여주며, 구조화된 협업 에이전트 설계의 이점을 보여줍니다.
'오라클 격차'는 이상적인 문서 검색과 주어진 검색 시스템의 실제 성능 간의 차이를 정량화하며, 평가의 핵심 지표로 사용됩니다.
아키텍처 개선 및 에이전트 활용을 통해 이 성능 격차는 성공적으로 10점대에서 6점대로 줄었습니다.
이러한 개선은 실수에서 40%의 눈에 띄는 감소로 이어져 에이전트 시스템의 신뢰성과 정확성을 크게 높였습니다.
법률 및 의료 분야와 같은 산업은 지식 및 워크플로를 구성하기 위한 확립된 템플릿을 제공하며, 이는 에이전트 아키텍처를 위한 귀중한 청사진 역할을 합니다.
따라서 에이전트 설계는 프로그래밍 패러다임에 국한되지 않고 이러한 효과적인 인간 지식 관리 전략을 모방해야 합니다.
도구는 그 자체로 존재하는 것이 아니라 본질적으로 성능 한계를 극복하고 불가능하거나 비실용적일 수 있는 작업을 가능하게 하도록 설계됩니다.
모델은 복잡한 워크플로 내에서 다양한 필요와 기능에 맞게 조정된 각각의 특정 도구를 별개의 기본 요소로 인식하도록 갖춰져야 합니다.
효과적인 에이전트는 시맨틱 검색과 키워드 검색 중 어떤 것을 적용할지 구별하기 위한 명시적인 훈련이 필요하며, 각 쿼리에 가장 적합한 도구를 선택하도록 합니다.
궁극적으로 효과적인 에이전트는 지식을 조직화할 수 있어야 합니다. 왜냐하면 어떤 단일 모델도 전 세계 법률 코드 또는 기타 방대한 지식 도메인 전체를 포괄할 수 없기 때문입니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 33편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.