정신 모델을 통한 에이전트 측정
이 프레임워크는 에이전트의 성능과 가치를 보다 명확하게 이해할 수 있도록 돕는 것을 목표로 합니다.
그는 "오늘 저는 마우스파워에 대해 이야기할 것입니다. 이것은 정신 모델을 통해 에이전트를 측정하는 것에 대한 이야기입니다."라고 말했습니다. 핵심 아이디어는 사용자가 계산 자원, 특히 토큰이 에이전트에 의해 효율적이고 효과적으로 사용되는지 평가하는 데 도움이 되는 새로운 측정 단위를 설정하는 데 있습니다.
맥시밀리언 피라스는 AI 에이전트 성능 정량화의 어려움을 논의하고 '마우스파워'를 새로운 측정 단위로 제안합니다.
이 프레임워크는 에이전트의 성능과 가치를 보다 명확하게 이해할 수 있도록 돕는 것을 목표로 합니다.
그는 "오늘 저는 마우스파워에 대해 이야기할 것입니다. 이것은 정신 모델을 통해 에이전트를 측정하는 것에 대한 이야기입니다."라고 말했습니다. 핵심 아이디어는 사용자가 계산 자원, 특히 토큰이 에이전트에 의해 효율적이고 효과적으로 사용되는지 평가하는 데 도움이 되는 새로운 측정 단위를 설정하는 데 있습니다.
그는 사용자의 주된 관심사가 다른 곳에 있는 동안 에이전트가 디자인 탐색이나 다른 주변 작업을 도울 수 있다고 설명했습니다.
그는 "내 적극적인 주의가 한 가지에 집중되어 있지만… 나는 여전히 주변 작업에서 어느 정도 진전을 이루고 싶다"고 언급했습니다. 이러한 기능은 종종 사용자가 여러 에이전트를 동시에 실행하게 하여 직접적인 인간의 개입 없이 다양한 분야에서 진행을 가능하게 합니다.
처음에는 흥미롭지만, 청구서가 도착하면 흥분은 종종 사그라들고, 지출된 토큰에서 얻은 실제 가치에 대한 의문이 제기됩니다.
피라스는 "물론 청구서를 받을 때까지는 매우 즐겁지만, 그 다음에는 그만한 가치가 있었는지 의아해하기 시작하죠?"라고 말했습니다. 이 감정은 에이전트 효율성이 극대화되었는지, 투자가 정당했는지 명확히 이해하지 못한 채 사용자가 토큰 예산을 소진하는 일반적인 과제를 강조합니다.
유토리는 에이전트가 인간과 유사하게 컴퓨터를 작동하도록 학습하는 컴퓨터 사용 모델을 구축하는 데 중점을 둡니다. 이러한 모델은 기존 API 또는 MCP(Master Control Programs)를 사용할 수 없는 환경에서 중요한 다리 역할을 합니다.
피라스는 "우리는 컴퓨터 사용 모델에 중점을 둡니다. 이는 인간처럼 컴퓨터를 사용하는 법을 배우는 모델입니다."라고 설명했습니다. 이 접근 방식은 에이전트를 최후의 수단으로B위치시켜, 인간의 입력과 의사 결정을 모방함으로써 복잡하고 비표준화된 디지털 환경에서 자동화와 상호 작용을 가능하게 합니다.
에이전트에 대한 상당한 기대에도 불구하고, 많은 사용자들은 잠재력의 극히 일부만 활용하고 있다고 느낍니다. 이는 종종 최적의 사용 사례와 배포에 따른 절충점에 대한 혼란으로 이어집니다.
피라스는 "많은 사람들이 에이전트에 대해 흥분하지만, 자주 나오는 표현은 그들이 잠재력의 극히 일부만 활용하고 있다고 느낀다는 것입니다."라고 말했습니다. 문제는 초기 열정을 실제 효용성으로 전환하는 데 있으며, 최적의 애플리케이션에 대한 보다 명확한 지침과 진정한 기능에 대한 더 나은 이해가 필요합니다.
맥시밀리언 피라스는 얼리 어답터의 내재된 편향을 강조하며, 그들의 현재 토큰 사용량이 더 넓은 시장의 표준이라고 가정하는 것에 대해 경고했습니다. 그는 새로운 기술에 대한 그들의 열정이 일반 대중의 요구 사항이나 이해를 반드시 반영하는 것은 아님을 청중에게 상기시켰습니다.
그는 "이 방에 있는 모든 사람들은 매우 편향되어 있고 우리는 얼리 어답터이며 이 새로운 기술을 탐구하는 데 매우 흥분하고 있지만, 그것이 우리가 궁극적으로 이 기술을 채택하도록 돕고자 하는 사람들을 대표한다는 의미는 아닙니다."라고 강조했습니다. 이러한 구별은 초기 열광자들의 틈새 매력을 넘어 더 넓은 청중에게 접근 가능하고 가치 있는 에이전트를 개발하는 데 중요합니다.
제임스 와트는 말 기반의 방아간에 익숙한 시장에 증기기관을 도입해야 하는 과제에 직면했을 때, 잠재 고객들의 일반적인 정신 모델을 이해할 필요가 있었습니다. 그의 목표는 동물 기반이었던 방아간의 표준 동력원을 새로운 기계식 동력원으로 대체하는 것이었습니다.
피라스는 "그는 증기기관의 훌륭한 사용 사례가 말 방아간을 대체하려는 것이라고 결정했습니다. ... 그는 이 사람들의 정신 모델을 이해해야 했고, 특히 효율성의 상대적 개선에 대한 기준을 제공하는 데 도움이 되는 측정 단위를 만들어야 했습니다." 와트는 사용자들이 살아있는 동물에서 '차가운 기계'로 전환하면서 겪을 인지 부조화를 인식했습니다. 그의 해결책은 기존의 동력 출력 이해와 공감할 수 있는 용어로 상대적 효율성 향상을 정량화하기 위해 '마력'이라는 새로운 측정 단위를 고안하는 것이었습니다.
'마력' 측정 단위는 엄밀히 과학적이거나 완벽하게 정확하지는 않았지만, 의사소통 도구로서 매우 효과적이었습니다. 주요 기능은 가치와 효율성의 증가를 명확하게 보여주어, 회의적인 사용자들에게 새로운 기술을 더욱 매력적으로 만드는 것이었습니다.
피라스는 "이 측정 단위는 당시에는 그다지 과학적이지 않았습니다. 심지어 정확하다고 할 수도 없었죠. 하지만 가장 중요한 점은 가치의 증가를 전달했다는 것입니다."라고 언급했습니다. 이러한 명확성은 채택을 장려하기에 충분했는데, 사용자들이 익숙한 용어로 실질적인 이점을 이해할 수 있게 하여, 명확한 투자 수익률에 초점을 맞춰 전통적인 방법에 대한 감정적 선호도를 효과적으로 우회했습니다.
맥시밀리언 피라스는 고객에게 실질적인 투자 수익률(ROI)을 제공할 수 없는 것이 AI 에이전트의 가치를 전달하는 것을 불가능하게 한다고 주장했습니다. 이 문제는 현재 기업들이 비용을 정당화하는 데 어려움을 겪으면서 광범위한 산업 채택을 방해하고 있습니다.
피라스는 "만약 우리가 고객에게 실질적인 ROI를 제공할 수 없다면, 가치를 전달하기가 매우 어렵습니다."라고 말했습니다. 업계는 에이전트 가치에 대한 표준화된 측정 단위가 없기 때문에 인센티브 불일치와 '토큰 최대화'로 알려진 토큰 예산의 조기 소진과 같은 문제에 직면해 있습니다.
이러한 순환은 사용자들이 반복적으로 '토큰 최대화'를 통해 절약 모드로 들어가게 한다고 그는 주장했습니다.
피라스는 "현재 우리는 과소비와 활용 부족의 악순환에 빠져 있다고 생각합니다. ... 이것은 우리가 단지 토큰 최대화를 통해 긴축 재정으로 가는 악순환과 같습니다." 사용자는 과도한 지출과 기술 이탈 사이를 자주 오가며, FOMO(놓치는 것에 대한 두려움)에 이끌려 다시 돌아옵니다. 그는 이러한 자멸적인 패턴을 깨려면 보다 정확한 성능 및 가치 측정 단위를 개발해야 한다고 제안했습니다.
코인베이스 CEO는 최근 AI 모델 사용에 대한 내부적 접근 방식의 변화를 보여주는 차트를 공유했습니다. 그들은 기본 모델을 변경하기 시작했고, 최첨단 모델은 가장 어려운 작업에만 사용하도록 예약하여 AI 지출과 순수 토큰 사용량 간의 차이를 만들었습니다.
피라스는 "최근 X에 코인베이스 CEO가 올린 차트가 있었습니다. 그들은 내부적으로 어떤 모델을 시작할지 기본값을 변경하기 시작했고, 최첨단 모델을 가장 어려운 작업에만 사용하려고 노력한 결과, AI 지출이 토큰 사용량과 분리되기 시작하는 좋은 징후를 보였습니다."라고 언급했습니다. 이러한 변화는 단순히 토큰 소비를 추적하는 것보다 결과 기반 측정으로의 전환을 반영하지만, 깨끗한 결과 없이 ROI를 효과적으로 측정하는 것은 여전히 어렵습니다.
피라스는 코딩 에이전트가 코드 생성을 개선했지만, 병목 현상이 인간 코드 검토로 옮겨갔다고 지적했습니다. 생성된 코드를 검토하는 데 대부분의 시간을 보내기 때문에 효율성 향상이 완전히 실현되지 않고 있습니다.
피라스는 "병목 현상이 이제 인간 검토로 옮겨갔습니다. 코딩 에이전트의 효율성 향상은 우리가 코드 검토에 대부분의 시간을 보내기 때문에 아직 완전히 나타나지 않고 있습니다."라고 설명했습니다. Anthropic 팀도 코드 생성의 발전에도 불구하고 코드 검토는 해결되지 않은 문제로 남아 있으며, 진정한 효율성을 달성하기 위해 검증 프로세스를 다룰 필요가 있음을 시사한다고 언급했습니다.
노아 하인(Noah Hine)은 AI 에이전트가 도입하는 새로운 패러다임을 수용하기 위해 이러한 전통적인 표준을 조정할 것을 옹호합니다.
피라스는 "문화적으로 코드 검토는 공유된 가정에 대해 매우 좋은 수렴을 가지고 있으며, 이는 우리가 모두 측정에 대해 수렴할 수 있을 때 규모에 따라 사물을 측정할 수 있게 하고, 어느 정도 명확한 기준이 됩니다."라고 설명했습니다. 문화적 관행으로서 코드 검토는 효과적으로 확장하기 위해 공유된 가정에 의존합니다. 에이전트를 사용하면 작업에 대한 확장 가능하고 일관된 측정을 허용하도록 이러한 가정이 발전해야 합니다.
와트가 동력의 기준을 만들었듯이, 목표는 인간-컴퓨터 상호 작용 효율성에 대한 유사한 기준을 설정하는 것입니다.
피라스는 "이것이 에이전트 시대의 마력과 동등한 마우스파워라는 아이디어로 이어집니다. 제임스 와트가 당시 동력원이었던 방아간의 말에 비해 효율성 측정을 보여줄 수 있었던 것처럼. 우리도 효율성의 기준을 어떻게 만들지 알아낼 수 있을 것입니다."라고 자세히 설명했습니다. 이 측정 단위는 에이전트가 특정 작업에서 인간보다 측정 가능하게 뛰어날 수 있음을 보여줌으로써 실질적인 투자 수익률을 증명하는 것을 목표로 합니다.
그 목적은 개발자에게 에이전트가 작업을 효과적으로 수행하고 있는지 사용자가 검증하는 데 도움이 되는 기준을 제공하는 것입니다.
피라스는 "마우스파워는 물론 측정 단위가 될 수는 없지만, 에이전트를 판매하려면 이 에이전트가 제대로 작동하고 있는지 실제로 어떻게 검증할 것인가에 대한 기준을 사용자에게 제공해야 한다는 아이디어에 가깝습니다."라고 말했습니다. 이 개념은 에이전트에 지출된 토큰이 가치 있고 검증 가능한 작업으로 전환되는지 판단하는 중요한 과제를 다루며, 사용자가 투자 가치를 정확하게 평가할 수 있도록 보장합니다.
확률 분포의 불확실성으로 정의되는 엔트로피는 에이전트가 현재 훈련되는 방식의 기초를 형성합니다.
피라스는 "클로드 섀넌의 정보 엔트로피 측정에 대한 아이디어로 돌아가서, 엔트로피는 확률 분포의 불확실성이며 물론 오늘날 우리가 에이전트를 훈련하는 방식의 기초입니다."라고 언급했습니다. 개발자는 정보 이론을 에이전트 평가 및 훈련에 효과적으로 활용하기 위해 작업 단계의 본질적인 복잡성과 수용 기준의 명확성을 모두 고려해야 합니다.
피라스는 "에이전트가 작업을 수행할 수 있을 뿐만 아니라, 실제로 누군가를 도울 수 있는지 또는 실제로 어떻게 등급이 매겨지는지에 대한 명확한 기준이 있는지"를 강조했습니다. 그는 효과적인 에이전트가 출력을 검증하기 위한 명확하고 잘 정의된 기준이 있을 때 가장 잘 수행되어, 그 기여가 측정 가능하고 가치 있도록 보장한다고 강조했습니다.
피라스는 최적의 에이전트 작업을 'NP-스타일' 문제와 유사한 것으로 식별했습니다. 즉, 실행하는 것보다 검증하는 것이 더 쉽다는 의미입니다. 이러한 특성은 에이전트 효용성의 최적 지점을 나타내며, 효율성과 가치를 극대화합니다.
피라스는 "그것들은 NP 스타일 문제의 형태를 띠게 되는데, 이는 실행하는 것보다 검증하는 것이 더 쉽다는 의미입니다. 그리고 제가 이렇게 말하는 이유는 작업 검증을 위한 상당히 반복 가능한 패턴을 찾아낼 수 있다면, 그 문제에도 에이전트를 투입할 수 있기 때문입니다."라고 설명했습니다. 검증 프로세스를 표준화함으로써 개발자는 추가 에이전트를 배포하여 주요 에이전트의 출력을 확인하고, 낭비되는 토큰을 최소화하며 에이전트가 실질적인 가치를 제공하도록 보장할 수 있습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 16편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.