공개 벤치마크와 비공개 성능 간의 괴리
특히 Meta의 Llama 4 모델 출시 당시, 자체 보고된 벤치마크 결과와 독립적인 고품질 평가 결과 간에 큰 차이가 관찰되었습니다. 이는 모델 개발자들이 공개 벤치마크에 맞춰 모델을 최적화하는 경향이 있기 때문으로, 이러한 최적화는 모델의 실제 능력을 객관적으로 평가하기 어렵게 만듭니다.
공개 벤치마크의 한계와 AI 모델의 자율성 증대로 새로운 평가 시스템의 필요성이 커지고 있습니다.
특히 Meta의 Llama 4 모델 출시 당시, 자체 보고된 벤치마크 결과와 독립적인 고품질 평가 결과 간에 큰 차이가 관찰되었습니다. 이는 모델 개발자들이 공개 벤치마크에 맞춰 모델을 최적화하는 경향이 있기 때문으로, 이러한 최적화는 모델의 실제 능력을 객관적으로 평가하기 어렵게 만듭니다.
이러한 외부 평가는 모델이 특정 방향으로 발전하고 있다는 객관적인 데이터를 제공하여, 연구소의 대규모 투자가 성공적이라는 것을 보여주는 핵심적인 방법으로 부상하고 있습니다.
이를 위해 대규모 분산 처리 인프라에 투자하고 '스티브'와 같은 자동화 시스템을 도입하여 평가 속도를 극대화하고 있습니다. 현재 인간의 개입이 필요한 작업을 자동화 시스템으로 전환하는 과정이 진행 중입니다. 이러한 자동화는 모델 출시 속도를 저해하지 않으면서 가용 용량과 속도 제한 내에서 최대한 많은 평가 신호를 추출하는 것을 목표로 합니다.
과거 엔터프라이즈 소프트웨어에서는 프로젝트를 단계별로 순위를 매기고 특정 기능 유무로 회사를 평가할 수 있었습니다. 그러나 AI 시대로 넘어오면서 이러한 정형화된 지표 기반의 평가 방식은 더 이상 유효하지 않게 되었습니다. AI 모델의 성능은 측정하기 매우 어려운 불확실한 경계에 놓여 있어, 기존 방식으로는 제대로 평가하기 어려운 상황입니다.
감사 책임 주체가 컨설팅과 지원을 동시에 맡으면 감사 통과나 벤치마크 통과 자체가 목적이 될 수 있기 때문입니다. 이러한 원칙은 평가의 객관성을 유지하고, 벤치마크 점수를 높이는 데 급급한 상황을 경계하기 위함입니다.
모델 스스로 학습하는 RSI(재귀적 자기 개선)는 비용과 속도 문제로 제한적입니다. 이에 차세대 모델 구축 과정의 각 단계를 대변할 수 있는 일련의 프록시를 구성하여 평가합니다. 이러한 프록시는 사전 학습, 사후 학습, 그리고 하네스 수준의 엔지니어링과 관련된 작업들을 포괄하여 모델의 연구 수행 메커니즘과 동작 방식을 파악하는 데 활용됩니다. 이를 통해 모델의 성능을 효율적으로 검증하고 개선 방향을 모색합니다.
AI 에이전트 시대가 도래하면서 비동기식 백그라운드 에이전트의 수가 증가하고 있습니다. 이에 따라 모델이 몇 시간, 며칠, 때로는 몇 주 동안 작동하는 능력을 테스트하는 장기간 평가가 중요해졌습니다. 평가는 단순히 성능뿐만 아니라 비용, 지연 시간, 그리고 도메인 유연성까지 포괄하며, 복잡한 작업을 안정적으로 수행할 수 있는 인프라의 중요성이 더욱 강조되고 있습니다.
'Open Router'와 같은 명칭은 때때로 오해를 불러일으키지만, 실제 사용량 대부분은 특정 애플리케이션에 어떤 지능형 모델을 사용해야 할지 결정하는 평가 시스템에서 발생합니다. 따라서 어떤 모델을 선택하고 적용할지에 대한 정교한 평가 시스템을 구축하는 것이 가장 어려운 부분이자 중요한 과제입니다.
지능의 폭발적인 성장으로 파운데이션 모델 선택지가 급증하면서, 많은 기업이 사내 전문성을 키워 자체 평가 역량을 강화해야 하는 상황에 놓였습니다. 그러나 복잡한 에이전트 환경에서 기업이 내부 평가 역량을 개발하는 것은 매우 어려운 과제입니다. 모든 기업이 자체적으로 평가 전문성을 갖추기 어렵다는 점에서, 외부 전문가의 지원도 함께 고려해야 합니다.
많은 기업들이 사내 전문성을 키우는 것을 권장하지만, 그것만이 유일한 해결책이 되어서는 안 된다고 생각합니다.
이 도구는 GitHub 코드 베이스를 활용하여 자체 코딩 벤치마크를 구축하고, 파레토 최적 및 투자 대비 효율(ROI) 파악을 지원합니다. 이를 통해 기업은 코드 생성 AI 모델의 실제 가치와 성능을 효과적으로 측정할 수 있습니다.
코딩 평가는 미래의 지식 노동 평가 전반을 예측하는 중요한 신호탄으로 간주됩니다. 많은 산업 분야에는 이미 업무가 어떻게 이루어져 왔는지에 대한 방대한 데이터 저장소가 축적되어 있습니다. 이 데이터를 활용하여 파워포인트나 엑셀 등 다른 업무 영역의 평가 메커니즘으로 체계화하는 것이 향후 과제입니다. 즉, 코딩 평가를 통해 얻은 경험과 기술을 다른 지식 노동 분야로 확장 적용하려는 움직임이 활발합니다.
AI 모델은 모든 도구에 대한 접근 권한을 부여하며, GitHub 이슈나 티켓이 발생하면 작업 시작 지점을 자동으로 추천합니다. 또한, 작업에 필요한 지능 수준에 맞춰 실제 토큰 사용량을 조절함으로써 효율성을 극대화합니다. 이러한 유연한 토큰 기반 모델 활용은 현행 업무 프로세스를 지능적으로 최적화하여 생산성 향상에 기여합니다.
정부 규제 절차가 기술 혁신 속도를 늦추지 않도록 하는 것과, 기술 개발이 전 인류의 이익에 부합하도록 보장하는 것은 상충하는 두 가지 힘입니다. 이 둘을 조화시키기는 매우 어렵지만, 제3자 평가자는 정책 입안자들이 기술의 이점을 이해하도록 돕고, 실제 현장에서 적용 가능한 평가 기술을 개발하는 역할을 수행합니다. 이를 통해 평가 방법론을 발전시켜 기술 발전 속도를 따라잡고, 정부 규제와 기술 혁신 사이의 균형을 맞출 수 있습니다.
평가는 모델이 사용자 의도에 맞게 정렬되어 있는지 확인하는 데 중점을 둡니다. 모델이 의도와 다른 행동을 보이는 증거가 발견될 경우, 이는 정렬 범주 안에서의 폭넓은 위험을 의미하며, 이를 해결하기 위한 노력이 필요합니다.
AI 모델 배포에 대한 이론적 담론과 실제 기업 환경 사이에는 큰 간극이 존재합니다. 기업마다 구축 환경이 크게 다르고, 사람들이 모델을 사용하는 방식 또한 매우 맞춤화되어 있기 때문입니다. 따라서 실제 사례와 연결된 담론은 드물고, 모델이 실행되는 환경의 특성을 고려한 가이드라인과 규칙 기반을 마련하는 것이 중요합니다. 역량을 갖춘 전문가가 이러한 가이드라인을 현장에 적용하여 사람들이 안심하고 모델을 사용할 수 있도록 돕는 과정이 필수적입니다.
AI 모델 평가는 개발자가 추구하는 가치관을 반영하는 중요한 지표입니다. 중국을 비롯한 각 국가의 연구소들은 중요시하는 가치와 평가 기준이 상이하여, 이는 AI 모델의 표준화에 영향을 미칩니다. 오픈 소스 모델 역시 사상적 제약이 있을 수 있으며, 지역별 평가 기준 논의는 AI 기술의 윤리적, 사회적 영향을 이해하는 데 필수적입니다.
서로 다른 지역의 다양한 모델 연구소들이 평가와 벤치마크를 어떻게 다루고, 그것이 표준화에 어떤 역할을 한다고 생각 하시나요?
AI의 재귀적 자기 개선과 관련하여, 우리가 수용할 수 있는 개발 속도인지, 아니면 그 속도를 초과하는 것인지에 대해 국제 사회가 공동으로 평가하고 기술할 수 있는 방법을 갖추는 것이 매우 중요합니다. 사이버 및 생물 보안과 같이 상호 이익이 명확한 분야부터 협력을 시작하여, 재귀적 자기 개선 모델이 초래할 수 있는 통제 불능 상태를 경고하고 국제 사회가 기술 발전 속도를 공동으로 조절할 방법을 모색해야 합니다.
valis.ai와 같은 도구를 활용하여 기업용 클라우드 인프라나 전력망과 같은 더 큰 환경을 시뮬레이션해야 합니다. 고품질 평가를 수행하기 위한 시장 인센티브를 제공하여, AI 모델의 실제 위험 요소를 정확하게 문서화하고 관리하는 새로운 평가 체계를 구축해야 합니다.
Answers come from the transcript, with the exact spot cited.
Want the next one from this channel too?
When a16z publishes, we'll write it up like the one you just read and email it to you.
We skip Shorts. You can unfollow any time.
AI Reshapes Venture Capital's Power Lawa16zyesterday · 48:19 · 337 views · Created yesterday
OpenAI Models Advance Math, Solving Long-Standing Problemsa16z3 days ago · 1:05:16 · 181 views · Created 3 days ago
Atlas AI Unifies 3D, Generative, and Robotic Intelligencea16zlast week · 43:43 · 1 views · Created last week