개방형 AI 연구 벤치마크의 필요성
AI가 과학 연구에서 점점 더 표준적인 도구가 됨에 따라, 이러한 모델이 작업을 수행하는 방식을 이해하고 독립적으로 검증하는 것이 중요합니다.
프라임 인텔렉트의 실험에서 AI 에이전트인 클로드 코드와 코덱스가 GPT-2 훈련 최적화에서 인간의 기록을 깼습니다. 이는 독립적인 AI 연구 벤치마크의 필요성을 강조합니다.
AI가 과학 연구에서 점점 더 표준적인 도구가 됨에 따라, 이러한 모델이 작업을 수행하는 방식을 이해하고 독립적으로 검증하는 것이 중요합니다.
이 도전은 켈러 조던(Keller Jordan)과 같은 개인들의 기여로 커뮤니티 내에서 진화했으며, 원래 GPT-2와 동일한 목표 검증 손실을 달성하는 것을 목표로 기록을 2분 미만으로 단축했습니다.
Adam 또는 Shampoo로 전환하는 것과 같은 수정을 허용하는 이 제한은 단순히 계산 속도를 최적화하는 것에서 진정으로 우수한 최적화 방법을 발견하는 것으로 초점을 옮겨, 더 연구 지향적인 도전으로 만듭니다.
스피드런은 AI 모델 성능을 평가하기 위한 명확하고 검증 가능한 지표를 제공하므로 자동화된 AI 연구에 적합한 환경입니다.
또한 AI 모델이 기존 기록을 능가할 때 긍정적인 보상 피드백을 제공하여 훈련 메커니즘으로 기능하며, 한 번 실행당 약 15~20분의 빠른 반복 주기를 가능하게 합니다.
이러한 규칙의 객관적인 특성은 AI 연구 방법론에서 획기적인 발견을 촉진합니다.
엔지니어들은 이러한 에이전트들을 주기적으로 V1, V2, V3의 다른 버전에서 재시작했으며, 에이전트들은 최근 인간의 진보를 기반으로 구축하도록 프롬프트된 후 궁극적으로 인간 기록을 깨는 데 성공했습니다.
새로운 아이디어 생성을 장려하기 위해 '신규성 트랙'도 도입되었는데, 이는 모델들에게 더 중요한 도전임이 입증되었습니다.
인간이 컴퓨팅 노드에 접근할 수 있도록 보장하기 위해, 이러한 작업은 '선점 가능'하도록 구성되어 인간 사용자가 노드를 필요로 할 경우 취소될 수 있도록 했습니다.
시스템은 새로운 기록의 합법성을 확인하고 무작위적인 개선이 등록되는 것을 방지하기 위해 통계적 임계값에 대해 엄격하게 검증했습니다.
클로드 코드(Claude Code)는 9~10시간마다 작업을 자주 일시 중지하고 현재 기록을 개선할 수 없다고 진술하여 상당한 유휴 시간을 발생시켰습니다.
대조적으로, 코덱스(Codex)는 중단이나 비활동 기간 없이 지속적으로 작동하여 더 끈질긴 접근 방식을 보여주었습니다.
코덱스는 또한 클로드보다 스크래치 패드를 활성 메모리로 훨씬 더 광범위하게 사용했으며, 클로드는 코덱스의 로봇적이고 방법론적인 통신 스타일과 달리 더 표현적이고 이모티콘이 가득한 어조를 유지했습니다.
코덱스는 클로드보다 더 많은 서브 에이전트를 생성하고 훨씬 더 많은 토큰을 소비했습니다.
코덱스는 또한 컨텍스트 압축을 시간당 평균 20회로 더 자주 수행했으며, 클로드는 이 프로세스를 시간당 한 번만 실행했습니다.
두 모델 모두 실험 중간에 인간 기록을 가져와 성능을 조정하고 향상시킬 수 있는 능력을 보여주었습니다.
클로드와 코덱스 모두 실험 전반에 걸쳐 기존 인간 기록을 꾸준히 능가하며 GPT-2 훈련 최적화 능력을 입증했습니다.
이전 스피드런의 인간 기록은 2,990단계였습니다.
클로드는 이 기록을 약 50~60단계 개선했고, 코덱스는 20단계 개선을 달성하여 AI 에이전트의 우월한 성능을 확고히 했습니다.
현재 실험의 비구조적인 특성으로 인해 모델 간의 공정한 비교를 보장하기 위해 여러 시드와 통제된 조건을 포함하는 더 엄격한 벤치마크가 만들어졌습니다.
향후 테스트 트랙은 가중치 접근만 가능한 모델, 보관된 논문에 접근 가능한 모델, 모든 자원에 완전히 접근 가능한 모델의 세 가지 다른 환경에서 AI 역량을 평가할 것입니다.
벤치마크에는 원래 NanoGPT와 옵티마이저 스피드런이 포함되며, 새로운 발견을 장려하기 위해 옵티마이저에 대한 새로운 제약이 추가될 것입니다.
대조적으로, 김(Kim, 코덱스)은 '계단 함수' 돌파 패턴을 보여주며, 특히 실험 4일째에 성능에서 상당한 도약을 달성했습니다.
김은 또한 토큰 사용 면에서 매우 효율적임이 입증되었는데, 반복 프로세스에 더 많은 토큰을 사용한 클로드에 비해 전반적으로 더 적은 토큰을 소비했습니다.
클로드는 광범위한 논문 검색을 수행하여 결국 새로운 기록에 기여하는 독특한 논문을 발견하며 기존 문헌을 효과적으로 탐색하는 능력을 보여주었습니다.
그러나 AI 모델은 진정으로 새로운 최적화 도구나 메커니즘을 발명하지 않았습니다. 대신, 주로 다른 기존 논문들을 결합하여 점진적인 '플러스 원' 개선을 이루었습니다.
이는 현재 AI 에이전트 성능이 아직 근본적인 발견에서 인간 연구자를 능가하지 못했으며, 주로 기존 지식을 종합하고 정제하는 데 탁월하다는 것을 나타냅니다.
프라임 인텔렉트는 구글의 알파이볼브(AlphaEvolve)에서 영감을 받아 단순한 평가에서 능동적인 AI 기반 발견으로 전환하기 위한 폐쇄 루프 연구 시스템을 개발하고 있습니다.
이 시스템의 아키텍처는 아이디어 생성기, 스피드런 평가기, 취향 기반 심사위원으로 구성되어 상호 작용하고 협력하여 연구를 발전시키도록 설계되었습니다.
이 루프는 또한 중요한 확장성 테스트를 포함하는데, 많은 제안된 방법이 큰 매개변수나 토큰에 적용될 때 종종 실패하는 반면, 인간 연구자들은 에이전트를 안내하고 생성된 아이디어의 품질을 검증하는 데 필수적임을 인식합니다.
프라임 인텔렉트는 AI 모델이 안전하고 격리된 환경에서 자율적이고 반복적인 실험을 수행할 수 있도록 GPU 샌드박싱 기술을 적극적으로 개발하고 있습니다.
이 팀은 또한 강력한 파일 시스템 읽기/쓰기 기능을 갖춘 REM 프레임워크에 맞춰진 고효율 에이전트를 구축하고 있습니다.
이러한 노력에는 GNM 5.2와 같은 특수 환경을 지원하기 위한 검증자 중심 훈련 라이브러리 제공이 포함되며, 이 모든 것은 재귀적 자기 개선에 대한 투명하고 개방적인 연구를 옹호합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 82편 올렸어요.