AI 벤치마크 세계 10위에도 독파모 사업 탈락한 모티프
반면 SK텔레콤, LG AI연구원, 업스테이지 등 다른 참가 기업들은 모티프보다 낮은 AAII 순위를 기록했음에도 불구하고 다음 단계로 진출한 것으로 알려져 평가의 객관성에 대한 의문이 커지고 있습니다.
과학기술정보통신부 주관 '독파모' 사업의 평가 방식이 객관성을 잃었다는 비판에 직면했습니다.
반면 SK텔레콤, LG AI연구원, 업스테이지 등 다른 참가 기업들은 모티프보다 낮은 AAII 순위를 기록했음에도 불구하고 다음 단계로 진출한 것으로 알려져 평가의 객관성에 대한 의문이 커지고 있습니다.
이를 통해 글로벌 AI 모델에 근접하는 성능을 확보하고, 국가 차원에서 AI 기술 주권을 확보하려는 목표를 가지고 있습니다.
사업 참가팀 선발 과정에서는 전문가 평가와 사용자 평가의 비중이 60% 이상을 차지하며, 이러한 정성 평가가 당락에 큰 영향을 미치는 구조입니다.
나머지 75%는 전문가 평가와 사용자 평가로 구성되어 있어, 상대적으로 주관적인 평가 요소가 과도하다는 지적입니다.
이러한 평가 방식은 객관적인 데이터 격차를 합산 점수 과정에서 축소하는 결과를 초래하여, 실질적인 기술력 우위가 제대로 반영되지 않을 수 있다는 우려를 낳고 있습니다.
이번 평가는 블라인드 테스트가 아닌 기명 평가 방식으로 진행되었습니다. 이로 인해 심사위원들이 참가 기업의 인지도나 브랜드에 영향을 받았을 가능성이 제기됩니다.
특히 대기업의 경우 이미 시장에서 높은 신뢰도를 가지고 있어, 이러한 요소가 심사위원들의 주관적인 평가에 긍정적인 영향을 미쳐 대기업에 유리하게 작용했을 수 있다는 우려가 나옵니다.
이게 사실 뭐 블라인드 테스트가 아니잖아요. 그러니까 조금은 그래도 대기업이라는 그런 거에 뭔가 신뢰가 조금 더 가는 느낌이랄까 그런 평가를 내릴 수 있지 않을까?
SK텔레콤과 LG 등 대형 통신사들은 이미 막대한 인프라를 보유하고 있어, AI 서비스의 실용성 평가에서 유리하게 작용했을 가능성이 있습니다. 통신사의 인프라는 당장 서비스에 적용할 수 있는 환경을 제공하기 때문입니다.
이는 모티프와 같은 신생 스타트업들이 초기 단계부터 막대한 인프라를 구축해야 하는 부담과 비교할 때, 불공정한 출발선에서 경쟁하는 결과를 초래할 수 있다는 지적입니다.
AAII 벤치마크 지표는 그 신뢰성을 인정받고 있습니다. 현재 AAII 순위의 상위권에는 엔트로픽의 클로드, 오픈AI의 GPT, 그리고 그록과 같이 실제로 널리 사용되며 우수성이 입증된 글로벌 AI 모델들이 위치하고 있기 때문입니다.
이러한 점은 AAII 벤치마크가 AI 모델의 객관적인 성능을 평가하는 데 있어 매우 유효한 지표임을 보여주는 근거가 됩니다.
모티프는 AAII 벤치마크 결과가 보여주듯 순수 기술력 면에서는 다른 참가 기업들보다 우위에 있다고 평가할 수 있습니다. 하지만 대기업의 막대한 인프라와 자본력이라는 현실적인 장벽 앞에서는 이러한 기술력이 충분히 발휘되기 어렵습니다.
이러한 상황은 앞으로 유사한 정부 주도 프로젝트에서도 기술력 있는 스타트업이 대기업과의 경쟁에서 불리한 위치에 놓이는 결과를 반복할 수 있다는 우려를 낳고 있습니다.
정부 독파모 사업의 당초 취지는 글로벌 인공지능 모델에 근접하는 독자적인 성능을 확보하는 것이었습니다. 그러나 현재의 평가 방식과 국내 AI 생태계의 현실을 고려할 때, 이러한 목표 달성이 현실적으로 가능한지에 대한 의문이 제기됩니다.
글로벌 AI 경쟁은 조 단위의 막대한 투자를 필요로 하는데, 국내 환경에서 이러한 투자를 감당하며 글로벌 수준의 모델을 만들 수 있을지에 대한 현실적인 검토가 필요하다는 지적입니다.
오픈AI나 엔트로픽과 같은 글로벌 선두 AI 기업들은 막대한 적자를 감수하면서 천문학적인 금액을 연구 개발에 쏟아붓고 있습니다. AI 모델 개발에 필수적인 데이터 센터 구축과 연산 리소스 확보에는 엄청난 비용이 들기 때문입니다.
이러한 현실을 고려할 때, 국내 환경에서 제한적인 자본으로 글로벌 수준의 AI 모델을 처음부터 끝까지 독자적으로 개발하려는 접근 방식이 현실적인지에 대한 근본적인 의문이 제기됩니다.
글로벌 AI 모델과 같이 순수 독자적으로 인공지능 모델을 처음부터 개발하는 것은 현실적으로 매우 어렵다는 지적이 많습니다. 대신 오픈소스를 활용하여 한국식으로 파인튜닝하거나 조합하는 방식이 가장 현실적인 대안으로 거론되고 있습니다.
과거 네이버의 사례처럼 오픈소스를 활용한 경우 오히려 평가에서 불이익을 받거나 탈락하는 기준이 있었다면, 이러한 평가 기준을 재고하여 다양한 기술 확보 방법을 모색해야 할 필요가 있습니다. 무조건적인 독자 개발 고집보다는 실용적인 접근으로 기술 주도권을 확보하는 방안을 찾아야 합니다.
연말에 최종 2개 팀이 선발될 예정인 독파모 사업의 실효성에 대한 논란이 커지고 있습니다. 현재 성능 격차가 명확한 상황에서 선발된 국내 모델이 국민들에게 널리 사용될 수 있을지에 대한 의문이 제기됩니다. 이미 확고한 글로벌 AI 모델 사용층이 존재하기 때문입니다.
선발과 탈락이 기업 기술력의 절대적인 잣대로 평가되는 경향은 국내 AI 기술 발전의 다양성을 저해할 수 있습니다. 최종 선발된 모델이 과연 글로벌 모델과의 경쟁에서 우위를 점하거나, 국내 사용자의 선택을 받을 수 있을지는 미지수입니다.
결국 이 사업의 결과가 국내 AI 생태계에 어떤 영향을 미칠지, 그리고 정부의 막대한 투자가 기대했던 성과로 이어질 수 있을지에 대한 심도 깊은 고민이 필요한 시점입니다.
최종적으로 하나 팀은 선발한다고 해서 국민들이 쓸까요? 글쎄요. 이미 확고한 그 층이 있으니 그걸 쓰기가 쉽지는 않겠죠. 성능 차이가 날 텐데.
미국의 기술 수출 통제와 같은 국제적 상황을 고려할 때, 국내 서비스 중단 위기에 대응하기 위해서라도 독자적인 AI 모델을 갖추는 것은 필수적입니다. 일상생활뿐 아니라 산업 전반에 걸쳐 AI 활용이 확대되고 있기 때문에, 자립적인 AI 생태계 구축은 국가 안보와 산업 경쟁력 강화를 위해 반드시 필요합니다.
다만, 정부는 독자 AI 모델 개발의 필요성은 인정하되, 현재의 평가 방식과 사업 방향을 현실에 맞게 수정해야 한다는 요구가 나옵니다. 더욱 명확한 목표 설정과 현실적인 가이드라인을 제시하여 국내 AI 기술 발전의 효율성과 공정성을 동시에 확보하는 전략적 접근이 필요합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
디일렉 THEELEC의 다음 글도 받아볼까요?
디일렉 THEELEC에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 4편 올렸어요.