데이터의 4단계 고도화: DIKW 피라미드
가장 아래 단계인 데이터는 객관적인 사실이며, 이를 가공하여 패턴을 인식하면 정보가 됩니다. 정보를 활용하여 의사 결정을 하면 지식이 되고, 더 나아가 창의적인 전략을 수립하면 지혜로 발전합니다. 빅데이터 분석의 목적은 데이터를 수집한 후 이러한 고도화 과정을 통해 가치를 창출하는 데 있습니다.
빅데이터 시대의 핵심 개념과 분석 기획, 조직 운영, 데이터 처리 기술 전반을 이해해야 시험에 대비할 수 있습니다.
가장 아래 단계인 데이터는 객관적인 사실이며, 이를 가공하여 패턴을 인식하면 정보가 됩니다. 정보를 활용하여 의사 결정을 하면 지식이 되고, 더 나아가 창의적인 전략을 수립하면 지혜로 발전합니다. 빅데이터 분석의 목적은 데이터를 수집한 후 이러한 고도화 과정을 통해 가치를 창출하는 데 있습니다.
요리사의 경험을 통해 습득한 요리 지식처럼 개인에게 내재된 지식은 안목지이며, 이를 요리책이나 블로그에 작성하여 공유하면 형식지가 됩니다. 안목지가 타인에게 전달되는 '공통화', 안목지가 형식지로 표현되는 '표출화', 형식지 간의 상호작용으로 지식이 확장되는 '연결화', 그리고 타인이 형식지를 통해 지식을 습득하는 '내면화' 과정이 반복됩니다.
데이터베이스는 '공용 데이터, 통합 데이터, 저장 데이터, 변화 데이터(공통 접변)'라는 네 가지 중요한 특징을 가지고 있습니다. 공용 데이터는 여러 부서나 사용자가 다양한 목적으로 공동으로 이용하는 데이터를 의미합니다. 통합 데이터는 동일한 데이터가 중복 저장되지 않도록 하여 공간 낭비를 줄이고 데이터의 일관성을 유지하는 것을 목표로 합니다. 저장 데이터는 데이터베이스가 물리적인 저장 매체에 저장되어 관리됨을 나타냅니다. 마지막으로 변화 데이터는 데이터베이스가 지속적으로 변화하더라도 항상 정확한 데이터(무결성)를 유지해야 함을 강조합니다. 이 네 가지 특징은 데이터베이스의 기본적인 운영 원리이자 중요한 개념입니다.
빅데이터 시대의 도래는 크게 두 가지 기술 발전 덕분입니다. 첫째는 클라우드 컴퓨팅의 등장으로, 사용자가 직접 저장 매체를 구매하지 않고도 구글 드라이브나 원드라이브처럼 네트워크를 통해 대용량 데이터를 유연하게 저장할 수 있게 되었습니다. 이는 수요에 따라 저장 공간을 구독하여 사용하는 온디맨드(On-demand) 방식이 가능해졌다는 것을 의미합니다. 둘째는 분산 처리 기술의 발전입니다. 하둡(Hadoop)과 같은 오픈 소스 플랫폼의 등장은 대용량 데이터의 효율적인 처리를 용이하게 하여 빅데이터 분석의 기반을 마련했습니다. 이러한 기술 발전이 대규모 데이터의 수집, 저장, 분석을 가능하게 했습니다.
첫째, '규모(Volume)'는 기존 데이터베이스 시스템으로는 처리하기 어려울 정도로 데이터의 양이 방대하다는 것을 의미합니다. 둘째, '다양성(Variety)'은 정형 데이터뿐만 아니라 반정형, 비정형 데이터 등 다양한 형태의 데이터가 존재한다는 특징입니다. 셋째, '속도(Velocity)'는 데이터가 생성되고 처리되는 속도가 매우 빠르다는 것을 나타냅니다. 이 3V는 빅데이터를 이해하는 핵심 요소이며, 시험에서는 이 세 가지 외의 다른 V가 포함된 보기가 나올 경우 정답이 아닐 가능성이 높습니다. 가트너 정의 외에도 시각화(Visualization)와 같은 추가적인 V 요소들이 언급되기도 하지만, 3V가 가장 기본이 됩니다.
빅데이터는 데이터 분석 방식에 네 가지 주요 변화를 가져왔습니다. 첫째, '전수 조사'의 시대가 열렸습니다. 과거에는 컴퓨팅 파워의 한계로 표본 조사를 할 수밖에 없었지만, 이제는 전체 데이터를 분석할 수 있게 되었습니다. 둘째, '사후 처리'가 가능해졌습니다. 데이터 처리 능력이 향상되면서 미리 가공하지 않고도 모든 데이터를 수집한 후 처리할 수 있게 되었습니다. 셋째, '데이터 양'의 중요성이 커졌습니다. 데이터의 질도 여전히 중요하지만, 다양한 원천의 방대한 데이터를 모두 활용하는 것이 중요해졌습니다. 넷째, '상관 관계' 분석이 핵심이 되었습니다. 과거에는 원인과 결과를 파악하는 데 집중했다면, 이제는 데이터 간의 복잡한 상관 관계를 탐색하는 것이 중요해졌습니다. 이 네 가지 변화는 '전후 양상'으로 요약하여 기억할 수 있습니다.
둘째, '기능 구조'는 각 사업 부서 내에서 직접 데이터 사이언티스트를 양성하고 분석을 수행하는 방식입니다. 셋째, '분산 구조'는 독립적인 조직을 만들기보다 기존 현업 부서의 인력에게 빅데이터 분석 업무를 배치하여 수행하게 하는 방식입니다. 각 조직 구조는 장단점이 있으며, 기업의 특성과 목표에 따라 적절한 모델을 선택해야 합니다.
가장 큰 범주인 인공지능은 인간처럼 사고하고 행동하는 기계를 만드는 것을 목표로 합니다. 그 안에 포함되는 머신러닝은 데이터로부터 학습하여 패턴을 발견하는 인공지능의 한 분야입니다. 그리고 머신러닝 안에 딥러닝이 존재하며, 딥러닝은 인간의 뇌를 모방한 인공신경망을 활용하여 데이터를 분석하는 기술을 의미합니다. 이 세 개념의 관계는 시험에 자주 출제되므로 정확히 이해하는 것이 중요합니다.
기업들은 고객들의 개인 정보를 활용하여 빅데이터 분석을 통해 인사이트를 얻고 싶어 하지만, 개인 정보의 무분별한 활용은 문제가 될 수 있습니다. 이에 데이터 3법은 개인 식별이 불가능하도록 가공된 가명 정보에 대해서는 정보 주체의 동의 없이도 특정 목적(통계 작성, 과학적 연구, 공익적 기록 보존 등) 하에 활용이 가능하도록 허용했습니다. 이는 기업의 데이터 활용 경쟁력을 높이고 빅데이터 산업을 활성화하기 위한 핵심 조치입니다.
이는 분석 대상과 분석 방법이 얼마나 알려져 있는지에 따라 네 가지 유형으로 나눌 수 있습니다. 첫째, 분석 대상과 방법을 모두 모를 때는 '발견(Discovery)' 단계로, 무엇을 분석해야 할지 찾아야 합니다. 둘째, 분석 대상은 알지만 방법을 모를 때는 '솔루션(Solution)'을 찾아야 합니다. 셋째, 분석 방법은 알지만 대상을 모를 때는 '통찰(Insight)'을 통해 자신을 돌아봐야 합니다. 넷째, 분석 대상과 방법을 모두 알 때는 '최적화(Optimization)'를 통해 효율을 극대화합니다. 이 분류는 데이터 분석 로드맵 설정의 중요한 출발점입니다.
일반적으로 시급성은 프로젝트가 창출할 가치와 관련되며, 난이도는 빅데이터의 3V 특성(규모, 다양성, 속도)을 고려하여 판단합니다. 가로축에 시급성을, 세로축에 난이도를 두고 매트릭스를 그리면 프로젝트의 우선순위를 시각적으로 결정할 수 있습니다. 예를 들어, 난이도가 쉬우면서 시급한 프로젝트는 최우선으로 진행하고, 난이도가 어렵고 시급하지 않은 프로젝트는 가장 나중에 진행하는 것이 일반적인 상식에 부합합니다.
'시급성이 중요하다'는 것은 단순히 급한 것을 우선하는 것이 아니라, 원래 시급하지 않던 프로젝트라도 현재 시점으로 끌어와 분석할 만큼 중요하게 생각한다는 의미입니다. 즉, 미래 가치를 현재화하려는 의지로 해석됩니다.
마찬가지로 '난이도가 중요하다'는 것은 어려운 프로젝트를 피하는 것이 아니라, 아무리 난이도가 높은 프로젝트라도 이를 쉬운 난이도로 낮춰서라도 분석을 진행해야 할 만큼 중요하게 여긴다는 뜻입니다. 이는 분석 기술을 통해 복잡성을 해소하려는 노력을 강조합니다. 따라서 수험생들은 이러한 출제 기관의 관점을 이해하고 학습해야 시험 문제에 올바르게 접근할 수 있습니다. 이러한 해석은 ADSP 시험에서도 동일하게 적용됩니다.
데이터 분석 프로세스에서 '모델링' 단계와 '평가' 단계는 이름이 비슷하여 혼동될 수 있는 요소가 있습니다. 모델링 단계에서는 '모델 작성 및 평가'가 이루어집니다. 이는 생성된 모델이 적절한지 내부적으로 검증하는 과정입니다. 반면, 평가 단계에서는 '분석 결과 평가', '모델링 과정 평가', '모델 적용성 평가'와 같이 보다 포괄적이고 최종적인 평가가 진행됩니다. 시험 문제에서 '평가'라는 단어만 보고 답을 선택하면 오답으로 이어질 수 있으므로, 어떤 '평가'인지 정확히 구분하여 이해하는 것이 중요합니다.
4과목의 혼동 행렬에서 재현율과 정밀도는 계산 가능한 지표로서 서로 트레이드오프 관계에 있다고 설명되곤 합니다. 하지만 1과목의 분석 과제 맥락에서 정확도는 '모델이 얼마나 틀리지 않는지'를 의미하며, 정밀도는 '여러 번 반복했을 때 결과가 똑같이 나오는지' 즉 일관성을 의미합니다.
이러한 정확도와 정밀도 또한 트레이드오프 관계에 있습니다. 즉, 한 가지를 신경 쓰면 다른 한 가지에 소홀해질 수밖에 없는 특성을 가집니다. 예를 들어, 매우 정확한 모델을 만들려고 하면 여러 번 반복했을 때 일관성이 떨어질 수 있고, 반대로 일관성을 높이려고 하면 정확도가 다소 희생될 수 있습니다. 따라서 이 두 가지 개념을 4과목의 지표와 혼동하지 않고 각각의 맥락에서 정확히 이해하는 것이 중요합니다.
반정형 데이터는 정형 데이터처럼 미리 정해진 구조를 가지고 있지는 않지만, 데이터를 설명하는 메타데이터(설명서)를 포함하고 있습니다. 이러한 메타데이터 덕분에 데이터가 어떻게 구성되어 있는지 파악할 수 있어, 비정형 데이터보다는 구조화된 정보를 제공합니다. XML, JSON과 같은 파일 형식이 대표적인 반정형 데이터에 해당합니다. 이는 정형 데이터와 비정형 데이터의 중간 형태라고 할 수 있습니다.
개인정보 보호를 위한 대표적인 비식별화 기술인 K-익명성, L-다양성, T-근접성은 시험에서 매우 중요한 개념입니다. K-익명성은 특정 레코드가 최소 K개 이상의 다른 레코드와 구분 불가능하게 함으로써 익명성을 보장하는 방식입니다. L-다양성은 K-익명성을 보완하여 민감 정보의 다양성을 확보함으로써 추론 공격을 방지합니다. T-근접성은 L-다양성이 가지는 특정 정보의 분포 불균형 문제를 해결하기 위해 민감 정보의 분포 자체를 유사하게 만듭니다.
과거 시험에서는 이 세 가지 개념에 대한 정의를 묻는 문제가 주로 출제되었지만, 앞으로는 난이도가 높아지면서 실제 사례를 주고 어떤 익명성 기술이 적용되었는지 고르는 문제 유형이 나올 수 있습니다. 따라서 단순히 개념을 암기하는 것을 넘어, 각 기술이 어떤 상황에서 어떻게 활용되는지 사례를 통해 이해하는 것이 중요합니다.
빅데이터 시대에는 정형화된 데이터뿐만 아니라 비정형 데이터의 양이 기하급수적으로 증가했습니다. 이러한 비정형 데이터를 효율적으로 저장하고 관리하기 위해 등장한 것이 바로 NoSQL 데이터베이스입니다. NoSQL은 'Not only SQL'의 약자로, 기존 관계형 데이터베이스(RDBMS)의 제약을 벗어나 유연한 데이터 모델과 확장성을 제공합니다. 대규모 분산 환경에서 비정형 데이터를 저장하고 처리하는 데 적합하며, 빅데이터 플랫폼의 핵심 구성 요소 중 하나로 자리 잡았습니다. NoSQL 데이터베이스는 데이터의 다양성과 속도라는 빅데이터의 특성을 효과적으로 지원합니다.
기존의 데이터 웨어하우스는 주로 정형화된 데이터를 저장하고 분석하는 데 사용되었습니다. 그러나 비정형 데이터가 급증하면서 이를 저장할 새로운 '창고'의 필요성이 대두되었고, 이것이 바로 '데이터 레이크(Data Lake)'입니다. 데이터 레이크는 정형, 비정형, 반정형 등 모든 종류의 데이터를 원본 형태로 저장하는 대규모 저장소를 의미합니다. 마치 호수에 데이터를 던져 넣듯이 어떤 형태로든 데이터를 일단 저장하고, 필요할 때 분석하는 방식입니다. 이러한 데이터 레이크는 대규모 비정형 데이터 처리에 강점을 가진 하둡(Hadoop)과 연계되어 효율적인 데이터 관리 및 분석을 가능하게 합니다.
Answers come from the transcript, with the exact spot cited.
Want the next article from IT의 답을 터득하다, 아답터?
When IT의 답을 터득하다, 아답터 publishes, we'll write it up like the one you just read and email it to you.
Ngozi Okonjo-Iweala: Redefining Global TradeBloomberg Originals11 hours ago · 24:01 · 27.7K views · Created 6 minutes ago
Google Labs VP: Every Company Needs to Be a LabLenny's Podcast7 hours ago · 1:02:11 · 8.7K views · Created 6 minutes ago
Saudi Airport Attack, Ukraine War Escalate RisksBloomberg Podcasts3 hours ago · 12:45 · 14.1K views · Created 6 minutes ago