ServiceNow 엔지니어가 소개하는 음성 AI 언어학 프레임워크
그녀의 음성 커뮤니케이션 연구 배경은 현재 음성 AI 시스템을 분석하는 접근 방식의 근간을 이룹니다. 주요 목표는 이 시스템들이 어떻게 기능하고 사용자와 상호작용하는지 더 잘 이해하고 개선하기 위해 언어학적 관점을 제공하는 것입니다.
ServiceNow의 ML 엔지니어 김미담이 음성 AI 시스템을 분석하고 개선하기 위한 언어학적 프레임워크를 소개하며, 효과적인 의사소통은 공동 활동임을 강조합니다.
그녀의 음성 커뮤니케이션 연구 배경은 현재 음성 AI 시스템을 분석하는 접근 방식의 근간을 이룹니다. 주요 목표는 이 시스템들이 어떻게 기능하고 사용자와 상호작용하는지 더 잘 이해하고 개선하기 위해 언어학적 관점을 제공하는 것입니다.
김미담은 음성 봇이 자신의 이름인 '미담'을 정확하게 식별하지 못했던 개인적인 경험을 이야기했습니다. 시스템은 처음에 '미단'으로 추측했고, 그녀가 철자를 말하며 정정하려고 시도한 후에도 이름을 '마담'으로 잘못 발음했습니다. 이 사건은 현재 음성 AI의 중요한 결함, 즉 상호작용을 정확하게 인식하고 개인화하지 못하여 사용자에게 불쾌감을 주었다는 점을 강조했습니다.
또 다른 불만스러운 상호작용은 김미담이 계좌 번호를 제공하는 동안 봇이 그녀를 방해한 사건이었습니다. 시스템은 그녀가 말을 마치기도 전에 말을 끊었고, 그녀의 기록을 찾을 수 없다고 말하며 대화 중 사용자 진행 상황을 추적하지 못했음을 나타냈습니다. 이러한 지능적인 오류 처리 및 인지된 공감 능력 부족은 현재 음성 AI가 사용자 입력 및 상호작용 흐름을 관리하는 방식의 결함을 더욱 부각시켰습니다.
김미담은 인간의 의사소통이 공동 활동으로 작동하며, 참여자들이 상호 교환을 기반으로 정신 모델을 지속적으로 처리하고 업데이트한다고 강조했습니다. 이러한 끊임없는 적응과 공유된 이해는 효과적인 대화에 매우 중요합니다. 따라서 음성 AI 시스템은 의미 있고 성공적인 상호작용을 달성하기 위해 일련의 개별 명령이 아닌, 대화를 유사하게 취급하도록 설계되어야 합니다.
STT 시스템은 그녀의 이름에서 'M'과 'N' 소리를 구분하지 못했으며, TTS 시스템은 비영어 이름에 영어 중심의 발음 규칙을 잘못 적용했습니다. 이 상호작용 실패는 봇이 공유된 정신 모델을 구축하지 못하여 근본적인 언어학적 수준에서 오해를 초래했기 때문입니다.
김미담은 음성 AI 시스템에 반영되어야 할 인간 대 인간 대화의 필수 핵심 구성 요소인 명확한 듣기 및 말하기 채널을 설명했습니다. 이러한 채널 내에서 효과적인 의사소통은 소리, 단어, 상호작용 역학을 관리하고 공유된 정신 모델을 유지하는 것을 필요로 합니다. 음성 AI 시스템은 인간 상호작용과 비교할 만한 수준의 대화 능력을 달성하기 위해 이러한 구성 요소를 통합해야 합니다.
봇이 대화 내내 사용자 의도를 이해하도록 보장하기 위해 중요한 '정신 모델' 계층이 통합됩니다. 이 프레임워크는 다양한 공학, 언어학 및 인지 과학 용어를 체계적으로 구성하여 각 요소가 음성 AI 아키텍처 내에서 적절한 위치를 갖도록 합니다.
성공적인 대화를 위해서는 소리의 품질이 단어 선택과 상호작용 타이밍에 완벽하게 일치해야 합니다. 낮은 음질이나 부적절한 단어 선택과 같은 단일 계층의 실패는 필연적으로 음성 에이전트 기능의 완전한 고장으로 이어질 것입니다.
텍스트 기반 상호작용과 달리 음성 커뮤니케이션의 소리, 단어 및 상호작용은 말하는 순간 사라지며, 파형은 소멸됩니다. 유일하게 지속되는 요소는 상호작용 내내 지속적으로 진화하는 사용자 정신 모델입니다. 따라서 음성 AI 시스템은 이러한 일시적인 특성을 고려하여 통화 과정에서 정신 모델을 동적으로 구축하고 업데이트하는 데 중점을 두도록 설계되어야 합니다.
여기에는 최적의 자동 음성 인식(ASR) 및 텍스트 음성 변환(TTS) 모델 선택과 효과적인 전처리 및 후처리 기술이 포함됩니다. 신중한 어휘 관리, 정교한 차례 전환 관리, 감정 감지 및 동적 컨텍스트 유지 기능 또한 다양한 사용자를 효과적으로 수용하는 데 중요합니다.
이 언어학적 프레임워크에 세심한 주의를 기울이면 사용자 불만, 작업 실패, 라이브 에이전트 에스컬레이션, 포기된 통화 및 무음 오류를 줄여 상당한 비즈니스 영향을 미칩니다. 음성 에이전트의 엔드투엔드 성능을 진단하고 측정하기 위해 ServiceNow는 'Eva Bench'를 개발했습니다. 이 도구는 개선된 언어학적 조정이 어떻게 실질적인 비즈니스 이점으로 직접 전환되는지 보여주는 데 도움이 됩니다.
효과적인 의사소통은 인간과 AI를 포함한 양측이 서로에게 지속적으로 적응하는 공동 활동입니다. 사용자는 대화 내내 음성 에이전트에 맞춰 자신의 의사소통 스타일을 배우고 조정합니다. 따라서 음성 AI 시스템은 언어의 진화하는 특성과 시간 경과에 따른 변화하는 사용자 기대에 적응할 수 있는 본질적인 유연성을 갖도록 설계되어야 합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 32편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.