기술 블로그

사람에게 쉬운 대화가 AI에게는 어려운 이유

다글로 팀 · 2026년 10월 7일

사람에게 쉬운 대화가 AI에게는 어려운 이유

사람은 생각보다 대화를 아주 잘 이해합니다. 카페에서 음악이 들리고 옆 테이블에서 다른 사람이 이야기하고 있어도 바로 앞 사람의 말에 집중할 수 있습니다. 상대방이 단어를 끝까지 정확하게 말하지 않아도 앞뒤 문맥을 보고 의미를 짐작합니다.

그래서 음성 인식을 단순하게 생각하면 “사람이 말한 소리를 글자로 바꾸면 되는 것 아닌가?”라고 느끼기 쉽습니다.

하지만 실제 대화에는 조용한 방에서 한 사람이 마이크 가까이 또박또박 읽은 문장과 전혀 다른 문제가 들어 있습니다. 회의실에서는 여러 사람이 함께 이야기하고, 누군가는 노트북 마이크에서 멀리 떨어져 있으며, 회사 안에서만 사용하는 제품명과 약어도 계속 등장합니다.

사람에게는 너무 자연스러워서 의식하지 않는 것들이 AI에게는 하나씩 해결해야 하는 문제입니다.

현실의 음성은 깨끗하지 않습니다

음성 인식에 가장 좋은 조건은 한 사람이 조용한 공간에서 마이크 가까이 명확하게 말하는 상황입니다. 하지만 실제 업무에서는 이런 조건이 흔하지 않습니다.

회의실에는 에어컨과 키보드 소리가 있고, 책상을 두드리는 소리도 들어갑니다. 노트북 한 대로 여러 사람의 목소리를 함께 녹음하기도 합니다. 온라인 회의에서는 네트워크 상태에 따라 음성이 끊기거나 압축되고, 전화 통화는 애초에 사용할 수 있는 음질 자체가 제한됩니다.

사람은 이런 환경에서도 상당 부분을 자연스럽게 보정합니다. 단어 하나를 정확히 듣지 못해도 문장의 앞뒤와 현재 이야기 중인 주제를 이용해 의미를 추론합니다.

AI는 음성 신호에서 이 복잡한 조건들을 처리하면서 동시에 실제 발화를 찾아내야 합니다.

여러 사람이 말하면 문제는 더 어려워집니다

회의에서는 사람들이 완벽하게 차례를 지켜 말하지 않습니다. 누군가의 말이 끝나기 전에 다른 사람이 대답하기도 하고, 짧은 맞장구와 웃음이 겹치기도 합니다.

이때 음성 AI는 단순히 들리는 소리를 받아쓰기만 해서는 충분하지 않습니다. 서로 다른 사람이 말했다는 사실을 구분하고, 각각의 문장을 적절한 화자에게 연결해야 합니다.

이것이 화자 분리, Speaker Diarization이 필요한 이유입니다.

“이번 안으로 진행하겠습니다”라는 문장도 담당자가 말했는지, 의사결정권자가 말했는지에 따라 의미가 달라집니다. 특히 회의 후 누가 어떤 업무를 맡았는지 확인하려면 발언 내용만큼 화자 정보가 중요합니다.

‘화자 1’에서 실제 이름으로

기존의 화자 분리는 보통 서로 다른 목소리를 화자 1, 화자 2, 화자 3처럼 구분합니다. 누가 서로 다른 사람인지 알 수 있다는 것만으로도 회의록의 가치는 크게 올라갑니다.

하지만 사용자는 결국 한 단계 더 알고 싶습니다.

“그래서 화자 1이 누구인가?”

다글로는 화자 분리에서 더 나아가 Speaker Identification을 적용할 예정입니다. 등록된 화자의 음성 특성을 구분해 익숙한 화자라면 누구의 목소리인지 식별하고, 회의 기록에 해당하는 이름을 자동으로 연결하는 방향입니다.

매번 회의가 끝난 뒤 사람이 화자 1 = 김다글, 화자 2 = 이액션이라고 다시 지정해야 하는 과정을 줄이는 것이 목표입니다.

회의 AI가 대화를 제대로 이해한다는 것은 결국 무엇을 말했는지만 아는 것이 아니라 누가 말했는지까지 함께 이해하는 방향으로 발전하고 있다는 뜻입니다.

고유명사는 왜 유난히 어렵게 느껴질까?

사람은 회사에서 사용하는 언어를 금방 배웁니다. 동료 이름, 제품명, 프로젝트명과 고객사 이름을 몇 번 듣고 나면 자연스럽게 알아듣습니다.

AI에게는 이런 단어가 특히 어려울 수 있습니다. 일반적인 문장에서 자주 등장하지 않는 표현이고, 발음만으로는 여러 표기가 가능하기 때문입니다.

처음 듣는 서비스 이름이 영어인지 한국어인지, 일반 단어인지 브랜드명인지, 띄어쓰기를 어떻게 해야 하는지 음성만으로 판단해야 할 수도 있습니다.

전문 분야에서는 문제가 더 커집니다. 의료, 법률, 개발, 금융 등 특정 업계에서만 사용하는 표현과 약어는 일반적인 언어 데이터에서 자주 접하기 어렵습니다.

우리 조직의 언어를 알려주는 단어장

다글로의 단어장 기능은 이런 문제를 보완하기 위한 기능입니다.

사람 이름이나 회사명, 프로젝트명, 제품명, 전문용어처럼 일반적인 음성 인식 모델이 충분히 학습하기 어려운 단어를 사용자가 직접 등록할 수 있습니다. 그러면 실제 전사에서 해당 표현을 더 잘 인식하는 데 도움을 받을 수 있습니다.

같은 한국어를 사용하더라도 조직마다 실제 업무 언어는 다릅니다. 어떤 회사에서만 쓰는 프로젝트명이 있고, 한 팀에서 반복해서 사용하는 약어가 있으며, 특정 업계에서만 자연스러운 전문용어도 있습니다.

좋은 음성 AI가 일반적인 언어를 잘 이해하는 것에서 끝나지 않고, 사용자가 실제로 사용하는 언어에 적응할 필요가 있는 이유입니다.

숫자는 짧지만 중요합니다

숫자도 까다롭습니다. 음향적으로 일부가 비슷한 표현이 있고, 같은 숫자라도 금액인지 날짜인지 시간인지 비율인지에 따라 의미가 달라집니다.

문제는 숫자가 회의에서 굉장히 중요하다는 것입니다. 가격, 일정, 목표, 매출, 계약 조건이 숫자로 표현됩니다.

긴 회의 전체에서 대부분의 단어를 정확하게 인식했더라도 중요한 숫자 하나가 잘못 기록되면 사용자가 느끼는 품질은 크게 떨어질 수 있습니다.

음성 인식이 전체 단어의 평균 정확도만으로 설명되기 어려운 이유이기도 합니다.

사람은 소리가 아니라 맥락까지 듣습니다

사람이 대화를 잘 이해하는 이유 중 하나는 소리만 듣지 않기 때문입니다. 지금 어떤 프로젝트를 이야기하고 있는지, 직전에 무슨 이야기를 했는지, 상대방이 어떤 일을 하는지 이미 알고 있습니다.

“그거 다음 주까지 바꾸죠”라는 한 문장만 보면 ‘그거’가 무엇인지 알 수 없습니다. 하지만 같은 회의에 참석한 사람은 이전 대화를 알고 있으니 무엇을 뜻하는지 이해합니다.

음성 AI도 점점 더 긴 문맥을 활용하는 방향으로 발전하고 있습니다. 짧은 음향 신호 하나만 보는 것이 아니라 주변 발화와 전체 대화의 흐름을 함께 처리하고, 전사 이후에는 AI가 대화의 구조와 의미를 다시 분석할 수 있습니다.

결국 실제 대화를 기록하는 문제는 소리를 글자로 바꾸는 것만으로 끝나지 않습니다. 소리와 언어, 화자와 맥락이 함께 작동해야 합니다.

다글로가 기록하려는 것은 실제 사람들이 나누는 대화입니다

사용자는 회의가 시작될 때 방 안의 소음 수준을 측정하거나, 사람들이 말을 겹치지 않도록 통제하고 싶어 하지 않습니다. 회의는 그냥 평소처럼 진행되고, 끝난 뒤 필요한 기록을 얻고 싶어 합니다.

좋은 기술은 현실의 복잡성을 사용자에게 그대로 넘기지 않고 내부에서 해결해야 합니다.

다글로가 풀고 있는 문제도 단순한 받아쓰기에 머물지 않습니다. exp-300과 같은 음성 인식 엔진으로 발화를 더 정확하게 기록하고, 단어장을 통해 조직에서 사용하는 표현을 보완하며, Speaker Identification을 통해 앞으로는 등록된 화자가 누구인지까지 자동으로 알아보는 방향으로 발전하고 있습니다.

사람에게 너무 자연스러워서 쉬워 보이는 대화가 AI에게는 어려운 이유는, 그 안에 우리가 생각하는 것보다 훨씬 많은 정보가 들어 있기 때문입니다.

그리고 다글로는 그 정보를 더 많이, 더 정확하게 이해하는 쪽으로 계속 발전하고 있습니다.

← 블로그로 돌아가기

대화가 일이 되는 곳, daglo.

지금 바로 무료로 시작해보세요