음성 인식 정확도 95%면 정말 정확한 걸까?

음성 인식 서비스를 보다 보면 “정확도 95%”, “정확도 98%” 같은 숫자를 만나게 됩니다. 숫자만 보면 비교는 간단해 보입니다. 98%가 95%보다 더 좋은 음성 인식처럼 느껴집니다.
하지만 실제 회의록을 읽어보면 이야기는 조금 복잡해집니다. 같은 한 단어의 오류라도 중요도가 전혀 다를 수 있기 때문입니다. “이번 주”가 “다음 주”로 바뀌거나, “15%”가 “50%”로 기록된다면 단어 하나가 틀린 것 이상의 문제가 됩니다.
음성 인식의 품질을 제대로 이해하려면 단순히 몇 퍼센트가 맞았는지보다 어떤 종류의 오류가 발생했고, 그 오류가 실제 업무에 어떤 영향을 주는지를 함께 봐야 합니다.
음성 인식 정확도는 어떻게 측정할까?
음성 인식 분야에서는 WER, Word Error Rate라는 지표를 많이 사용합니다. 사람이 직접 작성한 정답 문장과 AI가 인식한 결과를 비교해 단어가 얼마나 빠지고, 다른 단어로 바뀌고, 불필요하게 추가됐는지를 계산하는 방식입니다.
예를 들어 사람이 “내일 오전 열 시에 회의합시다”라고 말했는데 AI가 “내일 오전 아홉 시에 회의합시다”라고 적었다고 생각해보겠습니다. 대부분의 단어는 정확합니다. WER 관점에서는 전체 문장 중 작은 일부만 잘못된 결과일 수 있습니다.
하지만 실제로 회의에 참석해야 하는 사람에게는 가장 중요한 정보가 틀렸습니다. 이 지점에서 기술적인 정확도와 사용자가 체감하는 정확도가 달라집니다.
WER는 모델을 비교하고 음성 인식 기술의 발전을 측정하는 데 유용합니다. 다만 실제 제품의 품질을 숫자 하나만으로 설명하기에는 부족할 수 있습니다.
모든 단어가 똑같이 중요한 것은 아닙니다
업무 대화에는 특히 중요도가 높은 정보들이 반복해서 등장합니다. 사람 이름과 회사명 같은 고유명사, 날짜와 시간, 금액과 비율 같은 숫자, 제품명과 프로젝트명, 그리고 업계에서 사용하는 전문용어입니다.
“김민수 님이 다음 주까지 수정안을 보내기로 했다”는 문장에서 조사 하나가 틀린 것과 김민수라는 이름 자체가 잘못 기록되는 것은 의미가 다릅니다. “매출이 15% 증가했다”에서 15가 50으로 바뀌는 오류 역시 단순히 한 단어가 잘못된 것으로 보기 어렵습니다.
특히 고유명사와 전문용어는 일반적인 문장보다 음성 인식이 어려울 수 있습니다. 일상 언어에서는 거의 등장하지 않는 제품명이나 회사 내부 약어가 특정 조직에서는 하루에도 수십 번씩 사용될 수 있기 때문입니다.
다글로에는 이런 단어를 미리 등록할 수 있는 단어장 기능이 있습니다. 사람 이름, 회사명, 프로젝트명, 제품명, 업계 전문용어처럼 일반적인 음성 인식 모델이 미리 알기 어려운 표현을 등록해두면 해당 단어를 더 정확하게 기록하는 데 도움을 받을 수 있습니다.
좋은 음성 인식이 단순히 일반적인 한국어를 잘 알아듣는 것에서 끝나지 않는 이유입니다. 실제 사용자가 어떤 언어를 사용하는지까지 제품이 이해할 수 있어야 합니다.
좋은 요약도 정확한 전사에서 시작합니다
최근에는 전사 결과를 처음부터 끝까지 읽기보다 AI 요약이나 Action Item을 먼저 확인하는 사용자도 많습니다. 그러면 “어차피 AI가 요약해주는데 전사가 조금 틀려도 괜찮지 않을까?”라는 생각이 들 수 있습니다.
하지만 요약 모델이 아무리 좋아도 입력 단계에서 잘못된 사실을 정확하게 복원하기는 어렵습니다. 이름이나 숫자, 중요한 결정이 잘못 기록된 상태라면 그 위에서 만들어지는 요약 역시 잘못될 가능성이 생깁니다.
앞으로 회의 내용을 바탕으로 AI Agent가 후속 업무까지 수행하게 된다면 이 문제는 더 중요해집니다. 잘못된 회의 기록이 단순한 오타로 끝나는 것이 아니라 다음 Action의 입력이 될 수 있기 때문입니다.
음성을 텍스트로 만드는 STT는 그래서 결과물의 마지막 단계라기보다 이후 AI가 사용할 데이터를 만드는 첫 번째 단계에 가깝습니다.
다글로의 300번째 실험, exp-300
음성 인식 엔진은 한 번 만들어놓고 끝나는 기술이 아닙니다. 실제 대화에는 새로운 표현이 계속 등장하고, 사람마다 발음과 말하는 속도가 다르며, 사용하는 환경도 달라집니다. 그래서 더 좋은 음성 인식을 만들기 위해서는 반복적인 실험과 개선이 필요합니다.
다글로는 2026년 10월 음성 인식 엔진을 exp-300으로 업데이트합니다.
exp는 experiment의 약자입니다. 그리고 300은 다글로가 만든 300번째 모델이라는 뜻입니다. 수많은 실험을 거쳐 300번째 모델까지 도달했다는 의미에서 다글로에게도 하나의 기념비적인 엔진입니다.
앞으로 다글로의 음성 인식 엔진은 exp-000 형식으로 브랜딩됩니다. 모델 이름 하나하나가 더 좋은 음성 인식을 만들기 위해 이어온 실험의 기록이 되는 셈입니다.
exp-300 역시 “정확도 몇 퍼센트”라는 하나의 숫자만을 목표로 만들어진 것은 아닙니다. 실제 사용자가 회의와 인터뷰, 강의와 업무 대화를 기록했을 때 필요한 내용을 더 잘 남기는 것이 중요합니다.
결국 중요한 것은 업무에서 믿고 쓸 수 있는가입니다
음성 인식 정확도를 숫자 하나로 표현하는 것은 편리합니다. 모델을 비교하거나 기술의 발전을 측정하는 데도 필요합니다.
하지만 실제 사용자의 질문은 조금 다릅니다.
중요한 이름과 숫자가 제대로 남는가. 우리 회사에서 자주 쓰는 제품명과 전문용어를 알아듣는가. 필요한 내용을 나중에 다시 찾을 수 있는가. 그리고 그 기록을 바탕으로 다음 업무를 해도 괜찮은가.
다글로는 음성을 텍스트로 바꾸는 것에서 끝나지 않고, 그 기록을 다시 찾고 정리하고 활용할 수 있는 기반으로 만드는 것을 목표로 하고 있습니다. exp-300과 단어장 역시 그 과정의 일부입니다.
음성 인식 정확도를 볼 때 “몇 퍼센트인가?”와 함께 한 가지 질문을 더 해볼 필요가 있습니다.
“내가 중요하게 생각하는 정보까지 제대로 남는가?”
대화가 일이 되는 곳, daglo.
지금 바로 무료로 시작해보세요