[일상에 스며든 AI 음성 인식 서비스] 텍스트 감정 분석 (Text Sentiment Detection)
![[일상에 스며든 AI 음성 인식 서비스] 텍스트 감정 분석 (Text Sentiment Detection)](https://cdn.sanity.io/images/ia1efdbu/production/d66d3dbb50f67e2e9f4c73cc462bd7252263b650-800x393.png?rect=26,0,749,393&w=1440&h=756&fit=crop&auto=format)

액션파워는 AI 음성 인식 기술로 텍스트의 감정을 판별할 수 있습니다. 텍스트 감정 분석을 통해 화자의 상황과 문맥에 대한 정보 등을 얻을 수 있어요.
텍스트의 토큰화 (Text tokenization)

텍스트 감정 인식을 위해서는 문장을 어떠한 단위로 분리하는 과정이 필요합니다. 이를 텍스트의 토큰화 (Text tokenization)라고 하는데요. 텍스트를 토큰화하는 방법에는 크게 단어 토큰화 (word tokenization), 세부 단어 토큰화 (subword tokenization), 문자 토큰화 (character tokenization)의 3가지 방법이 있습니다.
3가지 방법을 활용하면 아래 예시처럼 토큰화 할 수 있어요.
예시)
- 문장 : 사실 오늘 내내 정말 우울했었어. 그런데 화창한 날씨를 보니 지금은 기분이 좋네.
- 단어 토큰화 : ‘사실’, ‘오늘’, ‘내내’, ‘정말’, ‘우울했었어’, ‘.’, ‘그런데’, ‘화창한’, ‘날씨를’, ‘보니’, ‘지금은’, ‘기분이’, ‘좋네’
- 세부 단어 토큰화 : ‘사실’, ‘오늘’, ‘내내’, ‘정말’, ‘우울’, ‘했었’, ‘어’, ‘.’, ‘그런데’, ‘화창’, ‘한’, ‘날씨’, ’를’, ‘보’, ‘니’, ‘지금’, ‘은’, ‘기분’, ‘이’, ‘좋’, ‘네’, ‘.’
- 문자 토큰화 : ‘사’, ‘##실’, ‘오’, ‘##늘’, ‘내’, ‘##내’, ‘정’, ‘##말’, ‘우’, ‘##울’, ‘##했’, ‘##었’, ‘##어’, ‘.’, ‘그’, ‘##런’, ‘##데’, ‘화’, ‘##창’, ‘##한’, ‘날’, ‘##씨’, ‘##를’, ‘보’, ‘##니’, ‘지’, ‘##금’, ‘##은’, ‘기’, ‘##분’, ‘##이’, ‘좋’, ‘##네’, ‘.’
액션 파워에서는 Bert tokenizer를 활용하여 문자 토큰화를 진행하였고 Konlpy tokenizer를 활용하여 세부 단어 토큰화를 진행했어요.
텍스트 감정 인식 아키텍처
RNN (Recurrent Neural Network)이나 CNN (Convolutional Neural Network)에 기초하여 텍스트 감정 분석이 수행될 수 있어요.
RNN (Recurrent Neural Network)
RNN은 시퀀스 데이터의 패턴을 파악하는데 유용한 모델로 문장 분류 문제 (text classification)에도 효과적이라고 알려져 있어요. 아래와 같이 입력 문장이 들어오면 이를 토큰화하여 텍스트 감정 인식을 진행합니다.

문장 분류를 위한 RNN 구조 (출처: https://www.tensorflow.org/text/tutorials/text_classification_rnn)
CNN (Convolutional Neural Network)
CNN은 이미지 데이터의 패턴을 파악하는데 유용한 모델이지만, 문장 분류 문제에도 효과적이라고 알려져 있어요. 입력 문장의 길이가 k, 각 토큰의 임베딩(embedding)의 차원이 n이라고 할 때 이를 마치 n x k 크기의 이미지처럼 만들어서 텍스트 감정 인식을 진행합니다.

문장 분류를 위한 CNN 구조 (출처: https://reniew.github.io/26/)
분류 정확도(Classification Accuracy)가 평가 지표로 사용될 수 있어요.
텍스트 감정 분석의 활용
- STT 결과 텍스트에서 감정을 분석할 수 있어요.
- 고객 지원(Customer Service) 업무에 활용하여, 불만이 있었던 부분을 검출할 수 있어요.
- 뉴스의 댓글이나 SNS에 활용하여 어떠한 감정이 지배적인지 파악할 수 있어요.
액션파워는
액션파워에서는 Bert 또는 Konlpy tokenizer를 RNN 또는 CNN과 함께 사용하여 텍스트 감정 분석 모델을 구현한 바 있습니다. 감정 레이블은 [‘중립’, ‘기쁨’, ‘슬픔’, ‘코믹’, ‘공포&스릴러’, ‘편안함’, ‘아름다움’, ‘신나는’]의 7가지 레이블로 구성했고 분류 정확도는 아래와 같았어요.

액션파워는 텍스트 감정 분석을 활용한 특허 출원도 보유하고 있어요.
- 출원번호 10–2022–0083603
텍스트 감정 분석을 활용한 화자 인증 방법(speaker verification)에 관한 발명이에요. - 출원번호 10–2022–0088795
텍스트 감정 분석을 활용한 번역 음성 생성 방법에 관한 발명이에요.
액션파워에 대한 더 많은 이야기가 궁금하다면?
More about Action Power
대화가 일이 되는 곳, daglo.
지금 바로 무료로 시작해보세요