기술 블로그

[일상에 스며든 AI 음성인식 서비스] 텍스트 요약 (Summary)

daglo 팀 · 2022년 8월 2일

[일상에 스며든 AI 음성인식 서비스] 텍스트 요약 (Summary)

인공지능이 긴 글을 요약해준다면 삶이 얼마나 더 편리해질까요? SF영화 같은 이 일은 이제 현실이 되었습니다. 실제로 가능해졌거든요. 예를 들어, 어떤 분야에 대한 내용인지 한 문장으로 요약을 제공할 수 있어요. 또는, 원문보다 짧지만 어느 정도 길이가 있는 요약을 제공할 수도 있죠.

요약에는 크게 대화 요약과 산문 요약이 있습니다. 이외에도 요약에는 Word graph 모델이나 Topic segmentation 모델이 활용될 수 있습니다.

대화 요약

대화 요약은 화자의 정보를 고려한다는 점이 산문 요약과 가장 큰 차이점이라고 할 수 있는데요. 대화 요약 모델은 ‘화자 이름: 발화 내용’ 형식의 텍스트를 입력으로 받아, 대화에 대한 설명이나 요약 텍스트를 출력합니다. 대화 요약 모델은 BART같은 텍스트 생성 모델을 기반으로 구현할 수 있어요.

대화 기록에는 일반 텍스트와 다르게 ‘아, 저, 그, 에’ 등과 같은 간투어나 더듬거림, 혹은 비문이 많기 때문에 이에 잘 대응할 수 있는 모델이 필요해요. 대화 요약 모델이 훈련할 때 데이터 증강을 통해 비문에 강한 모델을 만들어야 합니다. 액션파워의 대화 요약 모델은 이를 성실히 수행하고 있죠. 액션파워는 자체 음성 및 텍스트 정제 기술로 대화체를 모델이 효과적으로 이해할 수 있는 형태로 바꿔주고 있습니다.

산문 요약

산문 요약은 화자 정보 없이 텍스트를 요약하는 것으로, 추출식 요약과 생성식 요약 두 종류가 있어요.

  • 추출식 요약

추출식 요약은 주요 문장을 찾는 방법으로 수행됩니다. 대표적으로 뉴스 데이터를 요약할 때 산문 요약 중 추출식 요약이 활용될 수 있어요. 텍스트 중 제일 중요한 문제나 메시지를 세 가지 골라주는 ‘세 줄 요약’ 서비스에도 추출식 요약이 활용됩니다. BERT-based ranking, keyphrase extraction, TF-IDF 등이 추출식 요약에 이용될 수 있어요.

  • 생성식 요약

생성식 요약은 모델이 직접 요약 문장을 생성하는 방법으로 수행됩니다. 대표적으로, 행간을 이해해야 하는 산문 텍스트 데이터를 요약할 때 생성식 요약이 활용될 수 있어요.

텍스트 생성 모델이 생성식 요약에 이용될 수도 있습니다. 텍스트 생성 모델에는 BART, T5, GPT 시리즈 등이 있어요.

평가 성능 지표

요약을 평가하는 성능 지표에는 대표적으로 루지 스코어(ROUGE score)가 있습니다. 인공지능 요약이 사람이 만든 요약과 얼마나 비슷한지 측정하는 지표예요.

검사 단위에 따라 ROUGE-1, ROUGE-2, ROUGE-L 등이 있어요. 최근에는 다방면의 성능 검증을 위해 다른 인공 신경망을 사용하기도 해요. 예를 들어 Bartscore를 이용해 요약과 원문의 내용이 얼마나 일치하는지 검증할 수 있어요. 액션파워의 요약 모델은 ROUGE-1: 0.4 / ROUGE-2: 0.15 / ROUGE-L: 0.35 의 높은 요약 성능을 보여주고 있어요.

액션파워에서는 더욱 고도화된 요약 모델을 만들기 위해 다음 연구들을 진행하고 있어요.

  • 한 눈에 요점만 파악할 수 있는 개요식 요약
  • 더 정확한 사실관계 검증 요약
  • 대화를 더 잘 알아듣는 대화체 특화 언어모델

이 기술들은 다글로에 조만간 추가될 요약 기능으로 곧 만나보실 수 있을 거예요.

액션파워는

액션파워는 요약과 관련된 특허 출원도 보유하고 있어요.

  • 출원번호 10–2022–0068319
    대화형 본문에 대해 단어 그래프를 이용하여 요약문을 생성하는 방법에 대한 발명이에요.
  • 출원번호 10–2022–0078041
    주요 화자의 발언에 기초하여 요약문을 생성하는 방법에 관한 발명이에요.

액션파워에 대한 더 많은 이야기가 궁금하다면?
More about Action Power

← 블로그로 돌아가기

대화가 일이 되는 곳, daglo.

지금 바로 무료로 시작해보세요