기술 블로그

[일상에 스며든 AI 음성 인식 서비스] 텍스트 / 비디오 질의 응답(Text/Video Question Answering)

daglo 팀 · 2022년 8월 23일

[일상에 스며든 AI 음성 인식 서비스] 텍스트 / 비디오 질의 응답(Text/Video Question Answering)

액션파워는 AI 기술로 텍스트 파일 뿐만 아니라, 비디오 파일을 가지고도 질의 응답(Question Answering)을 구현할 수 있어요. 비디오 파일은 비디오의 음성을 STT(Speech-To-Text) 처리한 텍스트 파일을 기초로 질의 응답 모델을 구현할 수 있어요.

QA(Question Answering)

QA는 크게 open-book question answering과 closed-book question answering으로 나눌 수 있어요.

Open-book QA

Open-book QA는 사용자가 모델에 질문을 요청했을 때, 모델이 사용 가능한 외부 지식을 활용하여 정답을 도출해내는 것을 뜻합니다. Open-book QA도 종류에 따라 QA with context, open-domain QA로 나눌 수 있는데요.

Open-domain QA는 질문이 들어왔을 때, 모델은 웹페이지와 같이 구조화되지 않은 많은 양의 문서들을 살펴보고 정답을 도출해 냅니다.

open-domain QA 구조 (출처: https://github.com/bcaitech1/p3-mrc-gaama)

QA with context

QA with context는 사용자가 모델에 질문을 요청할 때, 질문과 관련된 context를 같이 제공합니다. 모델은 제공된 context에 따라 정답을 도출해 냅니다.

QA with context 구조

Closed-book QA

Closed-book QA는 사용자가 모델에 오직 질문만 요청합니다. 이 모델은 외부 지식을 전혀 활용하지 않고 사전에 학습한 지식을 이용하여 바로 정답을 도출해내는 task를 뜻합니다.

closed-book QA 구조 (출처: https://www.ohsuz.dev/mrc-cookbook/mrc-lecture-09)

액션파워에서는 세 가지 방법론 중 사용자가 daglo에 입력한 음성/비디오 파일의 내용에 집중하여 QA를 수행하고 있습니다. 이를 위해, QA with context를 집중적으로 연구합니다.

입ㆍ출력

텍스트 형식의 질문(또는, 질문과 전체 텍스트)을 입력으로 받아, 텍스트 형식의 단답형 답변을 출력해요. 비디오의 경우 비디오의 음성을 STT하는 단계를 먼저 수행합니다.

QA 입출력 구조 (출처: https://rajpurkar.github.io/mlx/qa-and-squad/)

방법론

기본적으로 mT5(multilingual T5 with transformer architecture) 모델을 기초로 수행합니다. mT5모델은 한국어와 영어로 QA를 수행할 수 있는 기본 모델이에요.

데이터셋으로는 기본적으로 KorQUAD 1.0 (Korean, wiki passage)을 사용합니다. 액션파워가 다루는 데이터에는 사람들과의 대화나 구어체로 이루어진 것들도 많이 존재하지만, 이를 다루기 위한 한국어 데이터가 부족할 수 있어요. 따라서, 모델이 처리할 수 있는 입출력 형식을 늘리기 위해 아래와 같은 영문 데이터를 이용해 데이터를 확장합니다.

  • SQUAD 1.0 (wiki passage)
  • ConvQA (Dialogue)
  • MULTIWOZ2.4 (Dialogue)
  • FriendsQA (TVshow Dialogue)
  • DREAM (Dialogue)

주의 집중 기법(Attention Mechanism)

attention mechnism의 예제 (출처: Xie et al. (2020). Deep Learning Enabled Semantic Communication Systems.)

사용자의 질문이 context의 어느 영역과 가장 밀접한 관련이 있는지 알아보기 위해, 주의 집중 기법을 활용합니다. 주의 집중 기법은 문장이나 단어와 임베딩 유사도를 이용해 진행합니다.

전체 입력에서 모든 단어를 동일한 비율로 참고하는 것이 아니라, 해당 시점에서 예측해야 할 단어와 연관이 있는 입력 단어 부분을 더 집중해서 살펴봅니다.

SOTA(State-Of-The-Art)와 평가 방법

  • QA 모델의 성능 지표로는 F1-score를 사용해요.
  • 관련 SOTA: Samsung SDS AI research의 F1-score 95.57

액션파워에서는 더욱 고도화된 QA 모델을 만들기 위해 다음 연구들을 진행하고 있어요.

  • 길이, 형식, 모달리티 등을 포함한 다양한 입력 형식에 대응할 수 있는 QA 모델
  • TTS 모델이 잘못 받아 적은 문자나 문법 오류에도 잘 작동하는 강건한 QA 모델
  • 사용자의 질문이 주어진 context 내에서 실제로 대답이 가능한지 인지하는 QA 모델

액션파워는

액션파워는 F1-score 94.73의 QA 모델과 함께 QA 모델을 활용한 특허 출원도 보유하고 있어요.

  • 출원번호 10–2022–0078749
    개인화된 데이터베이스에 기초하여 QA를 수행하는 방법에 대한 발명이에요.
  • 출원번호 10–2022–0078750
     핵심 멀티 모달 정보 추출을 통해 효율적으로 Video QA를 수행하는 방법에 대한 발명이에요.

액션파워에 대한 더 많은 이야기가 궁금하다면?
More about Action Power

← 블로그로 돌아가기

대화가 일이 되는 곳, daglo.

지금 바로 무료로 시작해보세요