연구 주제: 가상인간의 비언어적 상호작용 통합을 위한 딥러닝 기반 모델링 방법 연구
1. 연구 배경 및 필요성
•
비언어적 상호작용 요소의 통합적 구현 요구: 대화형 메타휴먼의 사회적 실재감 향상을 위해 시선 행동뿐만 아니라 안면 표정, 머리 회전 등 복합적인 비언어적 신호의 유기적 결합이 필수적임.
•
기존 확률 모델의 한계 극복: GMM-HMM 등 전통적 확률 모델 기반의 시선 제어에서 나아가, 복잡한 감정 상태와 대화 맥락을 동시에 반영할 수 있는 고도화된 딥러닝 생성 모델(Generative AI)의 도입이 필요함.
불쾌한 골짜기(Uncanny Valley)의 완전한 해소: 미세한 안면 근육의 변화와 고개의 움직임이 시선과 동기화되지 않을 때 발생하는 부자연스러움을 딥러닝 기반 통합 모델링으로 해결하고자 함.
2. 연구 최종 목표
•
시선(Gaze), 안면 표정(Facial Expression), 머리 회전(Head Rotation)을 통합적으로 제어하는 딥러닝 기반 멀티모달 비언어적 상호작용 생성 프레임워크 개발
사용자의 감정, 위치, 대화 맥락에 실시간으로 대응하는 적응형(Adaptive) 비언어적 피드백 시스템 구축 및 검증
3. 주요 연구 내용
•
멀티모달 비언어적 행동 데이터셋 구축: 시선 벡터, 안면 랜드마크 데이터, 머리 각도 시퀀스가 동기화된 고품질 데이터셋 수집 및 정제
•
통합 행동 생성 신경망 설계: Transformer 또는 Diffusion Model 등을 활용하여 대화 텍스트 및 오디오 정보에 대응하는 비언어적 행동 시퀀스를 생성하는 엔드투엔드(End-to-End) 모델 개발
•
시각-음향 동기화 최적화: 생성된 비언어적 동작과 오디오2페이스(Audio2Face) 기반 입술 움직임 간의 프레임 단위 정밀 동기화 기술 구현
인지적 대화 맥락 반영: 언어 모델(LLM)에서 추출된 감정 라벨 및 화자 의도를 시선 및 표정 모델의 조건부 입력값으로 연동
4. 기대효과 및 활용방안
•
기술적 측면: 초실감형 가상 인간 인터페이스 구현을 위한 멀티모달 통합 생성 원천 기술 확보
•
산업적 측면: AI 상담사, 디지털 휴먼 헬스케어, 초실감 에듀테크 등 고차원적인 감정 소통이 필요한 지능형 에이전트 서비스에 적용 가능
학술적 측면: 인간의 비언어적 의사소통 메커니즘을 공학적으로 모델링함으로써 HCI 및 인공지능 분야의 융합 연구 성과 도출


