Search
moon
sun

한국연구재단, 우수신진-씨앗(`25-26)

연구 개요

사업 개요

•
지원 사업: 한국연구재단, 개인기초연구 우수신진연구(씨앗연구)
•
과제명: 사회적 시선 행동이 가능한 대화형 메타휴먼 요소기술 연구 (Research on Enabling Technologies for Conversational Metahumans with Social Gaze Behavior)
•
수행 예산: 85,846천원
•
수행 기간: 1년 @9/1/2025 → 8/31/2026
•
참여 연구원: ,
•
연구계획서
연구계획서_NRF우수신진(씨앗연구)_250513.pdf
3 MB

연구 개요

주제 : 얼굴과 눈이 사람 객체 위치에 따라 움직이는 대화 가능한 메타휴먼
•
현실 세계에서 지나가는 사람을 인식하고, 자연스럽게 상호작용하는 메타휴먼(Interactive avatar)
•
응용 분야: AI비서, 헬프 데스크, 광고, 게임 컨텐츠
•
요소 기술: 메타 휴먼 모델, 얼굴 표현, 대화 파이프라인(음성인식, 대화생성, 음성합성)
◦
메타 휴먼 모델 : Metahuman (Unreal Engine)
◦
얼굴 표현(표정) : Audio2face (Nvidia) → Unreal Engine
◦
얼굴 표현(얼굴/눈 응시) : OpenCV, MediaPipe, OpenFace → Unreal Engine
◦
대화 파이프라인 A : NVIDIA Riva + NeMo
◦
대화 파이프라인 B
▪
음성인식 : Whispher
▪
대화생성 : EEVE
▪
음성합성 : gTTS
구현 가이드라인

회의록

수행 내용

시스템 아키텍처 및 장비 구매 계획

[논문] 화자 인식 기반 헤드 방향 제어

시선 행동 모델링

시선 벡터 생성

실험 평가

[논문] 화자 위치 및 대화 상태 기반 시선 행동 모델링

학부 연구생 과제

[논문] 휴먼 디지털 트윈 Survey

🔶학회 정보
•
ICUFN 2026 (@7/7/2026 → 7/10/2026)
◦
이탈리아 밀라노
◦
논문 제출 @2/13/2026

연구 성과

🔶 학술대회 논문
•
김진학 외 4인, “화자인식 및 응시 행동이 가능한 가상인간 관련 연구 동향 분석”, 2025년 한국정보통신학회 추계종합학술대회.
🔶 논문지
•
김진학, 안현 “Design of a Speaker-Aware Conversational Virtual Human for Nonverbal Interaction: A Proof-of-Concept Study”, Journal of Information and Communication Convergencee Engineering, 24(4), 2026. 12.

용어 정리

안구 운동

대화 패턴 및 심리학 개념

실험 및 설문조사

•
하드웨어 (Embodied AI 구현)
◦
HMD (Head Mounted Device)
◦
IR (Infrared Rays, 적외선)
◦
NIR (Near Infrared Rays, 근적외선)
◦
RGBD (RGB Depth) Camera: 컬러와 깊이 값을 동시에 측정하는 카메라. 깊이 정보를 생성하기 위해 일반적으로 스테레오 카메라 또는 ToF(Time-of-Flight) 센서가 장착되어 있음
•
NVIDIA 플랫폼(휴먼 디지털 트윈 관련)
◦
NVIDIA Omniverse : 디지털 트윈 제작 및 시뮬레이션 플랫폼 (응용 예: BMW 자동차 생산 공정 시뮬레이션)
◦
NVIDIA ACE(Avatar Cloud Engine) : AI NPC, 대화형 디지털 휴먼, 음성 및 얼굴 애니메이션 (응용 예: 키오스크 안내용 메타휴먼) 제작을 위한 클라우드 서비스
◦
NVIDIA Maxine : AI 기반 화상회의 품질 개선, 얼굴 트래킹, 아바타 생성 (응용 예: 화상회의 눈동자 보정)
•
깊이 정보 획득 방식
◦
ToF (Time-of-Flight): 적외선(IR) 신호를 쏘고, 돌아오는 시간을 측정
▪
예: Kinect v2, Azure Kinect
▪
장점: 빠르고 비교적 정밀함
▪
단점: 반사체에 민감함
◦
Structured Light (구조광): 패턴이 있는 IR 빛을 쏘고 왜곡된 패턴을 기반으로 거리 측정
▪
예: Intel RealSense D400 시리즈, Kinect v1
▪
장점: 근거리에서 정밀
▪
단점: 햇빛 등의 외광에 약함
◦
Stereo Vision (이중 카메라): 두 개의 카메라를 통해 삼각 측량으로 거리 계산
▪
예: ZED Stereo Camera, 일부 RealSense 모델
▪
장점: 실외에서도 사용 가능
▪
단점: 텍스처 없는 표면에 약함

참고자료

[메타휴먼 제작]
•
◦
언리얼 엔진에서 NVIDIA ACE 플러그인 설치
•
•
◦
메타휴먼의 자연스러운 눈깜빡임 및 움직임 구현 (mixamo 활용)
•
◦
리얼한 메타휴먼 구현에 필요한 조명 효과를 쉽게 적용하는 기능 (피부 톤, 반사광, 입체감 조정)
•
◦
3D 캐릭터 애니메이션 서비스 (풍부한 라이브러리 제공)
•
Omniverse Audio2Face | Rest API | Headless A2F (link)
◦
헤드리스 모드(GUI X)에서 실행되는 Audio2Face의 Rest API 레퍼런스
•
◦
대화형 메타휴먼을 구현한 블루프린트 예제 프로젝트
•
◦
대화형 메타휴먼 예제 프로젝트
•
◦
NeuroSync 예제 프로젝트
[Nonverbal Communications]
•
◦
안구 운동 유형의 용어 정의
•
◦
multi microphone (화자 위치 인식) + 시선 일치 기법 (Data-driven gaze animation using recureent neural networks)
[기타]
•
◦
포트나이트 AI Bot 행동 개선을 위해 RL/IL을 적용한 사례
◦
발표자료 탬플릿으로 참고
•
Cristina Dobre, PhD at Goldsmith Univ. of London(link)
◦
연구 분야 : nonverbal behaviour of virtual humans

학술 논문 및 보고서

[휴먼 디지털 트윈 관련 조사 논문]
•
(Gaffinet 25) Human digital twins: A systematic literature review and concept disambiguation for industry 5.0. Computers in Industry
gaffinet25.pdf
1223.2KB
•
(Kisti 23) 휴먼 디지털 트윈: 인체 연구에 대한 효과적 대체제, KISTI 이슈 브리프
kisti23.pdf
4245.9KB
•
(Lin 24) Human digital twin: a survey, Journal of Cloud Computing
lin24.pdf
2944.3KB
•
(Schmaltz 24) Towards the Human Digital Twin: Definition and Design: A survey. arXiv
schmaltz24.pdf
1137.3KB
[Nonverbal Behavior + Virtual Humans]
2512.13674v2.pdf
13.4 MiB
•
(Aburumman 22) Nonverbal communication in virtual reality: Nodding as a social signal in virtual interactions. International Journal of Human-Computer Studies.
◦
심리학에 기반하여 가상 인간에 고개 끄덕임(nodding) 규칙을 구현 → 호감도와 신뢰도 상승
aburumman22.pdf
5.2 MiB
•
(Bae 25) Effects of meta-human characteristics on user acceptance: from the perspective of uncanny valley theory. Behaviour & Information Technology.
◦
불쾌한 골짜기 이론을 메타휴먼에 적용하여 분석: 시각적 유사성 및 행동적 유사성
◦
현재 메타휴먼 기술은 시각적 유사성 측면에서 골짜기를 넘었으나 행동적 유사성 측면에서는 여전히 골짜기 왼편에 머무르고 있음 → 메타휴먼의 행동 구현 기술의 중요성 (연구 배경)
bae25.pdf
2.7 MiB
•
(Cassel 01) Embodied conversational agents: representation and intelligence in user interfaces. AI magazine. (link)
•
(Chojnowski 25) Human-like Nonverbal Behavior with MetaHumans in Real-World Interaction Studies: An Architecture Using Generative Methods and Motion Capture. In ACM/IEEE International Conference on Human-Robot Interaction (HRI).
Summary
chojnowski25.pdf
702.7 KiB
•
(Dobre 23) Social Interactions in Immersive Virtual Environments: People, Agents, and Avatars. PhD Thesis, Goldsmiths University of London.
◦
아바타의 시선 이동 + 고개 움직임 → 대화 차례 조정과 사회적 존재감에 영향을 미침
dobre23.pdf
17.2 MiB
•
(Eijndhoven 25) A scoping review of nonverbal mimicry in human-virtual human interaction. Computers in Human Behavior: Artificial Human.
◦
인간과 가상인간의 상호작용에서 발생하는 비언어적 모방(nonverbal mimicry)에 관한 조사 논문
◦
다양한 모방 유형(행동, 정서, 얼굴 등)에 대한 최신 SW 및 알고리즘을 정리
eijndhoven25.pdf
3.7 MiB
•
(Song 25) Large Language Model-Driven 3D Hyper-Realistic Interactive Intelligent Digital Human System. Sensors.
◦
감정 인식 및 표현이 가능한 대화형 메타휴먼
song25.pdf
4 MiB
•
(Wölfel 22) Enabling embodied conversational agents to respond to nonverbal behavior of the communication partner. In International Conference on Human-Computer Interaction.
◦
대화 에이전트(ECA)를 대형 스크린에 실물 크기로 투영
◦
사용자의 비언어적 행동을 인식 (제스처, 자세, 공간적 좌표)
◦
다양한 비언어적 행동을 구현 (제스처, 시선 처리, 사용자 추적, 거리 유지 등)
Table. ECA가 인식/수행 가능한 사회적 신호
w ̈olfel22.pdf
1.2 MiB
[Social Gaze Behavior + Virtual Humans]
•
(Woo 24) Adaptive virtual agent: Design and evaluation for real-time human-agent interaction. International Joural of Human-Computer Studies
•
(Andrist 12) Designing effective gaze mechanisms for virtual agents. In SIGCHI.
◦
시선 행동 → 사용자와의 유대감(rapport)과 학습 효과에 미치는 영향을 분석
andrist12.pdf
2.4 MiB
•
(Canales 23) Real-time conversational gaze synthesis for avatars. In Proceedings of the 16th ACM SIGGRAPH Conference on Motion, Interaction and Games
◦
RNN 기반의 시선 합성 모델 (입력: 머리 움직임, 오디오)
canales23.pdf
2.3 MiB
•
(Dembinsky 24) Gaze generation for avatars using gans. IEEE Access.
◦
GAN을 이용한 아바타의 응시 애니메이션 생성
dembinsky24.pdf
1961.3KB
•
(Herashchenko 23) Appearance-based gaze estimation enhanced with synthetic images using deep neural networks, 2023 IEEE Symposium Series on Computational Intelligence (SSCI)
◦
메타휴먼의 응시 기능 구현 관련 연구
herashchenko23.pdf
1831.7KB
•
(Hwang 25) ViRAC: A Vision-Reasoning Agent Head Movement Control Framework in Arbitrary Virtual Environments, arXiv preprint.
◦
가상 에이전트의 머리 움직임에 대한 주관적 평가(subjective evaluation)에서 설문 결과에 기반한 통계 분석 방법 적용(Friedman 검정, Wilcoxon 부호 순위 검정)
hwang25.pdf
43415.5KB
•
(Huang 11) Virtual Rapport 2.0. In International workshop on intelligent virtual agents.
◦
사용자의 얼굴 특징, 시선 벡터를 활용하여 대화 및 백채널 제어에 활용
huang11.pdf
378.4 KiB
•
(Kshirsagar 20) Robot Gaze Behaviors in Human-to-Robot Handovers, IEEE IROS.
kshirsagar20.pdf
3.3 MB
•
(Peters 10) Animating gaze shifts for virtual characters based on head movement propensity. In  Int. Conf. on Games and Virtual Worlds for Serious Applications.
peters10.pdf
374.2 KiB
•
(Ramnauth 25) Gaze Behavior During a Long-Term, In-Home, Social Robot Intervention for Children with ASD, arXiv preprint.
ramnauth25.pdf
8.1 MB
•
(Scassellati 17) Social Eye Gaze in Human-Robot Interaction: A Review, Journal of Human-Robot Interaction
◦
휴먼-로봇 상호작용 (Human-Robot Interaction) 기능으로서 상호 응시 관련 연구에 대한 survey
scassellati17.pdf
671.0KB
•
(Qing 25) Look and Talk: Seamless AI Assistant Interaction with Gaze-Triggered Activation. arXiv preprint.
◦
연구 배경 : 음성 명령어(예: “Hey siri”)를 통한 기존의 대화 활성화 방식 → 환경 소음이 있는 장소에서 부적합. 수동적 대화 메커니즘
◦
시선 고정(eye fixation)을 통한 아바타와의 대화 활성화 방식을 제안
qing25.pdf
2.9 MiB
•
(윤개리 20) VR 환경에서 몰입감 향상을 위한 디지털 휴먼 눈 구현의 특성 연구, 한국공간디자인학회논문집
윤개리20.pdf
3159.9KB
•
(김우원 11) 2차원 영상의 얼굴 각도와 위치 판정, 한국방송공학회 하계학술대회
김우원21.pdf
650.4KB
•
(이연빈 20) VR에서 디지털 휴먼과 사회적 상호작용이 사회적 실재감에 미치는 영향 - 인공지능 기반의 모션캡처 시스템 Facecap 중심으로 -, 홍익대학교 석사학위논문
이연빈20.pdf
1890.4KB
•
(이영민 23) 웹캠 기반의 시선추적 알고리즘을 이용한 마우스 컨트롤러, 한국방송·미디어공학회 추계학술대회
이영민23.pdf
440.9KB
[인지과학 연구: 안구운동 및 시선행동]
•
(Evinger 94) Not looking while leaping: the linkage of blinking and saccadic gaze shifts. Experimental brain research.
◦
gaze-evoked blinking 패턴에 대한 실험 및 관찰
[실험 및 설문]
•
(Kum 24) The effect of eye contact in multi-party conversations with virtual humans and mitigating the Mona Lisa effect. Electronics.
◦
다자간 대화에서 가상 인간의 시선 행동이 사용자 경험에 미치는 영향을 규명
◦
모나리자 효과 완화: 가상 인간이 다른 곳을 보고 있어도 자신을 쳐다보는 것처럼 착각하게 되는 ‘모자리나 효과’ 를 완화하기 위한 카메라 회전 기법(CRAFT)을 제안
◦
설문: 대인 관계 기술, 사회적 실재감, 주의 집중, 공존감, 능숙함
kum24.pdf
8.9 MiB
[기타]
•
(Agrawal 25) Seamless interaction: Dyadic audiovisual motion modeling and large-scale dataset. arXiv.
◦
Meta에서 공개한 대화 상호작용 관련 멀티모달 데이터셋 (4,000시간 이상)
◦
Dyadic Motion Model : 두 참가자의 음성을 동시에 처리하여 말하는 사람의 제스처뿐만 아니라 듣는 사람의 반응(고개 끄덕임, 미소 등)을 함께 생성
agrawal25.pdf
38.4 MiB
•
(Müller 07) Dynamic Time Warping. Information retrieval for music and motion, Springer Berlin Heidelberg.
◦
DTW 알고리즘 정의
dynamic-time-warping-2007.pdf
1.1 MB
•
(Pan 16) Empirical study on designing of gaze tracking camera based on the information of user’s head movement. Sensors.
◦
웹캠 + 초음파 센서 → 3차원 머리 움직임 정밀 측정 → 시선 추적 시스템의 카메라 렌즈 설계에 적용 (최적의 화각 및 피사계 심도)
pan16.pdf
7.3 MiB
•
(Rondón 21) TRACK: A New Method From a Re-Examination of Deep Architectures for Head Motion Prediction in 360∘ Videos, IEEE Transactions on Pattern Analysis and Machine Intelligence
◦
360도 비디오 스트리밍에서 사용자의 머리 움직임(Head Motion)을 예측하는 방법 → 네트워크 대역폭 절약 + 사용자 경험 개선 (Hwang 25 실험 평가에서 활용됨)
rondón21.pdf
1697.6KB
•
(Kaup 24) A Review of Nine Physics Engines for Reinforcement Learning Research, arXiv.
2412.15834v1.pdf
4.4 MB
Int Trans Operational Res - 2024 - Akpan - Conversational and generative artificial intelligence and human chatbot.pdf
3.2 MB
jcm-12-01339.pdf
1.4 MB
resprot-2023-1-e46601.pdf
328.4 KB
IJISAE_4_Hemendra+Jain.pdf
344.8 KB
1-s2.0-S1574013724000376-main.pdf
4.5 MB
https://discuss.pytorch.kr/t/llama-omni-llm-feat-llama-3-1-8b/5220
•
저지연 대화 모델 : Text + Speech 한 번에 생성

정리중 ( )