-
장주용 교수(전자통신공학과) 연구팀, 사용자가 원하는 자세와 영역을 직접 지정할 수 있는 ‘인간 영상 복원’ 기술 개발
조회수 606 | 작성일 2026.06.12 | 수정일 2026.06.12 | 홍보기획실
-
장주용 교수(전자통신공학과) 연구팀, 사용자가 원하는 자세와 영역을 직접 지정할 수 있는 ‘인간 영상 복원’ 기술 개발
- 인공지능 및 컴퓨터비전 분야 세계 최고 권위 학술대회 CVPR 2026 채택 -
본교 전자통신공학과 장주용 교수 연구팀(노승영 박사과정)은 사람의 신체 일부가 다른 물체에 의해 가려진 상황에서도 보이지 않는 영역을 복원함과 동시에, 사용자가 원하는 자세(pose)와 복원 영역을 직접 지정할 수 있는 새로운 인간 영상 복원 기술인 ‘Promptable Human Amodal Completion(PHAC)’ 알고리즘을 개발하였다.

제안된 Promptable Human Amodal Completion(PHAC) 개요
최근 디퓨전(diffusion) 모델 기반의 영상 생성 기술이 빠르게 발전하면서 가려진 객체를 복원하는 아모달 완성(amodal completion) 기술이 주목받고 있다. 특히 사람을 대상으로 하는 휴먼 아모달 완성(human amodal completion)은 가려진 신체 부위를 자연스럽게 복원하여 증강현실(AR), 가상현실(VR), 디지털 휴먼, 3차원 아바타 생성, 인간-로봇 상호작용(HRI) 등의 다양한 분야에 활용될 수 있다.
그러나 기존의 휴먼 아모달 완성 기술들은 사용자가 원하는 복원 결과를 직접 제어하기 어렵다는 한계를 가지고 있다. 예를 들어 사용자가 특정 자세를 원하더라도 모델은 학습된 데이터 분포에 의존하여 결과를 생성하기 때문에 원하는 결과가 나올 때까지 반복적으로 생성 과정을 수행해야 했다. 또한 자세 정보를 활용하는 기존 기술들은 사용자가 원하는 자세를 반영하는 과정에서 원본 인물의 의상, 신발, 외형 등의 시각적 특징이 손실되는 문제가 존재하였다.
연구팀은 이러한 문제를 해결하기 위해 사용자가 몇 개의 점(point)만 지정하여 원하는 자세나 복원 영역을 직접 입력할 수 있는 Promptable Human Amodal Completion(PHAC) 프레임워크를 제안하였다. 사용자는 추가 관절 위치를 지정하여 원하는 자세를 입력하거나, 복원하고자 하는 영역을 박스 형태로 지정할 수 있으며, 제안된 알고리즘은 이러한 사용자 프롬프트를 ControlNet 기반 조건 정보로 활용하여 사용자의 의도를 반영한 결과를 생성한다.
특히 연구팀은 디퓨전 모델의 강력한 생성 능력을 유지하면서도 사용자 프롬프트와의 정합성을 높이기 위해 cross-attention 블록만 선택적으로 미세조정(fine-tuning)하는 구조를 도입하였다. 또한 생성 과정에서 손실될 수 있는 원본 인물의 외형 정보를 보존하기 위해 인페인팅(inpainting) 기반 정제(refinement) 모듈을 추가하여 가려지지 않은 영역은 그대로 유지하면서 복원 영역만 자연스럽게 생성할 수 있도록 설계하였다.

다양한 사용자 프롬프트에 따른 복원 결과 예시
개발된 알고리즘은 공개 휴먼 아모달 완성 데이터셋(OccThuman2.0, AHP)에서 기존 최신 기법들보다 우수한 성능을 달성하였다. 특히 사용자가 지정한 자세 조건과의 정합성(pose alignment)을 크게 향상시켰으며, 복원된 영상의 시각적 품질과 사실성 또한 기존 방법 대비 높은 수준을 기록하였다. 실험 결과 기존 인간 영상 복원 방법뿐 아니라 자세 기반 인물 생성(pose-guided person image synthesis) 분야의 최신 기술들과 비교하여 모든 주요 성능 지표에서 우수한 결과를 달성하였다.
이번 연구는 사용자가 생성 결과를 직접 제어할 수 있는 인간 중심 생성형 인공지능(human-centric generative AI) 기술을 제시했다는 점에서 의의가 있다. 향후 디지털 휴먼 생성, 가상 의류 착용(virtual try-on), 콘텐츠 제작, 게임 및 메타버스 환경에서의 아바타 생성 등 다양한 분야에 활용될 것으로 기대된다.
한편 해당 연구 성과는 과학기술정보통신부 실감콘텐츠핵심기술개발사업(RS-2023-00219700)의 지원으로 수행되었으며, 6월 3일(수)~7일(일)의 일정으로 미국 덴버에서 개최된 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR 2026)에서 발표되었다. CVPR은 인공지능 및 컴퓨터비전 분야를 대표하는 세계 최고 권위의 국제 학술대회로, ECCV, ICCV와 함께 세계3대 컴퓨터비전 학회로 꼽힌다. 최근 생성형 인공지능과 멀티모달 인공지능 기술의 발전과 함께 전 세계 연구자들의 관심이 집중되고 있는 대표적인 학술대회 중 하나이다.