비즈니스 기회
인간의 얼굴 사진을 말하고 노래하게 만드는 AI 프레임워크

Microsoft는 AI 기반 콘텐츠 생성 분야에서 큰 도약을 이루었습니다. 불과 몇 시간 전, 사티아 나델라(Satya Nadella)가 이끄는 회사의 연구 부서는 인간의 얼굴 사진을 말하고 노래하는 비디오로 변환할 수 있는 AI 프레임워크인 VASA-1을 발표했습니다.
이 프로젝트는 매우 최소한의 입력으로 작동하기 때문에 AI 생성 콘텐츠에서 달성한 것에 상당한 변화를 나타냅니다. 하나의 정적 헤드샷과 음성이 포함된 오디오 파일만 있으면 모델이 립싱크 및 관련 표정과 머리 움직임으로 완성되어 생동감을 불어넣습니다.
Microsoft는 Mona Lisa 랩을 포함하여 프레임워크의 기량을 보여주는 여러 샘플을 공유했습니다. 그러나 이러한 기술에서 딥페이크가 생성될 위험이 명백하다는 점을 감안할 때 회사는 이것이 연구 데모일 뿐이며 기술을 시장에 출시할 계획이 없다고 강조했습니다.
Microsoft VASA는 정적 이미지에 생명을 불어넣습니다
오늘날 AI 콘텐츠, 특히 비디오를 생성하는 도구는 양날의 검입니다. 광고 프로젝트를 위한 장면 제작과 같은 긍정적인 응용 프로그램이나 딥페이크 제작 및 사람/유명인의 평판을 손상시키는 것과 같은 유해한 행위에 사용할 수 있습니다.
하지만 여기서 까다로운 점은 딥페이크조차도 긍정적인 응용을 할 수 있다는 것입니다. 광고 프로젝트나 소셜 미디어 프로모션을 위해 디지털 복제본을 만드는 데 동의하는 아티스트를 상상해 보십시오. Microsoft는 VASA-1을 통해 "매력적인 시각 정서 기술(VAS)을 가진 가상 캐릭터의 실제와 같은 말하는 얼굴을 생성하는 것"을 통해 딥페이크 제작의 미세한 라인을 걷고 있습니다.
회사에 따르면 프리미어 모델은 사람의 얼굴 정지 이미지와 음성 오디오 파일을 제공하면 오디오와 동기화된 입술 움직임은 물론 다양한 감정, 얼굴 뉘앙스 및 자연스러운 머리 움직임으로 완성되어 진정성과 생동감을 인식하는 데 기여합니다. 심지어 한 사람의 얼굴 사진을 같은 사람이 말하거나 노래하는 동영상으로 변환하는 방법을 보여주는 여러 예시를 공유했습니다.
VASA의 연구원들은 회사 웹사이트에 "핵심 혁신에는 얼굴 잠재 공간에서 작동하는 전체론적 얼굴 역학 및 머리 움직임 생성 모델과 비디오를 사용하여 이러한 표현적이고 얽히지 않은 얼굴 잠재 공간의 개발이 포함됩니다"라고 썼습니다.
더 중요한 것은 기술을 통해 사용자가 자신의 세대를 제어할 수 있어 슬라이더를 위아래로 움직이기만 하면 모션 시퀀스, 시선 응시 방향, 머리 거리 및 감정과 같은 측면을 조정할 수 있다는 점에 주목했습니다. 또한 예술 사진, 노래 오디오 및 비영어 음성을 포함하여 교육 데이터 세트에 포함되지 않은 콘텐츠에서 작동할 수 있습니다.
실제 VASA 구현을 위해서는 갈 길이 멉니다
Microsoft에서 공유한 샘플은 특히 경우에 따라 실제처럼 보이지만 많은 클립이 AI로 생성되었음을 알려줍니다. 움직임이 매끄럽게 보이지 않습니다. 이 회사는 이 접근 방식이 오프라인 일괄 처리 모드에서 45fps로 512 X 512 비디오를 생성하고 온라인 스트리밍 모드에서 최대 40fps를 지원할 수 있다고 말합니다. 심지어 완전히 새로운 메트릭 세트에 대한 비교를 포함하여 광범위한 실험을 통해 테스트했을 때 이 분야의 다른 방법보다 성능이 우수하다고 주장합니다.
그렇긴 하지만, 이런 종류의 작품은 사람의 나쁜 이미지를 묘사하는 데 쉽게 악용될 수 있다는 점에 유의하는 것이 중요합니다. 이것이 Microsoft가 VASA를 제품 또는 API로 릴리스하지 않는 이유입니다. 회사는 데모 클립에 등장하는 모든 사람의 얼굴 사진이 AI를 사용하여 생성되었으며 이 기술은 주로 가상 AI 아바타에 대한 시각적 정서적 기술을 생성하는 것을 목표로 하며, 오도하거나 속이는 데 사용되는 콘텐츠가 아닌 긍정적인 응용 프로그램을 목표로 한다고 강조했습니다.
장기적으로 Microsoft는 VASA 연구를 인간의 움직임과 감정을 모방하는 실물과 같은 아바타를 향한 단계로 보고 있습니다. 이는 교육 형평성을 강화하고, 의사소통에 문제가 있는 개인을 위한 접근성을 개선하고, 도움이 필요한 사람들에게 교제 또는 치료 지원을 제공하는 데 도움이 될 수 있다고 회사는 말합니다.
이상의 기사는 2024년 4월 18일 Venturebeat에 게재된 “Microsoft shows off VASA-1, an AI framework that makes human headshots talk, sing”제목의 기사 내용을 편집하여 작성하였습니다.
* 원문정보 출처 : https://venturebeat.com/ai/microsoft-shows-off-vasa-1-an-ai-framework-that-makes-human-headshots-talk-sing/