오이마켓기술을 고객가치로 만드는 미디어

비즈니스 기회

비디오를 보는 것 만으로도 언어를 발견하는 새로운 알고리즘

박윤석 VP · 2024.06.12

비디오를 보는 것 만으로도 언어를 발견하는 새로운 알고리즘

MIT 전기 공학 및 컴퓨터 과학 박사 과정 학생이자 MIT 컴퓨터 과학 및 인공 지능 연구소(CSAIL)의 소속 연구원인 마크 해밀턴(Mark Hamilton)은 기계를 사용하여 동물이 의사 소통하는 방식을 이해하고자 합니다. 이를 위해 그는 먼저 인간의 언어를 "처음부터" 배울 수 있는 시스템을 만드는 작업에 착수했습니다.

"재미있게도, 영감의 중요한 순간은 영화 '펭귄의 행진'에서 나왔습니다. 펭귄이 얼음을 건너다가 넘어지고, 일어나면서 약간 힘겨운 신음을 내뱉는 장면이 있습니다. 당신이 그것을 볼 때, 이 신음은 네 글자 단어를 대신하고 있다는 것이 거의 분명합니다. 언어를 배우기 위해 오디오와 비디오를 사용해야 할 수도 있겠다는 생각이 드는 순간이었습니다." 해밀턴의 말입니다. "알고리즘이 하루 종일 TV를 시청하고 이것으로 우리가 말하는 것을 알아낼 수 있는 방법이 있습니까?"

"우리 모델인 DenseAV는 듣는 것에서 보는 것을 예측하고 그 반대의 경우도 마찬가지인 언어를 학습하는 것을 목표로 합니다. 예를 들어, 누군가 '350도에서 케이크를 굽으세요'라고 말하는 소리가 들리면 케이크나 오븐을 보고 있을 가능성이 있습니다. 수백만 개의 비디오에 대한 오디오-비디오 매칭 게임에서 성공하려면 모델이 사람들이 말하는 내용을 학습해야 합니다"라고 Hamilton은 말합니다.

이 매칭 게임에서 DenseAV를 훈련시킨 후, 해밀턴과 그의 동료들은 모델이 소리를 들을 때 어떤 픽셀을 찾는지 살펴보았습니다. 예를 들어, 누군가 "개"라고 말하면 알고리즘은 즉시 비디오 스트림에서 개를 찾기 시작합니다. 알고리즘에 의해 어떤 픽셀이 선택되는지 확인하면 알고리즘이 단어의 의미를 어떻게 생각하는지 알 수 있습니다.

흥미롭게도 DenseAV가 개 짖는 소리를 들을 때 유사한 검색 프로세스가 발생합니다.

"이것은 우리의 관심을 불러일으켰습니다. 우리는 알고리즘이 '개'라는 단어와 개 짖는 소리의 차이를 알고 있는지 확인하고 싶었습니다"라고 해밀턴은 말합니다. 연구팀은 DenseAV에 "양면 뇌"를 부여하여 이를 탐구했습니다. 흥미롭게도, 그들은 DenseAV의 뇌의 한쪽이 자연스럽게 "개"라는 단어와 같은 언어에 초점을 맞추고 다른 쪽은 짖는 소리와 같은 소리에 초점을 맞춘다는 것을 발견했습니다. 이를 통해 DenseAV는 단어의 의미와 소리의 위치를 학습했을 뿐만 아니라 사람의 개입이나 문어에 대한 지식 없이 이러한 유형의 교차 모드 연결을 구별하는 방법도 배웠습니다.

응용 프로그램의 한 분야는 매일 인터넷에 게시되는 방대한 양의 비디오를 통해 학습하는 것입니다.

"우리는 교육용 비디오와 같은 방대한 양의 비디오 콘텐츠로부터 학습할 수 있는 시스템을 원합니다"라고 Hamilton은 말합니다. "또 다른 흥미로운 응용 분야는 돌고래나 고래의 의사소통과 같이 문자로 된 의사소통 형태가 없는 새로운 언어를 이해하는 것입니다. 우리의 희망은 DenseAV가 처음부터 인간의 번역 노력을 피한 이러한 언어를 이해하는 데 도움이 될 수 있다는 것입니다. 마지막으로, 우리는 이 방법을 사용하여 지구가 내는 지진음과 지질학과 같은 다른 신호 쌍 사이의 패턴을 발견할 수 있기를 바랍니다."

팀 앞에는 텍스트 입력 없이 언어를 배우는 만만치 않은 과제가 놓여 있었습니다. 그들의 목표는 사전 훈련된 언어 모델을 사용하지 않고 백지 상태에서 언어의 의미를 재발견하는 것이었습니다. 이 접근 방식은 아이들이 언어를 이해하기 위해 환경을 관찰하고 들으면서 배우는 방법에서 영감을 받았습니다.

이상의 기사는 2024년 6월 11일 TechXplore에 게재된 “New algorithm discovers language just by watching videos”제목의 기사 내용을 편집하여 작성하였습니다.

* 원문정보 출처 : New algorithm discovers language just by watching videos (techxplore.com)

* 추가정보 출처 : [2406.05629] Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language (arxiv.org)