오이마켓기술을 고객가치로 만드는 미디어

비즈니스 기회

Meta, 최첨단 멀티모달 모델인 카멜레온 출시

박윤석 VP · 2024.05.23

Meta, 최첨단 멀티모달 모델인 카멜레온 출시

생성형 AI 분야의 경쟁이 멀티모달 모델로 이동함에 따라 Meta는 프론티어 랩스에서 출시한 모델에 대한 해답이 될 수 있는 프리뷰를 공개했습니다. 새로운 모델 제품군인 Chameleon은 다양한 양식의 구성 요소를 결합하는 대신 기본적으로 다중 모드로 설계되었습니다.

메타는 아직 모델을 공개하지 않았지만, 보고된 실험에 따르면 카멜레온은 이미지 캡션 및 시각적 질문 답변(VQA)을 포함한 다양한 작업에서 최첨단 성능을 달성하는 동시에 텍스트 전용 작업에서 경쟁력을 유지하고 있습니다.

카멜레온의 아키텍처는 시각 및 텍스트 정보에 대한 깊은 이해가 필요한 새로운 AI 애플리케이션을 잠금 해제할 수 있습니다.

초기 융합 멀티모달 모델

다중 모드 기초 모델을 만드는 일반적인 방법은 다양한 형식에 대해 학습된 모델을 함께 패치하는 것입니다. 이 접근 방식을 "후기 융합"이라고 하며, AI 시스템이 서로 다른 모달리티를 수신하고 별도의 모델로 인코딩한 다음 추론을 위해 인코딩을 융합합니다. 후기 융합은 잘 작동하지만 여러 모달리티 간에 정보를 통합하고 인터리브 이미지 및 텍스트 시퀀스를 생성하는 모델의 기능을 제한합니다.

카멜레온은 "초기 융합 토큰 기반 혼합 모달" 아키텍처를 사용하는데, 이는 이미지, 텍스트, 코드 및 기타 양식의 인터리브 혼합에서 학습하도록 처음부터 설계되었음을 의미합니다. 카멜레온은 언어 모델이 단어를 사용하는 것처럼 이미지를 개별 토큰으로 변환합니다. 또한 텍스트, 코드 및 이미지 토큰으로 구성된 통합 어휘를 사용합니다. 이렇게 하면 이미지 토큰과 텍스트 토큰을 모두 포함하는 시퀀스에 동일한 변환기 아키텍처를 적용할 수 있습니다.

연구진에 따르면 카멜레온과 가장 유사한 모델은 구글 제미니(Google Gemini)로, 이 모델도 초기 융합 토큰 기반 접근 방식을 사용합니다. 그러나 Gemini는 생성 단계에서 별도의 이미지 디코더를 사용하는 반면 Chameleon은 토큰을 처리하고 생성하는 엔드 투 엔드 모델입니다.

연구진은 "카멜레온의 통합 토큰 공간을 통해 형식별 구성 요소 없이도 인터리브 이미지 및 텍스트 시퀀스를 원활하게 추론하고 생성할 수 있다"고 주장합니다.

초기 융합은 매우 매력적이지만 모델을 훈련하고 확장할 때 상당한 문제가 발생합니다. 이러한 문제를 극복하기 위해 연구원들은 일련의 아키텍처 수정 및 교육 기술을 사용했습니다. 논문에서 그들은 다양한 실험과 모델에 미치는 영향에 대한 세부 정보를 공유합니다.

카멜레온의 훈련은 4조 4천억 개의 텍스트 토큰, 이미지-텍스트 쌍, 인터리브된 텍스트와 이미지 시퀀스를 포함하는 데이터 세트와 함께 두 단계로 진행됩니다. 연구진은 500만 시간 이상의 엔비디아 A100 80GB GPU에서 70억 개 및 340억 개의 파라미터 버전의 카멜레온을 훈련시켰습니다.

카멜레온의 활약

논문에 보고된 실험에 따르면 카멜레온은 다양한 텍스트 전용 및 다중 모드 작업을 수행할 수 있습니다. 시각적 질문 답변(VQA) 및 이미지 캡션 벤치마크에서 Chameleon-34B는 Flamingo, IDEFICS 및 Llava-1.5와 같은 모델을 능가하는 최첨단 성능을 달성했습니다.

연구원에 따르면 카멜레온은 "사전 훈련된 모델 평가와 미세 조정된 모델 평가 모두에서 훨씬 적은 수의 컨텍스트 내 학습 예제와 더 작은 모델 크기"로 다른 모델의 성능을 일치시킵니다.

다중 모달리티의 단점 중 하나는 단일 모달리티 요청의 성능 저하입니다. 예를 들어 비전 언어 모델은 텍스트 전용 프롬프트에서 성능이 떨어지는 경향이 있습니다. 그러나 Chameleon은 상식적인 추론 및 독해력 작업에서 Mixtral 8x7B 및 Gemini-Pro와 같은 모델과 일치하는 텍스트 전용 벤치마크에서 경쟁력을 유지하고 있습니다.

흥미롭게도 Chameleon은 특히 프롬프트가 텍스트와 이미지가 인터리브된 혼합 모드 응답을 예상하는 경우 혼합 모드 추론 및 생성을 위한 새로운 기능을 잠금 해제할 수 있습니다. 사람이 평가한 응답을 사용한 실험에 따르면 전반적으로 사용자는 Chameleon에서 생성된 다중 모드 문서를 선호했습니다.

지난주 OpenAI와 Google은 풍부한 멀티모달 경험을 제공하는 새로운 모델을 공개했습니다. 그러나 그들은 모델에 대한 많은 세부 정보를 공개하지 않았습니다. 메타가 계속해서 플레이북을 따르고 카멜레온의 가중치를 공개한다면 개인 모델에 대한 개방형 대안이 될 수 있습니다.

초기 융합은 특히 더 많은 양식이 추가됨에 따라 더 발전된 모델에 대한 연구를 위한 새로운 방향에 영감을 줄 수 있습니다. 예를 들어, 로보틱스 스타트업은 이미 언어 모델을 로보틱스 제어 시스템에 통합하는 실험을 하고 있습니다. 초기 융합이 로봇 기반 모델을 어떻게 개선할 수 있는지 보는 것은 흥미로울 것입니다.

연구진은 "카멜레온은 멀티모달 콘텐츠를 유연하게 추론하고 생성할 수 있는 통합 기반 모델의 비전을 실현하기 위한 중요한 단계를 나타낸다"고 썼습니다.

이상의 기사는 2024년 5월 21일 VentureBeat에 게재된 “Meta introduces Chameleon, a state-of-the-art multimodal model”제목의 기사 내용을 편집하여 작성하였습니다.

* 원문정보 출처 : https://venturebeat.com/ai/meta-introduces-chameleon-a-state-of-the-art-multimodal-model/