오이마켓기술을 고객가치로 만드는 미디어

비즈니스 기회

Gen AI는 인터넷을 망가뜨릴 수 있습니다

박윤석 VP · 2024.07.31

Gen AI는 인터넷을 망가뜨릴 수 있습니다

합성 데이터로 훈련된 생성형 인공 지능(AI) 모델은 아티팩트로 인해 점진적으로 손상되는 출력을 생성합니다. 이 예에서 연구원들은 완전 합성 데이터를 사용하여 StyleGAN-2 생성 모델을 연속적으로 훈련했습니다. 6개의 이미지 열에는 각각 1세대, 3세대, 5세대 및 9세대 모델에서 생성된 몇 가지 예가 표시됩니다. 루프가 반복될 때마다 교차 해칭된 아티팩트가 점진적으로 증폭됩니다. 크레딧: Digital Signal Processing Group/Rice University

OpenAI의 GPT-4o 또는 Stability AI의 Stable Diffusion과 같은 생성형 인공 지능(AI) 모델은 새로운 텍스트, 코드, 이미지 및 비디오를 생성하는 데 놀라울 정도로 능력이 있습니다. 그러나 이들을 교육하려면 방대한 양의 데이터가 필요하기 때문에 개발자들은 이미 공급 제한에 부딪히고 있으며 곧 교육 리소스를 완전히 고갈시킬 수 있습니다.

이러한 데이터 부족 상황에서 미래 세대의 AI 모델을 훈련시키기 위해 합성 데이터를 사용하는 것은 다음과 같은 여러 가지 이유로 빅테크에 매력적인 옵션처럼 보일 수 있습니다. AI 합성 데이터는 실제 데이터보다 저렴하고 공급 측면에서 사실상 무제한입니다. 개인 정보 보호 위험이 적습니다. 그리고 경우에 따라 합성 데이터가 AI 성능을 향상시킬 수도 있습니다.

그러나 라이스 대학(Rice University)의 디지털 신호 처리 그룹의 최근 연구에 따르면 합성 데이터의 식단은 생성형 AI 모델의 향후 반복에 상당한 부정적인 영향을 미칠 수 있습니다.

"이 합성 데이터 훈련이 필연적으로 반복되어 일종의 피드백 루프를 형성 할 때 문제가 발생합니다. 우리가 자동 포식 또는 '자기 소비'루프라고 부르는 것"이라고 Rice의 C. Sidney Burrus 전기 및 컴퓨터 공학 교수 인 Richard Baraniuk는 말했습니다. "우리 그룹은 이러한 피드백 루프에 대해 광범위하게 작업해 왔으며, 나쁜 소식은 이러한 교육을 몇 세대만 거치더라도 새 모델이 돌이킬 수 없을 정도로 손상될 수 있다는 것입니다. 이를 일부 사람들은 '모델 붕괴(model collapse)'라고 불렀으며, 가장 최근에는 대규모 언어 모델(LLM)의 맥락에서 이 분야의 동료들에 의해 명명되었습니다. 그러나 우리는 '모델 자가포식 장애'(MAD)라는 용어가 광우병에 비유하는 데 더 적합하다고 생각합니다."

광우병은 소에게 영향을 미치는 치명적인 신경 퇴행성 질환으로, 감염된 육류 섭취로 인해 인간에서도 동등하게 발생합니다. 1980-90년대에 발생한 대규모 발병은 광우병이 도살된 동료의 가공된 찌꺼기를 소에게 먹이는 관행의 결과로 확산되었다는 사실에 주목하게 되었습니다. 따라서 "자아"를 의미하는 그리스어 auto-와 "먹다"를 의미하는 phagy에서 유래한 "autophagy"라는 용어가 사용되었습니다.

바라니우크는 "우리는 자가포식 훈련의 단점을 더 잘 강조하기 위해 시각 AI 모델을 개발하기로 결정했지만, 다른 그룹이 지적한 것처럼 LLM에서도 동일한 광우병 부패 문제가 발생합니다."라고 말했습니다.

인터넷은 일반적으로 생성형 AI 모델의 훈련 데이터 세트의 소스이므로 합성 데이터가 온라인에서 확산됨에 따라 모델이 새로 생성될 때마다 자체 소비적인 루프가 나타날 가능성이 높습니다. 이것이 어떻게 진행될 수 있는지에 대한 다양한 시나리오에 대한 통찰력을 얻기 위해 Baraniuk와 그의 팀은 실제 데이터와 합성 데이터가 생성 모델을 위한 훈련 데이터 세트에 결합되는 방법을 사실적으로 표현하도록 설계된 자체 소비 훈련 루프의 세 가지 변형을 연구했습니다.

- 완전 합성 루프(Fully synthetic loop)--생성 모델의 후속 세대에는 이전 세대의 출력에서 샘플링된 완전 합성 데이터 다이어트가 제공되었습니다.

- 합성 증강 루프--모델의 각 세대에 대한 훈련 데이터 세트에는 이전 세대에서 샘플링된 합성 데이터와 고정된 실제 훈련 데이터 세트의 조합이 포함되었습니다.

- 새로운 데이터 루프--모델의 각 세대는 이전 세대의 합성 데이터와 새로운 실제 교육 데이터 세트의 혼합으로 학습됩니다.

루프의 점진적인 반복은 시간이 지남에 따라 새로운 실제 데이터가 충분하지 않은 경우 모델이 품질, 다양성 또는 둘 다 부족한 점점 더 뒤틀린 출력을 생성한다는 것을 보여주었습니다. 즉, 최신 데이터가 많을수록 AI가 더 건강해집니다.

모델의 연속적인 생성으로 인한 이미지 데이터 세트를 나란히 비교하면 잠재적인 AI 미래에 대한 섬뜩한 그림이 그려집니다. 사람의 얼굴로 구성된 데이터셋은 저자가 '생성적 인공물'이라고 부르는 격자 모양의 흉터로 점점 더 줄무늬가 생기거나 점점 더 같은 사람처럼 보입니다. 숫자로 구성된 데이터셋은 해독할 수 없는 낙서로 변형됩니다.

바라니우크는 "우리의 이론적, 경험적 분석을 통해 생성 모델이 유비쿼터스가 되고 미래 모델을 자체 소비 루프에서 훈련할 때 일어날 수 있는 일을 추정할 수 있었습니다. 몇 가지 파급 효과는 분명합니다: 새로운 실제 데이터가 충분하지 않으면 미래의 생성 모델은 미친듯이 변할 운명에 처해 있습니다."라고 말했습니다.

이러한 시뮬레이션을 더욱 현실적으로 만들기 위해 연구진은 "체리 피킹(cherry picking)", 즉 사용자가 다양성보다 데이터 품질을 선호하는 경향, 즉 데이터 세트의 이미지 및 텍스트 유형의 다양성을 균형 있게 보이거나 좋은 이미지를 얻기 위해 절충하는 경향을 설명하기 위해 샘플링 편향 매개변수를 도입했습니다.

체리 피킹(cherry picking)의 인센티브는 더 많은 모델 반복을 통해 데이터 품질이 유지된다는 것이지만, 이는 다양성의 훨씬 더 가파른 감소를 희생하게 됩니다.

바라니우크는 "한 가지 최후의 날 시나리오는 MAD가 여러 세대에 걸쳐 통제되지 않고 방치될 경우 전체 인터넷의 데이터 품질과 다양성을 오염시킬 수 있습니다. 이와는 별개로, 가까운 시일 내에 AI 자가포식으로 인해 지금까지 보이지 않는 의도하지 않은 결과가 발생하는 것은 불가피해 보입니다."라고 말했습니다.

이상의 기사는 2024년 7월 30일 TechXplore에 게재된 “Breaking MAD: Generative AI could break the internet”제목의 기사 내용을 편집하여 작성하였습니다.

* 원문정보 출처 : Breaking MAD: Generative AI could break the internet (techxplore.com)