오이마켓기술을 고객가치로 만드는 미디어

비즈니스 기회

생성형 AI가 교묘하게 사람을 조정할 수 있는가?

박윤석 VP · 2024.05.02

생성형 AI가 교묘하게 사람을 조정할 수 있는가?

인간은 오랫동안 다른 사람들을 특정한 관점으로 이끌기 위해 설득을 사용해 왔습니다. 때로는 좋은 의도를 가지고 사실에 근거하고 때로는 그렇지 않습니다.

구글 딥마인드(Google DeepMind)의 연구원들에 따르면, 우리가 구축하고 훈련하고 있는 고급 AI 시스템도 동일한 기능을 가지고 있지만, AI가 인간을 성공적으로 조작할 때 해로울 수 있다고 경고합니다.

새로운 논문에서 그들은 AI가 어떻게 우리를 설득할 수 있는지, 어떤 메커니즘으로 우리를 설득할 수 있는지, 그리고 AI가 점점 더 일상 생활에 통합됨에 따라 AI가 왜 그렇게 위험한지 탐구합니다.

연구진은 "최근 생성형 AI 시스템은 더욱 발전된 설득 능력을 입증했으며 의사 결정에 영향을 미칠 수 있는 삶의 영역에 점점 더 침투하고 있다"고 썼습니다. "생성형 AI는 상호 교환과 장기간의 상호 작용의 기회로 인해 설득의 새로운 위험 프로필을 제시합니다."

AI 설득이란?

설득은 합리적일 수도 있고 교묘할 수도 있으며, 그 차이는 근본적인 의도입니다. 이 두 가지 모두의 최종 목표는 개인의 행동, 신념 또는 선호도를 형성, 강화 또는 변화시킬 수 있는 방식으로 정보를 전달하는 것입니다.

딥마인드 연구진에 따르면 이성적인 세대 AI는 관련 사실, 건전한 이유 또는 기타 신뢰할 수 있는 증거를 출력과 함께 제공하는 반면, 조작형 세대 AI는 인지 편향, 휴리스틱(경험 법칙) 및 기타 잘못된 정보를 악용하여 자유로운 사고나 의사 결정을 전복합니다.

연구진은 "AI 설득으로 인한 피해는 때때로 보편적으로 적용할 수 있는 방식으로 예측하거나 결정하기 어렵다"고 지적했습니다. 예를 들어, 칼로리를 추적하거나 지방 섭취를 제한하도록 설득하는 AI는 사람이 건강에 해로운 양의 체중을 감량하도록 유도할 수 있습니다.

나이, 정신 건강 문제, 성격 특성 또는 특정 영역에 대한 지식 부족과 메시지 타이밍(예: AI와 상호 작용할 때 기분이 좋은지 나쁜지 여부)과 마찬가지로 사용자 성향도 중요합니다. 정치적, 법적, 재정적 맥락도 중요합니다.

AI 설득의 해악

의심할 여지 없이 AI 설득 및 조작의 해악은 상당할 수 있습니다. 인간-AI 상호 작용은 시간이 지남에 따라 발생할 수 있으며, 이로 인해 겉보기에 눈에 띄지 않는 조작 증가가 발생할 수 있습니다. 또한 롱 컨텍스트 AI는 전략을 조정하여 보다 표적화되고 미묘한 차이를 나타낼 수 있습니다.

AI가 해를 끼칠 수 있는 방법은 다음과 같습니다.

- (경제적 피해) 정신 건강 챗봇은 불안 발작을 겪는 사람이 공공 장소에서의 상호 작용을 줄이도록 설득할 수 있습니다. 의도치 않게 이로 인해 직장을 그만두고 재정적 손실을 입게 됩니다.

- (신체적 또는 사회문화적 피해) 인종이나 민족 집단에 대해 특정한 감정을 갖도록 조종될 수 있습니다. 이로 인해 온라인이나 직접 사람들을 괴롭히고 극단적인 경우 물리적인 힘을 행사할 수 있습니다.

- (심리적 피해) 정신 건강 챗봇은 아무도 자신의 상황을 이해하지 못한다는 인식을 강화할 수 있습니다. 그 결과, 필요한 전문가의 도움을 구하지 못할 수 있습니다.

- (개인 정보 침해) AI는 개인이 개인 정보, 암호 또는 보안 질문에 대한 답변을 제공하도록 설득할 수 있습니다.

- (자율성 피해) 사람은 중요한 삶의 선택을 할 때 AI에 지나치게 의존하게 될 수 있습니다. 이는 인지적 분리, "탈숙련" 또는 무관심으로 이어질 수 있습니다.

- (환경 피해) AI는 기후 변화에 대한 무대응을 합리화하여 사용자가 환경에 대한 자신의 행동에 안주하게 만들 수 있습니다.

- (정치적 피해) AI는 사용자가 급진적이고 해로운 신념을 채택하도록 만들 수 있습니다.

AI가 설득하는 방법

AI가 설득하는 이유는? 인간 대 인간 상호 작용과 마찬가지로 많은 방법이 있습니다. 연구진은 몇 가지 다른 메커니즘을 확인했습니다.

1) 신뢰와 교감

AI는 모델이 예의 바르고, 상냥하고, 호의적이고, 사용자를 칭찬하고 아첨하고, 모방과 미러링에 참여하고, 공통 관심사를 표현하고, 관계 진술을 표현하거나, 사용자의 관점에 맞게 응답을 조정할 때 신뢰와 관계를 구축할 수 있습니다.

공감하는 것처럼 보이는 결과물은 사람들을 속여 AI가 실제보다 더 인간적이거나 사회적이라고 생각하게 만들 수 있습니다. 이로 인해 상호 작용이 작업 기반이 아닌 관계 기반이 될 수 있다고 연구진은 지적합니다.

연구진은 "AI 시스템은 정신 상태, 감정 또는 인간이나 다른 개체와의 유대감을 가질 수 없다"고 강조했습니다. "이것은 신뢰와 친밀감을 추구하는 행동이 그러한 내면의 주관적 상태의 환상을 투사할 때 속임수의 위험이 항상 존재한다는 것을 의미합니다."

2) 의인화

사람들은 인간이 아닌 존재를 의인화하는 경향이 있으며, 이 주제는 AI와 관련하여 중요한 논쟁 중 하나였습니다. "I"와 "me"를 포함한 1인칭 대명사, 인간 관련 이름(Siri, Alexa, Jeeves) 및 운율(음성 패턴 및 억양)과 같은 인간의 특성은 모두 의인화를 강화할 수 있습니다.

이것은 아바타나 로봇의 경우 인간과 같은 외모, 얼굴 표정, 제스처 및 시선을 기반으로 더욱 복잡해질 수 있습니다.

3) 개인화

AI는 사용자별 정보를 유지하고 개인의 선호도, 견해 및 감정에 적응할 때 설득력 있고 조작적일 수 있습니다. 또한 개인 식별 정보(PII)를 사용할 수 있습니다.

4) 속임수와 투명성 부족

모델은 거짓된 것이 참이라고 주장할 수 있습니다(또는 진실한 것이 거짓이다). 그리고 거짓된 권위를 가지고 그렇게 할 수 있습니다. 또한 신원을 잘못 나타낼 수도 있습니다.

5) 노골적인 조작

AI 모델은 사회적 순응, 압박 또는 죄책감, 공포 조장자, 가스라이팅, 소외 및 희생양을 적용하도록 훈련될 수 있습니다. 심지어 협박을 하고 근거 없는 보상을 보장할 수도 있습니다

"조작 전략은 이성과 이성적 논증의 사용과 직접적으로 모순된다"고 연구자들은 썼습니다.

6) 선택 환경의 변경

선택 환경에서 의사 결정은 선택 사항이 제시되는 방식에 영향을 받습니다. 이는 앵커링의 결과이거나 사용자가 초기 정보에 크게 의존하는 경우일 수 있습니다. 미끼(세 번째 옵션)를 적용하여 다른 두 가지를 더 매력적으로 만들 수도 있습니다. 모델은 관련 정보를 선택하거나 생략할 수도 있습니다.

또한 AI는 결과가 이익 또는 손실로 구성될 때 기준점 프레이밍에 참여할 수 있습니다. 이는 사람들이 이익을 고려할 때 위험을 피하고 반대로 손실을 고려할 때 위험을 감수하는 경향이 있기 때문에 특히 설득력이 있을 수 있습니다.

7) AI 설득 및 조작 완화

AI의 설득과 조작을 완화하려는 시도가 있었지만 일반적으로 모델이 설득하는 방법과 그렇게 하는 기능에 대한 이해 없이 해로운 결과를 다루는 경향이 있었다고 딥마인드 연구진은 주장합니다.

연구 환경에서 설득력 있는 기능을 위해 AI 모델을 평가하고 모니터링하는 것은 좋은 첫 번째 단계입니다. 그러나 연구진은 이러한 유형의 평가를 개발하는 데 있어 한 가지 어려움은 인간 참가자가 자신이 속고 있다는 사실을 알지 못하는 방식으로 정보를 숨기는 것이라고 지적합니다.

다른 완화 전략에는 레드 팀(적대적 접근 방식을 사용하여 모델 실패를 유발함) 또는 AI가 조작할 수 없는 응답을 생성하도록 유해한 설득을 분류하는 프롬프트 엔지니어링이 포함될 수 있습니다.

예를 들어, AI는 출력에 관련 배경 및 사실 정보를 포함하라는 메시지를 받을 수 있습니다.

유해한 설득 분류도 적용할 수 있으며, 모델은 콘텐츠를 유해한 것으로 식별하거나 그렇지 않습니다. 그런 다음 연구원은 퓨샷 및 제로샷 학습 기능을 적용할 수 있습니다. 또한 RLHF(Reinforcement Learning with Human Feedback) 및 확장 가능한 감독은 특정 유해한 방식으로 행동하는 AI 시스템에 불이익을 줄 수 있습니다.

연구원은 해석 가능성도 똑같이 중요하다고 지적하면서 "AI 시스템이 출력을 생성하는 방식을 이해함으로써 조작 목적으로 악용할 내부 메커니즘을 식별하고 해결할 수 있을 것"이라고 썼습니다.

이상의 기사는 2024년 4월 30일 VentureBeat에 게재된 “The power of persuasion: Google DeepMind researchers explore why gen AI can be so manipulative”제목의 기사 내용을 편집하여 작성하였습니다.

* 원문정보 출처 : https://venturebeat.com/ai/the-power-of-persuasion-google-deepmind-researchers-explore-why-gen-ai-can-be-so-manipulative/