오이마켓기술을 고객가치로 만드는 미디어

비즈니스 기회

LLM(대규모 언어 모델)의 신경망 내부 들여다보기

박윤석 VP · 2024.05.23

LLM(대규모 언어 모델)의 신경망 내부 들여다보기

대부분의 컴퓨터 프로그램(복잡한 프로그램 포함)에서는 코드와 메모리 사용량을 꼼꼼하게 추적하여 해당 프로그램이 특정 동작이나 출력을 생성하는 이유를 파악할 수 있습니다.

생성형 AI 분야에서는 일반적으로 그렇지 않은데, 이러한 모델의 기반이 되는 해석 불가능한 신경망으로 인해 전문가조차도 정보를 자주 혼동하는 이유를 정확히 파악하기 어렵습니다.

이제 Anthropic의 새로운 연구는 Claude LLM의 "블랙 박스" 내부에서 무슨 일이 일어나고 있는지에 대한 새로운 창을 제공합니다. "클로드 3 소네트에서 해석가능한 특징 추출"에 대한 회사의 새로운 논문은 모델의 수백만 개의 인공 뉴런이 일반적인 쿼리에 대해 놀랍도록 생생한 응답을 생성하기 위해 어떻게 발화하는지 적어도 부분적으로 설명하는 강력한 새로운 방법을 설명합니다.

후드 열기

LLM을 분석할 때 특정 쿼리에 대한 응답으로 활성화되는 특정 인공 뉴런을 확인하는 것은 간단합니다. 그러나 LLM은 단순히 하나의 뉴런에 서로 다른 단어나 개념을 저장하지 않습니다. 대신, Anthropic의 연구자들이 설명하듯이, 각 개념은 많은 뉴런에 걸쳐 표현되고, 각 뉴런은 많은 개념을 표현하는 데 관여한다는 것이 밝혀졌습니다.

이러한 일대다 및 다대일 혼란을 분류하기 위해 희소 자동 인코더 시스템과 복잡한 수학 시스템을 사용하여 모델 전체에서 "사전 학습" 알고리즘을 실행할 수 있습니다. 이 프로세스는 다양한 텍스트 프롬프트에 나타나는 특정 단어에 대해 가장 일관되게 활성화되는 경향이 있는 뉴런 그룹을 강조합니다.

이러한 다차원 뉴런 패턴은 특정 단어나 개념과 관련된 소위 "특징"으로 분류됩니다. 이러한 기능은 금문교와 같은 간단한 고유 명사부터 프로그래밍 오류 또는 컴퓨터 코드의 덧셈 함수와 같은 보다 추상적인 개념에 이르기까지 모든 것을 포함할 수 있으며 여러 언어 및 통신 모드(예: 텍스트 및 이미지)에서 동일한 개념을 나타내는 경우가 많습니다.

2023년 10월 Anthropic 연구는 이 기본 프로세스가 매우 작은 단층 장난감 모델에서 어떻게 작동할 수 있는지 보여주었습니다. 이 회사의 새로운 논문은 이를 엄청나게 확장하여 중간 크기의 Claude 3.0 Sonnet 모델에서 활성화된 수천만 개의 기능을 식별합니다. 그 결과로 나온 특징 지도(부분적으로 탐색할 수 있음)는 "계산의 중간에 내부 상태에 대한 대략적인 개념도"를 만들고 "소네트의 고급 능력을 반영하는 깊이, 폭 및 추상화"를 보여준다고 연구자들은 썼습니다. 그러나 동시에 연구자들은 이것이 "모델의 내부 표현에 대한 불완전한 설명"이며 Claude 3의 완전한 매핑보다 "수십 배"더 작을 가능성이 있다고 경고합니다.

표면적인 수준에서도 이 기능 맵을 탐색하면 Claude가 특정 키워드, 문구 및 개념을 근사치에 가까운 지식으로 연결하는 방법을 보여주는 데 도움이 됩니다. 예를 들어, "수도"라는 레이블이 지정된 기능은 "수도"라는 단어뿐만 아니라 리가, 베를린, 아제르바이잔, 이슬라마바드, 버몬트 주 몽펠리에와 같은 특정 도시 이름에서도 강력하게 활성화되는 경향이 있습니다.

이 연구는 또한 뉴런 유사성을 기반으로 서로 다른 특징 사이의 "거리"에 대한 수학적 측정을 계산합니다. 연구진은 이 과정에서 발견된 "특징 이웃"은 "종종 의미론적 관계를 공유하는 기하학적으로 관련된 클러스터로 구성된다"며 "AI 모델의 개념 내부 조직은 유사성에 대한 인간의 개념과 적어도 어느 정도 일치한다"고 썼습니다. 예를 들어, 금문교 특집은 "알카트라즈 섬, 기라델리 광장, 골든 스테이트 워리어스, 캘리포니아 주지사 개빈 뉴섬, 1906년 지진, 샌프란시스코를 배경으로 한 알프레드 히치콕 감독의 영화 현기증"을 묘사하는 특집과 비교적 "가까운" 편입니다.

(인공적인) 마음을 바꾸세요

LLM이 정보를 저장하는 방식을 매핑하는 것 이상으로, 클로드의 내부 작동에 대한 이러한 종류의 지식은 매우 구체적인 방식으로 모델의 동작을 조정하는 데에도 사용될 수 있습니다. 특정 기능에 대한 값을 인위적으로 높거나 낮게 "고정"한 후 Claude 모델은 매우 이상한 동작을 나타내기 시작할 수 있습니다. 예를 들어, 금문교 기능을 증폭하면 모델이 "나는 금문교입니다... 내 육체적 형태는 상징적인 다리 그 자체입니다..."

이러한 종류의 행동 관련 결과는 "특징은 모델이 내부적으로 세계를 표현하는 방법과 이러한 표현을 동작에 사용하는 방법의 충실한 부분일 가능성이 높다"는 것을 시사합니다.

때때로, 특징과 행동 사이의 연결은 비교적 직접적입니다. 높은 수준의 편견 관련 특징은 "모델이 혐오스러운 비판을 하게 만든다"라고 연구자들은 썼습니다. 다른 경우에는 효과가 더 미묘합니다. "sycophantic praise"와 관련된 기능을 제한하면 프롬프터의 능력을 평가하는 정확도가 높아지는 반면, "내부 갈등" 기능을 높은 값으로 고정하면 모델이 정보를 "잊어버리는" 능력에 대해 지속적으로 거짓말을 하지 않게 됩니다.

"흥미로운 점은 이러한 특징이 존재한다는 것이 아니라 대규모로 발견되고 개입할 수 있다는 것입니다." 저자들은 이 초기 연구에 대해 썼습니다. "예를 들어, 우리는 모델이 우리에게 기만적인지 거짓말을 하고 있는지 확실하게 알 수 있기를 바랄 수 있습니다. 또는 특정 범주의 매우 해로운 행동(예: 생물 무기 제조 지원)을 안정적으로 탐지하고 중지할 수 있기를 바랄 수 있습니다."

연구진은 이러한 종류의 행동 관련 모델 조정은 여전히 매우 거칠며, 안전상의 이유로 기능을 변경하는 잠재적인 다운스트림 효과를 식별하기 위해 더 많은 연구가 필요하다고 경고합니다.

그러나 이 초기 단계에서도, Anthropic의 연구는 LLM의 "블랙박스" 결과를 훨씬 더 해석가능하고 잠재적으로 제어 가능하게 만들기 위한 흥미로운 프레임워크를 제공합니다.

이상의 기사는 2024년 5월 23일 ArsTechnica에 게재된 “Here’s what’s really going on inside an LLM’s neural network”제목의 기사 내용을 편집하여 작성하였습니다.

* 원문정보 출처 : https://arstechnica.com/ai/2024/05/heres-whats-really-going-on-inside-an-llms-neural-network/