오이마켓기술을 고객가치로 만드는 미디어

비즈니스 기회

일론머스크의 AI 슈퍼컴퓨터 구축계획

박윤석 VP · 2024.08.06

일론머스크의 AI 슈퍼컴퓨터 구축계획

수년 동안 Elon Musk는 Tesla의 AI 야망의 초석이 될 AI 슈퍼컴퓨터인 Dojo에 대해 이야기해 왔습니다. 머스크는 최근 테슬라가 10월에 로보택시 공개를 준비함에 따라 회사의 AI 팀이 도조를 두 배로 늘릴 것이라고 말했습니다.

그렇다면 Dojo는 정확히 무엇일까요? 그리고 이것이 Tesla의 장기 전략에 그토록 중요한 이유는 무엇입니까?

Dojo는 "완전 자율 주행" 신경망을 훈련하도록 설계된 Tesla의 맞춤형 슈퍼컴퓨터입니다. Dojo를 강화하는 것은 완전 자율 주행에 도달하고 로보택시를 시장에 출시하려는 Tesla의 목표와 밀접한 관련이 있습니다.

현재 약 200만 대의 Tesla 차량에 탑재되어 있는 FSD(Full Self Driving)는 일부 자율 주행 작업을 수행할 수 있지만 여전히 사람이 운전석에서 주의를 기울여야 합니다.

테슬라는 8월로 예정됐던 로보택시 공개를 10월로 연기했지만, 머스크의 공개 발언과 테슬라 내부 소식통의 정보는 자율주행이라는 목표가 사라지지 않을 것임을 말해줍니다.

그리고 Tesla는 그 위업을 달성하기 위해 AI와 Dojo에 큰 비용을 지출할 준비가 되어 있는 것으로 보입니다.

Tesla의 Dojo 배경 이야기

머스크는 테슬라가 단순한 자동차 제조업체나 태양 전지판과 에너지 저장 시스템의 공급업체가 되는 것을 원하지 않는다. 대신 그는 테슬라가 인간의 인식을 모방하여 자율 주행 자동차의 암호를 해독한 AI 회사가 되기를 원합니다.

자율 주행 차량 기술을 구축하는 대부분의 다른 회사는 라이다, 레이더, 카메라와 같이 세상을 인식하기 위한 센서와 차량의 위치를 파악하기 위한 고화질 지도의 조합에 의존합니다. Tesla는 카메라에만 의존하여 시각적 데이터를 캡처한 다음 고급 신경망을 사용하여 해당 데이터를 처리하고 자동차가 어떻게 작동해야 하는지에 대한 빠른 결정을 내림으로써 완전한 자율 주행을 달성할 수 있다고 믿습니다.

테슬라의 전 AI 책임자인 안드레이 카르파티(Andrej Karpathy)가 2021년 테슬라의 첫 번째 AI 데이에서 말했듯이, 테슬라는 기본적으로 "처음부터 합성 동물"을 만들려고 노력하고 있습니다. 머스크는 2019년부터 도조를 놀려왔지만, 테슬라는 AI 데이에서 공식으로 발표했습니다.

알파벳(Alphabet)의 웨이모(Waymo)와 같은 회사들은 SAE(Society of Automotive Engineers)가 특정 조건에서 인간의 개입 없이 스스로 운전할 수 있는 시스템으로 정의하는 레벨 4 자율주행 차량을 보다 전통적인 센서 및 머신 러닝 접근 방식을 통해 상용화했습니다. Tesla는 아직 사람이 운전석에 앉을 필요가 없는 자율 시스템을 생산하지 못했습니다.

약 180만 명의 사람들이 현재 8,000달러에서 최고 15,000달러에 달하는 Tesla의 FSD에 대한 막대한 구독료를 지불했습니다. Dojo에서 훈련된 AI 소프트웨어는 결국 무선 업데이트를 통해 테슬라 고객에게 제공될 것이라는 전망이 지배적입니다. FSD의 규모는 Tesla가 FSD를 훈련하는 데 사용하는 수백만 마일 가치의 비디오 영상을 확보할 수 있었다는 것을 의미하기도 합니다. Tesla가 더 많은 데이터를 수집할수록 자동차 제조업체가 실제로 완전 자율 주행을 달성하는 데 더 가까워질 수 있다는 아이디어입니다.

그러나 일부 업계 전문가들은 모델에 더 많은 데이터를 던지고 더 똑똑해질 것으로 기대하는 무차별 대입 접근 방식에는 한계가 있을 수 있다고 말합니다.

"우선, 경제적 제약이 있고, 곧 그렇게 하기에는 너무 비싸질 것입니다"라고 퍼듀 대학의 실리콘 밸리 전기 및 컴퓨터 공학교수인 Anand Raghunathan은 TechCrunch에 말했습니다. 또한 그는 "어떤 사람들은 모델을 훈련시킬 수 있는 의미 있는 데이터가 실제로 부족할 수 있다고 주장합니다. 더 많은 데이터가 반드시 더 많은 정보를 의미하는 것은 아니므로 해당 데이터에 더 나은 모델을 만드는 데 유용한 정보가 있는지, 그리고 학습 프로세스가 실제로 해당 정보를 더 나은 모델로 추출할 수 있는지 여부에 따라 달라집니다"라고 말합니다.

라구나단은 이러한 의구심에도 불구하고 적어도 단기적으로는 더 많은 데이터가 나오는 추세가 나타날 것으로 보인다고 말했습니다. 그리고 더 많은 데이터는 Tesla의 AI 모델을 훈련하기 위해 모든 데이터를 저장하고 처리하는 데 더 많은 컴퓨팅 파워가 필요하다는 것을 의미합니다. 이것이 바로 슈퍼컴퓨터인 Dojo가 필요한 이유입니다.

슈퍼컴퓨터란 무엇인가요?

Dojo는 AI, 특히 FSD를 위한 훈련장 역할을 하도록 설계된 Tesla의 슈퍼컴퓨터 시스템입니다. 이름은 무술이 연습되는 공간에 대한 고개를 끄덕이는 것입니다.

슈퍼컴퓨터는 노드라고 하는 수천 개의 작은 컴퓨터로 구성됩니다. 이러한 각 노드에는 자체 CPU와 GPU가 있습니다. 전자는 노드의 전반적인 관리를 처리하고 후자는 작업을 여러 부분으로 분할하고 동시에 작업하는 것과 같은 복잡한 작업을 수행합니다. GPU는 시뮬레이션에서 FSD 훈련을 지원하는 것과 같은 머신러닝 작업에 필수적입니다. 또한 대규모 언어 모델을 구동하기 때문에 생성형 AI의 부상으로 Nvidia는 지구상에서 가장 가치 있는 회사가 되었습니다.

Tesla도 AI를 훈련하기 위해 Nvidia GPU를 구입합니다.

Tesla에 슈퍼컴퓨터가 필요한 이유는 무엇입니까?

Tesla의 비전 전용 접근 방식은 Tesla가 슈퍼컴퓨터를 필요로 하는 주된 이유입니다. FSD의 기반이 되는 신경망은 방대한 양의 주행 데이터에 대해 훈련되어 차량 주변의 물체를 인식 및 분류한 다음 주행 결정을 내립니다. 즉, FSD가 작동하면 신경망은 인간의 깊이 및 속도 인식 능력에 맞는 속도로 시각적 데이터를 지속적으로 수집하고 처리해야 합니다.

즉, Tesla는 인간의 시각 피질과 뇌 기능의 디지털 복제본을 만드는 것을 의미합니다.

이를 위해 Tesla는 전 세계 자동차에서 수집한 모든 비디오 데이터를 저장 및 처리하고 수백만 번의 시뮬레이션을 실행하여 데이터에 대해 모델을 훈련해야 합니다.

Tesla는 현재 Dojo 훈련 컴퓨터에 전력을 공급하기 위해 Nvidia에 의존하는 것으로 보이지만 Nvidia 칩이 비싸기 때문에 모든 계란을 한 바구니에 담고 싶지는 않습니다. Tesla는 또한 대역폭을 늘리고 대기 시간을 줄이는 더 나은 것을 만들기를 희망합니다. 그렇기 때문에 자동차 제조업체의 AI 부서는 기존 시스템보다 AI 모델을 더 효율적으로 훈련하는 것을 목표로 하는 자체 맞춤형 하드웨어 프로그램을 고안하기로 결정했습니다.

이 프로그램의 핵심은 Tesla의 독점 D1 칩으로, 회사는 이 칩이 AI 워크로드에 최적화되어 있다고 말합니다.

이 칩에 대해 자세히 알려주세요

Tesla는 하드웨어와 소프트웨어가 함께 작동하도록 설계되어야 한다고 믿는다는 점에서 Apple과 비슷한 견해를 가지고 있습니다. 이것이 Tesla가 표준 GPU 하드웨어에서 벗어나 Dojo를 구동하기 위한 자체 칩을 설계하기 위해 노력하는 이유입니다.

테슬라는 2021년 AI 데이에 손바닥 크기의 실리콘 사각형인 D1 칩을 공개했다. D1 칩은 적어도 올해 5월에 생산에 들어갔습니다. TSMC(Taiwan Semiconductor Manufacturing Company)는 7나노미터 반도체 노드를 사용하여 칩을 제조하고 있습니다. Tesla에 따르면 D1에는 500억 개의 트랜지스터가 있으며 645 mm제곱의 큰 다이 크기가 있습니다. 이것은 D1이 매우 강력하고 효율적이며 복잡한 작업을 신속하게 처리할 것을 약속한다는 것을 의미합니다.

테슬라의 2021 AI 데이에서 오토파일럿 하드웨어의 전 선임 이사인 가네쉬 벤카타라마난(Ganesh Venkataramanan)은 "우리는 컴퓨팅과 데이터 전송을 동시에 수행할 수 있으며, 명령어 세트 아키텍처인 맞춤형 ISA는 머신 러닝 워크로드에 완전히 최적화되어 있습니다"라고 말했습니다.

D1은 여전히 Nvidia의 A100 칩만큼 강력하지는 않지만 TSMC에서 7나노미터 공정을 사용하여 제조합니다. A100은 540억 개의 트랜지스터를 포함하고 있으며 다이 크기는 826 제곱밀리미터이므로 Tesla의 D1보다 약간 더 나은 성능을 발휘합니다.

더 높은 대역폭과 더 높은 컴퓨팅 파워를 얻기 위해 Tesla의 AI 팀은 25개의 D1 칩을 하나의 타일로 융합하여 통합 컴퓨터 시스템으로 작동했습니다. 각 타일은 9페타플롭스의 컴퓨팅 파워와 초당 36테라바이트의 대역폭을 가지며 전력, 냉각 및 데이터 전송에 필요한 모든 하드웨어를 포함합니다. 타일은 25개의 작은 컴퓨터로 구성된 자급자족 컴퓨터로 생각할 수 있습니다. 이러한 타일 중 6개는 하나의 랙을 구성하고 2개의 랙은 캐비닛을 구성합니다. 10개의 캐비닛이 ExaPOD를 구성합니다. AI Day 2022에서 Tesla는 Dojo가 여러 ExaPOD를 배포하여 확장할 것이라고 밝혔습니다. 이 모든 것이 합쳐져 슈퍼컴퓨터를 구성합니다.

Tesla는 또한 정보 흐름 병목 현상을 해결하는 것을 목표로 하는 차세대 D2 칩을 개발하고 있습니다. 개별 칩을 연결하는 대신, D2는 전체 Dojo 타일을 단일 실리콘 웨이퍼에 놓습니다.

Tesla는 주문했거나 받을 것으로 예상되는 D1 칩의 수를 확인하지 않았습니다. 이 회사는 또한 D1 칩에서 Dojo 슈퍼컴퓨터를 실행하는 데 얼마나 걸릴지에 대한 타임라인을 제공하지 않았습니다.

머스크는 지난 6월 X에 올린 게시물에서 "일론이 텍사스에 거대한 GPU 쿨러를 짓고 있다"고 말한 것에 대해 머스크는 테슬라가 향후 18개월 동안 "절반은 테슬라 AI 하드웨어, 절반은 엔비디아/기타"를 목표로 하고 있다고 답했다. "기타"는 1 월 Musk의 발언에 따르면 AMD 칩이 될 수 있습니다.

Tesla에게 Dojo는 어떤 의미인가요?

자체 칩 생산을 통제한다는 것은 특히 Tesla와 TSMC가 칩 생산을 확대함에 따라 Tesla가 언젠가는 저렴한 비용으로 AI 교육 프로그램에 많은 양의 컴퓨팅 파워를 빠르게 추가할 수 있음을 의미합니다.

이는 또한 Tesla가 점점 더 비싸지고 확보하기 어려운 Nvidia의 칩에 의존할 필요가 없을 수도 있음을 의미합니다.

테슬라의 2분기 실적 발표에서 머스크는 엔비디아 하드웨어에 대한 수요가 "너무 많아 GPU를 구하기 어려운 경우가 많습니다"라고 말했습니다. 그는 "우리가 원할 때 안정적인 GPU를 얻을 수 있는지에 대해 상당히 우려하고 있으며, 따라서 필요한 훈련 능력을 확보하기 위해 Dojo에 더 많은 노력을 기울여야 한다고 생각합니다"라고 말했습니다.

그럼에도 불구하고 Tesla는 AI를 훈련시키기 위해 오늘날에도 여전히 Nvidia 칩을 구매하고 있습니다. 지난 6월 머스크는 X에 다음과 같은 글을 올렸습니다.

테슬라가 올해 인공지능 관련 지출 약 100억 달러 중 절반 정도는 테슬라가 설계한 AI 추론 컴퓨터와 센서, 그리고 도조(Dojo)와 같은 내부 지출입니다. AI 훈련 슈퍼클러스터를 구축하는 데 Nvidia 하드웨어는 약 2/3 비용입니다. Tesla의 Nvidia 구매에 대한 현재 최선의 추측은 올해 $3B에서 $4B입니다.

"추론 컴퓨팅"은 Tesla 자동차가 실시간으로 수행하는 AI 컴퓨팅을 의미하며 Dojo가 담당하는 교육 컴퓨팅과는 별개입니다.

Dojo는 머스크가 테슬라가 성공하지 못할 수도 있다고 여러 차례 헤지한 위험한 베팅입니다.

장기적으로 테슬라는 이론적으로 AI 사업부를 기반으로 새로운 비즈니스 모델을 만들 수 있습니다. 머스크는 Dojo의 첫 번째 버전이 Tesla 컴퓨터 비전 라벨링 및 교육에 맞게 조정될 것이라고 말했으며, 이는 FSD와 Tesla의 휴머노이드 로봇인 Optimus 교육에 적합합니다. 그러나 다른 경우에는 그다지 유용하지 않을 것입니다.

머스크는 Dojo의 미래 버전이 범용 AI 훈련에 더 적합할 것이라고 말했습니다. 이와 관련된 한 가지 잠재적인 문제는 거의 모든 AI 소프트웨어가 GPU와 함께 작동하도록 작성되었다는 것입니다. Dojo를 사용하여 범용 AI 모델을 훈련시키려면 소프트웨어를 다시 작성해야 합니다.

즉, Tesla가 컴퓨팅을 임대하지 않는 한, AWS와 Azure가 클라우드 컴퓨팅 기능을 임대하는 방식과 유사합니다. 머스크는 또한 2분기 실적 발표에서 "도조를 통해 엔비디아와 경쟁할 수 있는 길을 보고 있습니다"라고 언급했습니다.

Morgan Stanley의 2023년 9월 보고서에 따르면 Dojo는 로보택시 및 소프트웨어 서비스의 형태로 새로운 수익원을 창출하여 Tesla의 시장 가치에 5,000억 달러를 추가할 수 있습니다.

요컨대, Dojo의 칩은 자동차 제조업체를 위한 보험 정책이지만 배당금을 지불할 수 있는 정책입니다.

Dojo는 언제 상용화할 수 있을까요?

로이터는 지난해 테슬라가 2023년 7월 Dojo 생산을 시작했다고 보도했지만, 머스크가 2023년 6월 올린 게시물에 따르면 Dojo는 "몇 달 동안 온라인 상태였고 유용한 작업을 실행했습니다"라고 주장했습니다.

비슷한 시기에 Tesla는 Dojo가 2024년 2월까지 가장 강력한 상위 5개 슈퍼컴퓨터 중 하나가 될 것으로 예상한다고 밝혔는데, 아직 공개되지 않아 실제로 그런 일이 일어났는지 의심스럽습니다.

회사는 또한 2024년 10월에 Dojo의 총 컴퓨팅이 100 엑사플롭에 도달할 것으로 예상한다고 밝혔습니다. (1엑사플롭스는 초당 1퀸틸리언의 컴퓨터 작업과 같습니다. 100 엑사플롭스에 도달하기 위해, 그리고 하나의 D1이 362 테라플롭스를 달성할 수 있다고 가정하면, Tesla는 276,000 D1 또는 약 320,500 Nvidia A100 GPU가 필요합니다.)

테슬라는 또한 2024년 1월 뉴욕주 버펄로에 있는 기가팩토리에 5억 달러를 투자해 Dojo 슈퍼컴퓨터를 구축하겠다고 약속했습니다.

2024년 5월 머스크는 테슬라의 오스틴 기가팩토리 후단이 "초고밀도 수냉식 슈퍼컴퓨터 클러스터"로 구성될 것이라고 언급했습니다.

테슬라의 2분기 실적 발표 직후 머스크는 X에 테슬라의 AI 팀이 테슬라 차량에 탑재된 하드웨어인 테슬라 HW4 AI 컴퓨터(AI4로 명명)를 엔비디아 GPU와의 훈련 루프에서 사용하고 있다고 게시했습니다. 그는 대략 90,000대의 Nvidia H100과 40,000대의 AI4 컴퓨터로 구성되어 있다고 언급했습니다.

"그리고 Dojo 1은 올해 말까지 대략 8k H100에 해당하는 온라인 훈련을 받게 될 것입니다. 거대하진 않지만, 그렇다고 사소하지도 않아요."

이상의 기사는 2024년 8월 3일 TechCrunch에 게재된 “Tesla Dojo: Elon Musk’s big plan to build an AI supercomputer, explained”제목의 기사 내용을 편집하여 작성하였습니다.

Image Credits: Bryce Durbin | TechCrunch

* 원문정보 출처 : Tesla Dojo: Elon Musk's big plan to build an AI supercomputer, explained | TechCrunch