비즈니스 기회
Google Gemini는 인간보다 더 나은 건강 코치

Google Gemini는 출시된 지 6개월밖에 되지 않았지만 이미 보안, 코딩, 디버깅 및 기타 영역에서 인상적인 기능을 보여주었습니다. 물론 심각한 한계도 있었습니다.
이제 대규모 언어 모델(LLM)은 수면 및 피트니스 조언과 관련하여 인간을 능가하고 있습니다.
Google의 연구원들은 스마트워치 및 심박수 모니터와 같은 웨어러블의 시계열 개인 건강 데이터를 이해하고 추론하도록 미세 조정된 Gemini 버전인 PH-LLM(Personal Health Large Language Model)을 도입했습니다. 그들의 실험에서 모델은 건강 및 피트니스 분야에서 수년간의 경험을 가진 전문가보다 질문에 답하고 눈에 띄게 더 나은 예측을 했습니다.
"우리가 하는 일은... 연구진은 생성형 AI를 사용하여 모델 유용성을 건강 상태를 예측하는 것에서 복잡한 건강 행동에 의존하는 일관되고 상황에 맞으며 잠재적으로 규범적인 결과를 제공하는 것으로 확장합니다"라고 썼습니다.
수면 및 피트니스 전문가로서의 Gemini
웨어러블 기술은 사람들이 건강을 모니터링하고 이상적으로는 의미 있는 변화를 만드는 데 도움이 될 수 있습니다. 이러한 장치는 운동 및 다이어트 로그, 기분 저널, 때로는 소셜 미디어 활동을 포함한 입력에서 "수동적으로 지속적으로 획득"되는 개인 건강 모니터링을 위한 "풍부하고 종단적인 데이터 소스"를 제공한다고 Google 연구원은 지적합니다.
그러나 수면, 신체 활동, 심장 대사 건강 및 스트레스에 대해 수집한 데이터는 "산발적"인 임상 환경에 거의 통합되지 않습니다. 연구진은 데이터가 컨텍스트없이 캡처되고 저장하고 분석하는 데 많은 계산이 필요하기 때문이라고 주장합니다. 또한 해석하기 어려울 수 있습니다.
또한 LLM은 의료 질의응답, 전자 건강 기록 분석, 의료 영상 기반 진단 및 정신과 평가와 관련하여 잘 수행되었지만 웨어러블 데이터에 대해 추론하고 권장하는 능력이 부족한 경우가 많습니다.
그러나 Google 연구원들은 PH-LLM을 훈련시켜 권장 사항을 제시하고, 전문적인 시험 질문에 답하고, 자가 보고된 수면 장애 및 수면 장애 결과를 예측하는 데 돌파구를 마련했습니다. 이 모델에는 객관식 질문이 주어졌고, 연구원들은 생각의 사슬(chain-of-thought, 인간의 추론을 모방하는 것)과 제로샷(zero-shot) 방법(물체와 개념을 이전에 접하지 않고도 인식하는 방법)도 수행했습니다.
인상적이게도, PH-LLM은 수면 검사에서 79%, 체력 검사에서 88%를 달성했으며, 두 검사 모두 5명의 전문 운동 트레이너(평균 경력 13.8년)와 5명의 수면 의학 전문가(평균 경력 25년)를 포함한 인간 전문가 표본의 평균 점수를 능가했습니다. 인간은 피트니스에서 71%, 수면에서 76%의 평균 점수를 달성했습니다.
한 코칭 추천 사례에서 연구원들은 모델에게 "당신은 수면 의학 전문가입니다. 다음과 같은 수면 데이터가 제공됩니다. 사용자는 50세 남성입니다. 가장 중요한 통찰을 나열하십시오."
PH-LLM은 "그들은 잠드는 데 어려움을 겪고 있습니다. 충분한 숙면은 신체적 회복에 중요합니다." 모델은 또한 "침실이 시원하고 어두운지 확인하십시오. 낮잠을 피하고 일정한 수면 시간을 유지하십시오."
한편, "벤치 프레스의 느리고, 통제되고, 하향 단계 동안" 대흉근에서 어떤 유형의 근육 수축이 발생하는지에 대한 질문을 받았을 때, 답에 대한 네 가지 선택지가 주어졌을 때, PH-LLM은 "편심"이라고 정확하게 대답했습니다.
연구진은 모델에 "이 웨어러블 데이터를 기반으로 사용자가 잠드는 데 어려움을 겪는다고 보고할 수 있습니까?"라고 물었고, 모델에 대해 "이 사람은 지난 한 달 동안 여러 번 잠드는 데 어려움을 겪었다고 보고할 가능성이 높습니다"라고 답했습니다.
연구진은 "안전이 중요한 개인 건강 영역에서 추가 개발과 평가가 필요하지만, 이러한 결과는 제미니 모델의 광범위한 지식 기반과 기능을 모두 보여줍니다"라고 지적했습니다.
Gemini는 개인화된 통찰력을 제공할 수 있습니다
이러한 결과를 얻기 위해 연구원들은 먼저 캡처된 신체 활동, 수면 패턴 및 생리적 반응에서 개인화된 통찰력과 권장 사항을 테스트하는 전문 도메인 지식; 자가 보고된 수면의 질에 대한 예측 등 세 가지 데이터 세트를 만들고 선별했습니다.
연구진은 분야별 전문가들과 협력하여 수면과 피트니스에 관한 실제 시나리오를 나타내는 857개의 사례 연구(전자의 경우 507개, 후자의 경우 350개)를 만들었습니다. 수면 시나리오는 개별 메트릭을 사용하여 잠재적인 원인 요인을 식별하고 수면의 질을 개선하는 데 도움이 되는 개인화된 권장 사항을 제공했습니다. 피트니스 작업은 트레이닝, 수면, 건강 지표 및 사용자 피드백의 정보를 사용하여 특정 날짜의 신체 활동 강도에 대한 권장 사항을 만들었습니다.
두 범주의 사례 연구 모두 웨어러블 센서 데이터(수면의 경우 최대 29일, 피트니스의 경우 30일 이상)와 인구 통계학적 정보(연령 및 성별) 및 전문가 분석을 통합했습니다.
센서 데이터에는 전체 수면 점수, 안정시 심박수 및 심박수 변동성의 변화, 수면 시간(시작 및 종료 시간), 깨어 있는 시간(분), 안절부절못함, REM 수면 시간의 백분율, 호흡수, 걸음 수 및 지방 연소 시간(분)이 포함되었습니다.
연구진은 "우리의 연구는 PH-LLM이 웨어러블 기기에서 수동적으로 획득한 객관적인 데이터를 개인화된 통찰력, 관찰된 행동의 잠재적 원인 및 수면 위생 및 피트니스 결과를 개선하기 위한 권장 사항으로 통합할 수 있음을 보여줍니다"라고 주장하였습니다.
개인 건강 앱에서 아직 해야 할 일이 많습니다
그러나 연구원들은 PH-LLM이 시작에 불과하며 다른 신흥 기술과 마찬가지로 해결해야 할 버그가 있음을 인정합니다. 예를 들어, 모델 생성 응답이 항상 일관된 것은 아니었고, 사례 연구 전반에 걸쳐 혼동에 "뚜렷한 차이"가 있었으며 LLM은 때때로 응답에서 보수적이거나 신중했습니다.
피트니스 사례 연구에서 이 모델은 과도한 훈련에 민감했으며, 한 사례에서 인간 전문가는 수면 부족을 잠재적인 피해 원인으로 식별하지 못했다고 지적했습니다. 또한 사례 연구는 인구 통계와 상대적으로 활동적인 개인에 걸쳐 광범위하게 샘플링되었기 때문에 모집단을 완전히 대표하지 못했을 가능성이 높으며 더 광범위한 수면 및 피트니스 문제를 해결할 수 없었습니다.
연구진은 "우리는 LLM이 개인 건강 애플리케이션에서 신뢰할 수 있고 안전하며 공평하다는 것을 보장하기 위해 해야 할 일이 많다는 점에 주목합니다."라고 썼습니다. 여기에는 혼란을 더욱 줄이고, 센서 정보에 포착되지 않는 고유한 건강 상황을 고려하고, 훈련 데이터가 다양한 인구를 반영하도록 하는 것이 포함됩니다.
연구진은 "이번 연구 결과는 개인이 건강 목표를 달성할 수 있도록 지원하는 개인화된 정보와 권장 사항을 제공하는 LLM을 향한 중요한 발걸음을 내디뎠습니다."라고 평가했습니다.
이상의 기사는 2024년 6월 13일 VentureBeat에 게재된 “Google Gemini proves a better health coach than humans”제목의 기사 내용을 편집하여 작성하였습니다.
* 원문정보 출처 : Google Gemini proves a better health coach than humans | VentureBeat