Google Research

158 개의 포스트

research.google/blog

태그로 필터

google4분 읽기큐레이션 요약

AI가 사용자의 피부 질환 이해를 돕는 방법에 대한 연구

인터넷과 AI가 피부 질환 정보를 찾는 데 도움을 주지만, 정보를 이해하고 적절한 다음 행동을 결정하는 일은 여전히 어렵다. Google Research는 피부 질환 후보를 제시하는 AI가 일반인의 질환명 파악 능력과 검색 만족도를 크게 높인다는 점을 확인했지만, 병원 방문 시점 등 안전한 후속 조치 판단에는 효과가 제한적이라고 밝혔다. 따라서 피부과 AI는 진단 보조뿐 아니라 사용자의 의사결정을 지원하는 인간 중심 설계가 필요하다. ## 피부 건강 정보에서 인간 중심 연구가 필요한 이유 - 성인의 절반 이상이 인터넷으로 건강 정보를 찾고, 약 3분의 1은 AI를 활용한다. - 정보에 접근할 수 있어도 의학 용어를 모르거나 검색 결과를 잘못 해석할 수 있다. - 예: “다리에 빨간 점”이라는 증상을 보고도 실제 검색어인 “촉지성 자반(palpable purpura)”을 알기 어렵다. - 기존 연구에서는 인터넷 검색으로 질환 식별 능력은 향상될 수 있지만, 이후 어떤 행동을 해야 하는지 판단하는 능력은 반드시 좋아지지 않는 것으로 나타났다. - Google Research는 감별진단 AI 모델, 일반화 검증, SCIN 데이터셋 등을 개발해 왔으며, 궁극적으로는 피부 고민이 있는 사람들이 더 나은 결정을 내리도록 돕는 것을 목표로 삼았다. ## 대규모 실험: AI가 질환명 파악에 미치는 영향 JAMA Dermatology에 게재된 연구에서는 2,345명의 참가자에게 이미지와 병력 정보가 포함된 익명 피부 질환 사례를 제시하고, 자신의 사례라고 가정해 조사하도록 했다. - 참가자는 세 집단으로 무작위 배정됐다. - **일반 검색 대조군**: 기존 텍스트 기반 웹 검색 도구 사용 - **AI 집단**: AI가 예측한 3~7개의 질환 후보를 카드 형태로 제시하고, 각 질환의 이미지·증상·치료 정보를 제공 - **‘Wizard of Oz’ 집단**: 동일한 인터페이스를 사용하지만, AI 예측 대신 피부과 전문의 패널이 정한 실제 감별진단을 제시 - AI 도구는 확정 진단을 내리기보다 이미지와 가능한 질환을 연결해 정보를 찾기 쉽게 하는 방식으로 설계됐다. - AI 집단에서는 62% 이상이 질환명을 추측하려 했으며, 일반 검색 집단의 41%보다 높았다. - 질환명 추측 정확도는 다음과 같았다. - 일반 검색 집단: 8% - 일반 AI 집단: 23% - 전문의 감별진단을 제공한 집단: 36% - AI 사용자는 자신의 추측에 더 큰 자신감을 보였고, 검색 결과와 검색에 걸린 시간에 대한 만족도도 높았다. - 다만 전문의 감별진단을 그대로 제공한 경우에도 정확도가 완벽하지 않아, 후보 질환을 보여주는 것만으로 사용자의 이해가 완전해지는 것은 아니었다. ## 질환 식별과 다음 행동 판단은 별개의 문제 연구진은 AI가 지나치게 지시적이거나 진단적인 도구가 되지 않도록 설계했다. - 치료 및 질환 정보는 피부과 전문의가 권위 있는 자료를 바탕으로 작성했다. - 그러나 정보는 해당 질환의 일반적인 설명에 기반했으며, 개별 사례의 심각도에 맞춰 개인화되지는 않았다. - 참가자들은 다음과 같은 판단에서 여전히 어려움을 겪었다. - 집에서 관리해도 되는지 - 일반 진료를 예약해야 하는지 - 긴급하게 병원을 방문해야 하는지 - 다음 행동 판단의 정확도는 전문의 감별진단을 제공한 집단에서만 소폭 높아졌다. - 전문의 감별진단 집단: 63.5% - 일반 검색 대조군: 60% - 일반 AI 집단은 통계적으로 유의미한 개선을 보이지 않았다. - 오히려 일반 AI 집단은 피부과 전문의가 판단한 것보다 덜 긴급한 행동을 제안하는 비율이 다소 높았다. - AI 집단: 30% - 대조군: 27% - 이는 가능한 질환명을 알려주는 것만으로는 안전한 의료 결정을 보장할 수 없으며, 위험 신호와 긴급도를 명확히 안내하는 기능이 필요하다는 점을 보여준다. ## 실제 사용자와 지역사회를 대상으로 한 질적 연구 연구진은 통제된 설문만으로는 사람들이 자신의 피부 문제에 AI를 어떻게 적용하는지 충분히 알기 어렵다고 보고, 실제 피부 고민이 있는 지역사회 구성원을 대상으로 별도의 연구를 진행했다. - ACM CHI 학회에 발표된 연구는 Stanford Healthcare AI Applied Research Team, Santa Clara Family Health Plan과 공동으로 수행됐다. - 연구 대상 지역사회에는 의료 안전망인 Medi-Cal에 의존하는 사람들이 다수 포함됐다. - 참가자들은 실제 피부 고민을 가진 다양한 배경의 사람들로 구성됐다. - AI 피부 애플리케이션을 실제 환경에서 사용하게 하면서 다음을 살폈다. - 사용자가 AI 정보를 어떻게 해석하는지 - 자신의 증상과 AI가 제시한 정보를 어떻게 연결하는지 - 정보가 의료 이용이나 의사결정에 어떤 영향을 주는지 - 참가자들이 주로 사용하는 언어가 네 가지였기 때문에 애플리케이션을 각 언어로 번역했다. - 해당 언어에 능통한 자원봉사자나 직원도 참여해 의사소통을 지원함으로써, 다양한 언어권 사용자에게 적합한 설계를 연구하려 했다. 피부과 AI는 질환 후보를 빠르게 찾고 의학 정보를 이해하는 데 유용하지만, 그 결과를 곧바로 진단이나 치료 결정으로 받아들여서는 안 된다. 실제 서비스에서는 긴급 증상 안내, 불확실성 표시, 개인의 증상과 심각도를 반영한 후속 조치 안내, 의료진 상담 연결 기능을 함께 제공하는 것이 중요하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

머신 언러닝 감사를 위한 새로운 프레임워크

기계 언러닝이 실제로 특정 학습 데이터를 잊었는지 검증하려면, 모델의 내부 구조 대신 출력 샘플을 비교해야 한다. 기존 두 표본 검정은 대규모 모델의 미세한 정보 흔적을 놓치거나, 재학습 과정의 차이를 문제로 오인해 오탐을 낼 수 있다. Google Research는 이를 해결하기 위해 여러 f-발산과 커널 정규화를 결합한 상대적 거리 검정을 제안했으며, 표본 수가 늘어날수록 거짓 음성 위험이 0에 수렴하도록 설계했다. ## 기계 언러닝 검증의 필요성 - 기계 언러닝은 모델을 처음부터 재학습하지 않고 특정 학습 데이터를 제거하는 기술이다. - GDPR의 ‘잊힐 권리’, AI 안전성, 모델 품질 관리 때문에 언러닝이 제대로 수행됐다는 수학적 검증이 중요해지고 있다. - 감사자는 모델 내부나 원본 학습 데이터에 접근하지 못하는 경우가 많으므로, 모델에 질의하고 생성된 출력 샘플을 분석해야 한다. - 일반적인 방법은 다음 두 모델의 출력을 비교하는 두 표본 검정이다. - 해당 데이터를 처음부터 학습하지 않은 모델 - 해당 데이터를 잊었다고 주장하는 언러닝 모델 - 두 출력 분포가 통계적으로 다르면 언러닝이 실패했다고 판단한다. ## 기존 두 표본 검정의 한계 - 대규모 모델에서는 무작위 변동과 실제 데이터 의존성을 구분하기 위해 매우 많은 출력 샘플이 필요하다. - 샘플 수가 부족하면 실제 개인정보 유출이나 데이터 흔적을 발견하지 못하는 거짓 음성이 발생한다. - MMD(Maximum Mean Discrepancy)는 평균이나 전반적인 분포 변화 같은 전역적 차이를 잘 찾지만, 다음과 같은 국소적 변화에는 약할 수 있다. - 특정 프롬프트에서만 나타나는 개인 데이터 관련 이상 출력 - 드문 이상치 - 비매끄럽거나 복잡한 분포 차이 - 연구자가 검정 통계량, 커널 대역폭, 정규화 매개변수 등을 직접 선택해야 하므로 설정이 어렵고 오류가 발생하기 쉽다. - 재학습 모델 자체도 학습 배치 크기나 학습 순서가 다르면 원래 모델과 다른 출력 분포를 만들 수 있다. - 이 경우 언러닝 모델이 안전하게 동작하더라도 단순 비교 검정은 차이를 데이터 잔존 흔적으로 잘못 판단할 수 있다. - 표준적인 국소 언러닝 알고리즘은 학습 과정을 모두 되짚지 않기 때문에 데이터의 영향을 완벽히 제거하기 어렵다. - 따라서 ‘처음부터 재학습한 모델과 완전히 동일한 분포’를 요구하면 정상적인 언러닝도 실패로 판정될 수 있다. ## 상대적 거리 기반 검정 프레임워크 - 제안된 방법은 언러닝 모델이 어느 쪽에 더 가까운지를 비교한다. - 안전하게 재학습한 모델 - 원래의 손상된 모델 - 즉, 언러닝 모델이 재학습 모델에 더 가까운지를 평가해 단순한 분포 차이보다 언러닝의 방향성을 검증한다. - 이 방식은 단일 기준 모델과의 동일성만 요구하지 않으므로 재학습 과정에서 생기는 자연스러운 변동에 더 강하다. - 프레임워크의 핵심은 **Regularized f-Divergence Kernel Tests**다. - f-발산을 활용해 다양한 유형의 분포 차이를 표현한다. - 커널 정규화로 고차원 데이터에서 발산을 효율적으로 추정한다. - 통계적 검정 과정에서 거짓 양성을 통제하도록 설계됐다. - 표본 수가 증가하면 거짓 음성 위험이 0에 안정적으로 수렴한다. ## 다양한 f-발산의 활용 - **카이제곱 발산과 KL 발산** - 매끄러운 분포 변화나 국소적인 이상을 탐지하는 데 적합하다. - 특정 데이터가 모델 출력에 드문 이상치를 유발하는 상황을 포착할 수 있다. - **Hockey-stick 발산** - 프라이버시와 언러닝의 정의에 직접적으로 활용할 수 있다. - 통계적 비식별성의 허용 수준을 매개변수로 설정한다. - 안전 예산 이하의 사소한 차이는 무시하고, 의미 있는 개인정보 노출만 경고하도록 만들 수 있다. - 기존 방식과 달리 검정에 적합한 발산과 하이퍼파라미터를 자동으로 선택한다. - 이 적응형 선택은 연구자가 검정 방식을 일일이 고르는 부담을 줄이며, 표본 분할 없이 수행된다. ## 실험과 적용 분야 - 제안 방법은 다양한 문제에서 평가됐다. - 합성 데이터인 perturbed uniform 두 표본 벤치마크 - 물리학 데이터의 Expo1D 이상치 탐지 - 고에너지 물리학 데이터는 표준 모형에서 벗어난 매우 희귀한 입자처럼 미세한 차이를 찾아야 하므로, 개인정보 유출 탐지 성능을 시험하기에 적합한 사례로 사용됐다. - **차등 프라이버시 감사** - 한 레코드만 다른 두 데이터셋에 비공개 메커니즘을 적용한다. - 진정한 차등 프라이버시라면 두 출력 표본이 통계적으로 구별되지 않아야 한다. - 차이가 검출되면 단일 레코드의 영향이 과도하게 남아 있는 것으로 판단할 수 있다. - **기계 언러닝 평가** - 안전한 재학습 모델과 언러닝 모델만 단순 비교하는 대신, 세 표본 상대 검정을 사용한다. - Selective Synaptic Dampening, 가지치기(pruning), 무작위 라벨링 등 여러 언러닝 알고리즘에 적용했다. - 제공된 글은 실험 결과 설명이 “unlearned model d...”에서 중단되어 있어, 각 알고리즘의 구체적인 성능 수치나 최종 결론은 확인할 수 없다. ## 실용적인 결론 기계 언러닝을 감사할 때는 “언러닝 모델이 재학습 모델과 완전히 같은가”보다 “원본 모델보다 안전한 재학습 모델에 통계적으로 더 가까운가”를 평가하는 것이 현실적이다. 특히 개인정보 보호 감사나 희귀한 국소 이상 탐지처럼 작은 분포 변화가 중요한 경우, f-발산과 커널 정규화를 결합한 적응형 상대 검정이 기존 MMD 중심 접근보다 적합할 수 있다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

Gemini Enterprise Agent Platform의 Agentic RAG로 신뢰할 수 있는 응답 구현하기

Google의 Agentic RAG는 단일 검색과 생성을 수행하는 기존 RAG의 한계를 넘어, 복잡한 기업 질의를 여러 단계로 분해하고 필요한 정보가 확보될 때까지 반복 검색하는 멀티 에이전트 구조다. 특히 검색 결과와 중간 답변을 검토하는 ‘충분한 컨텍스트 에이전트’를 통해 누락된 정보를 식별하고 추가 검색을 지시한다. Google은 이 방식이 사실성 평가 데이터셋에서 정확도를 최대 34% 향상시켰으며, 내부 도메인별 데이터에서도 더 나은 근거 기반 응답과 추론 정확도를 보였다고 설명한다. ## 기존 단일 단계 RAG의 한계 - 일반적인 RAG는 질문을 바탕으로 관련 문서를 한 번 검색한 뒤, 검색 결과를 LLM에 전달해 답변을 생성한다. - 기업 데이터는 여러 데이터베이스와 문서 저장소에 분산되어 있어 한 번의 검색만으로 답을 찾기 어렵다. - 예를 들어 프로젝트 문서에 서버 ID만 있고 실제 서버 사양은 별도 자산 데이터베이스에 있다면, 기존 RAG는 서버 사양을 추가로 조회하지 못한다. - 그 결과 부분적인 답변을 내놓거나, 정보가 실제로 존재함에도 “찾을 수 없다”고 응답할 수 있다. ## 멀티 에이전트 기반 검색 구조 Agentic RAG는 하나의 검색기가 모든 작업을 처리하는 대신 역할별 에이전트가 협력한다. - **Orchestrator**: 질의를 분석해 단일 검색으로 충분한지 판단하고, 복잡한 작업을 하위 에이전트에 위임한다. - **Planner Agent**: 필요한 정보의 경로와 검색 순서를 계획한다. 예를 들어 예산은 재무 데이터베이스에서, 일정은 프로젝트 관리 로그에서 조회하도록 결정한다. - **Query Rewriter**: 모호하거나 긴 질문을 여러 개의 구체적인 검색 질의로 변환한다. - **Search Fanout Agent**: 변환된 질의를 여러 검색 소스에 동시에 보내 정보를 수집한다. - **LLM 또는 Synthesis Agent**: 수집된 컨텍스트를 통합해 최종 답변을 작성한다. ## Google 방식의 차별점: 충분한 컨텍스트 검증 - 기존 멀티 에이전트 RAG와 달리, Google의 구조는 정보가 충분한지 확인하는 전용 **Sufficient Context Agent**를 포함한다. - 첫 검색 결과가 불완전해도 즉시 답변하거나 포기하지 않고, 어떤 정보가 누락됐는지 분석한 뒤 추가 검색을 수행한다. - 이를 통해 정보 부족을 이유로 한 성급한 추측이나 불완전한 답변을 줄인다. ## 의료 질의 처리 과정 예시 질의는 환자의 퇴원 약물, 식이 제한, 입원 중 알레르기 반응을 묻고 특정 입원·응급실 투여 약물은 제외하도록 요구한다. ### 1. 오케스트레이션 - Root Agent가 의사의 요청을 분석하고 하위 작업으로 분배한다. - Planner Agent는 Pharmacy, Nutrition, Clinical Notes 등 세 영역을 확인해야 한다고 판단한다. - Query Rewriter는 긴 요청을 약물, 식이, 알레르기 여부에 관한 검색 가능한 질의로 나눈다. ### 2. 초기 검색 - RAG Agent가 여러 검색 질의를 환자 기록에 동시에 실행한다. - 퇴원 약물과 식이 정보는 찾지만, 알레르기 관련 내용은 주요 문서에서 발견하지 못한다. - 일반 RAG라면 이 시점에서 불완전한 답변을 생성할 수 있다. ### 3. 충분한 컨텍스트 검증 Sufficient Context Agent는 다음 세 가지를 함께 검토한다. - **검색된 스니펫**: 실제로 검색된 문서 구간에 필요한 정보가 포함되어 있는지 확인한다. - **중간 초안**: 현재까지의 검색 결과로 작성한 임시 답변이 질문의 모든 요구사항을 다루는지 평가한다. - **누락 정보 분석**: 단순히 “정보가 부족하다”고 말하지 않고, 어떤 내용이 빠졌는지 구체적인 이유와 피드백을 생성한다. - 예: 약물 목록과 저염식 지침은 확보했지만, 알레르기 반응이나 이상 사례 정보가 없음. - 후속 지시: “알레르기 질문이 해결되지 않았으므로 ‘발진’, ‘이상 반응’ 등을 검색하라.” ### 4. 반복 검색 - 검증 에이전트의 피드백을 받은 Query Rewriter가 새로운 검색어를 생성한다. - RAG Agent는 초기 검색에서 제외했던 파일과 문서 영역을 다시 조사한다. - 이 과정에서 알레르기나 이상 반응에 관한 누락 정보가 발견될 수 있다. ### 5. 최종 합성 - Sufficient Context Agent가 약물, 식이, 알레르기 정보가 모두 확보됐는지 다시 확인한다. - 충분한 정보가 모이면 검색을 종료한다. - Synthesis Agent가 의사가 활용할 수 있는 정확하고 정리된 최종 요약을 작성한다. ## 평가와 기대 효과 - Google은 Agentic RAG를 FRAMES 논문 기반의 **FramesQA** 데이터셋에서 평가했다고 밝혔다. - 평가 대상에는 여러 단계의 추론과 서로 다른 정보 출처를 연결해야 하는 멀티홉 질문이 포함된다. - 사실성 데이터셋에서 기존 방식보다 정확도가 최대 34% 향상됐다. - 내부 데이터셋에서도 도메인별 작업에 대해 더 나은 근거 연결과 추론 정확도를 확인했다고 설명한다. - 제공된 글 본문은 실험 예시가 시작되는 부분에서 끝나므로, 세부 수치와 비교 대상별 결과는 제시되지 않았다. 실무적으로 Agentic RAG는 데이터가 여러 시스템에 분산되어 있고 한 번의 검색으로 답을 완성하기 어려운 기업 환경에 적합하다. 다만 반복 검색과 다수 에이전트 운영으로 비용과 지연 시간이 증가할 수 있으므로, 충분한 컨텍스트 검증을 적용할 질의 유형을 선별하고 검색 횟수·중단 조건을 함께 설계하는 것이 중요하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

스마트폰 카메라를 활용한 수동적 심장 건강 모니터링을 향하여

스마트폰 전면 카메라로 일상적인 얼굴 영상을 촬영해 심박수(HR)와 안정시 심박수(RHR)를 수동 개입 없이 추정하는 연구 시스템 PHRM이 소개되었습니다. PHRM은 8초 영상과 딥러닝을 활용해 심전도(ECG) 대비 HR 오차 10% 미만을 달성했고, 하루 단위 RHR도 웨어러블 수준의 정확도로 추정했습니다. 특히 다양한 피부색을 포함한 대규모 데이터로 학습해 피부색에 따른 성능 격차를 줄인 점이 핵심입니다. ## 스마트폰을 활용한 수동 심박 모니터링 - 심박수는 활동량, 스트레스, 질병 등 생리 상태를 반영하는 주요 생체 지표입니다. - 안정시 심박수는 심혈관 건강과 장기적인 건강 위험을 나타내며, 높은 RHR이나 장기적 상승은 심혈관 질환 및 사망 위험 증가와 관련됩니다. - PHRM은 얼굴 잠금 해제 직후 전면 카메라로 약 8초간 얼굴 영상을 촬영합니다. - 사용자가 별도로 손가락을 카메라에 대거나 측정을 시작하지 않아도 일상적인 스마트폰 사용 중 데이터를 수집합니다. - 스마트폰은 전 세계 약 50억 명이 사용하는 기기이므로 웨어러블 접근성이 낮은 환경에서 건강 모니터링을 확대할 가능성이 있습니다. ## 카메라 기반 PPG와 PHRM 기술 - PHRM은 광용적맥파(PPG) 원리를 사용합니다. - 혈액이 맥박에 따라 흐를 때 피부와 빛의 상호작용이 변하는 현상을 카메라로 감지합니다. - 얼굴 영상에서 심박 신호를 추출하는 원격 PPG(rPPG) 모델을 적용합니다. - 기기 내에서 실행 가능한 효율적인 시계열 이동 합성곱 신경망을 사용해 HR과 예측 신뢰도 점수를 계산합니다. - 하루 동안 얻은 여러 HR 측정값을 신뢰도 점수와 칼만 필터로 통합해 일일 RHR을 추정합니다. - 웨어러블처럼 지속적으로 착용해야 하는 센서가 아니라 스마트폰 사용 순간에 자연스럽게 측정하는 방식입니다. ## 피부색 다양성을 고려한 모델 설계 - 기존 rPPG 연구는 소규모·통제된 환경에 치우쳤고, 어두운 피부를 가진 참가자가 충분히 포함되지 않았습니다. - 멜라닌은 카메라가 PPG 신호를 감지하기 어렵게 만들 수 있어 피부색별 정확도 격차가 발생할 수 있습니다. - PHRM은 약 700명의 참가자로부터 35만 개 이상의 영상 클립을 수집했습니다. - 피부색 분포를 Monk Skin Tone 기준으로 설계했습니다. - 밝은 피부 그룹: 최소 25% - 중간 피부 그룹: 최소 25% - 어두운 피부 그룹: 최소 33% - 가장 측정이 어려운 사례에 더 많은 학습을 할당했습니다. - 피부색 그룹별 HR MAPE 차이가 5%포인트 미만이어야 한다는 비열등성 기준을 설정했습니다. ## 실험실 검증 결과 - 365명의 다양한 참가자로부터 조명과 활동 상태가 다른 환경에서 얼굴 영상과 ECG를 동시에 수집해 학습했습니다. - 별도의 104명 테스트 세트에서 최소 신뢰도 기준을 적용한 뒤 모든 피부색 그룹에서 MAPE 10% 미만을 기록했습니다. - 같은 데이터에서 비교한 15개 주요 rPPG 모델보다 우수한 성능을 보였습니다. - 모든 피부색 그룹에서 MAPE 10% 미만을 달성한 모델은 PHRM뿐이었습니다. - 신뢰도 점수가 낮은 측정값을 제외하는 confidence gating이 정확도 개선에 기여했습니다. ## 실제 생활 환경에서의 검증 - 231명이 개인 스마트폰에 연구 앱을 설치하고 8일 동안 평소처럼 사용했습니다. - 참가자들은 ECG 흉부 스트랩과 Fitbit Charge 6를 함께 착용해 비교 기준 데이터를 제공했습니다. - 얼굴 잠금 해제 직후 하루 평균 231개의 8초 영상 클립을 수집했습니다. - 참가자는 매일 영상 내용을 검토한 뒤 서버 업로드를 명시적으로 승인했습니다. - 민감한 장면이나 다른 사람의 얼굴이 포함된 영상은 제외할 수 있었습니다. - 데이터는 암호화된 보안 서버에 업로드되었습니다. - 별도로 확보한 101명 검증 세트에서 신뢰도 필터 적용 후 전체 MAPE는 6.09%였습니다. - 밝은 피부 그룹: 5.04% - 중간 피부 그룹: 5.12% - 어두운 피부 그룹: 7.84% - ECG 대비 평균적으로 HR을 0.64bpm 낮게 추정했으며, 95% 일치 한계는 -11.3~10.3bpm이었습니다. - 실제 생활 환경에서도 기존 15개 rPPG 모델보다 크게 우수했고, 모든 피부색 그룹에서 MAPE 10% 미만을 유지했습니다. ## 일일 안정시 심박수 추정 - PHRM은 하루 중 여러 번 측정한 심박수를 단순 평균하지 않고 신뢰도와 시간적 변동을 함께 고려합니다. - 칼만 필터를 사용해 잡음이 있는 개별 측정값을 통합하고 하루의 RHR을 추정합니다. - 연구 결과 일일 RHR 추정 정확도는 웨어러블 추적기와 비교해 평균 절대 오차(MAE) 5bpm 미만으로, 웨어러블 수준에 해당했습니다. - 따라서 스마트폰 사용만으로 장기적인 심박 변화와 건강 추세를 관찰할 가능성을 보여줍니다. ## 연구 데이터와 남은 과제 - 연구진은 지금까지 공개된 스마트폰 영상 기반 rPPG 데이터셋 중 가장 크고 다양한 데이터셋을 공개했습니다. - 자격을 갖춘 연구자는 데이터셋과 사전 학습 모델인 ‘PHRM-mini’에 접근을 신청할 수 있습니다. - 다만 연구 시스템은 스마트폰 전면 카메라가 얼굴을 안정적으로 촬영할 수 있어야 하며, 조명·움직임·카메라 성능에 따라 결과가 달라질 수 있습니다. - PHRM은 연구용 시스템이므로 질병 진단이나 응급 판단을 대신하는 의료기기로 사용해서는 안 됩니다. 스마트폰 카메라 기반 PHRM은 웨어러블이 없어도 심박수와 RHR을 수동적으로 추적할 수 있는 현실적인 접근입니다. 특히 피부색 다양성을 반영한 학습과 실제 생활 환경 검증이 강점이며, 향후에는 개인정보 보호, 배터리·성능 부담, 다양한 기기에서의 일관성 검증이 상용화의 핵심 과제가 될 것입니다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

홍수 회복력의 다음 장: Google의 수문학 프레임워크 오픈 소스 공개

Google Research는 Google Flood Hub에 사용된 홍수 예측 수문 모델의 아키텍처와 학습 파이프라인을 오픈소스로 공개했다. 이를 통해 각국 기상·수문 기관이 자체 데이터와 지역 지식을 활용해 AI 기반 하천 홍수 예측을 구축하고 운영할 수 있게 된다. 연구용 재현뿐 아니라 실제 경보 시스템과의 통합까지 지원해, 전 세계 홍수 대응 역량을 확대하는 것이 공개의 핵심 목적이다. ## 오픈소스 공개의 목적 - 홍수는 예고 없이 발생하고 장기적인 피해를 남기므로, 더 긴 예측 시간과 신속한 경보가 중요하다. - 공개된 프레임워크는 Google Flood Hub의 하천 홍수 예측 모델과 유사한 구조 및 학습 데이터를 활용할 수 있도록 설계됐다. - 연구자는 새로운 모델·데이터·학습 방식을 추가해 실험할 수 있다. - 각국의 운영 예보 기관은 자국의 관측 자료와 지역 전문 지식을 반영해 모델을 조정할 수 있다. - 기관이 데이터를 외부에 넘기지 않고 자체적으로 관리하면서도 최신 AI 예측 기술을 활용할 수 있다. ## 수문 모델의 구성과 작동 방식 - Python 패키지로 제공되며, 오픈소스 딥러닝 프레임워크인 PyTorch를 사용한다. - 입력 데이터에는 다음과 같은 정보가 포함된다. - 기후 및 기상 정보 - 토양 특성 - 지형 - 토지 피복 - 강수량과 기온 등 기상 예보 - 모델은 이러한 자료를 바탕으로 하천의 일일 유량을 예측한다. - 기본 모델 아키텍처로 LSTM(Long Short-Term Memory) 네트워크를 제공한다. - 학습에는 오픈소스 하천 데이터셋인 Caravan을 사용할 수 있다. - 사용자는 자체 유역의 관측 자료를 Caravan에 추가하거나, 이를 이용해 모델을 재학습·미세 조정할 수 있다. - 구현을 돕기 위해 Python 인터랙티브 튜토리얼과 동영상 자료도 제공된다. ## 모델 버전과 예측 성능 개선 - 저장소에는 두 가지 모델 버전이 포함된다. - 2024년 벤치마크 연구에 사용된 초기 모델 - 현재 Flood Hub의 실시간 전 세계 홍수 예측에 사용되는 개선 모델 - 개선된 v2 모델은 여러 기상 입력을 통합하는 ME-LSTM 구조를 사용한다. - 각 기상 데이터 제품을 별도의 네트워크가 임베딩한 뒤, 그 결과를 LSTM에 전달한다. - LSTM은 하천 유량에 대한 확률 분포를 생성해 불확실성까지 반영한다. - 통합되는 주요 기상 자료는 다음과 같다. - Google GraphCast - ECMWF의 IFS - NASA IMERG 위성 강수량 자료 - NOAA CPC 관측 기반 일일 강수량 - 기존 모델과 비교해 신뢰할 수 있는 예측 기간이 다음과 같이 늘었다. - 관측소가 있는 유역: 6일 연장 - 관측소가 없는 유역: 1일 연장 ## 지역 데이터와 현장 지식의 활용 - 세계기상기구(WMO)는 효과적인 재난 경보를 위해 지역 관측 자료와 Indigenous and Local Knowledge(ILK)가 중요하다고 지적한다. - 공개 프레임워크는 지역 예보 담당자가 모델 학습과 운영 과정에 직접 참여할 수 있게 한다. - 전통적인 물리 기반 수문 모델보다 구조가 단순하고 상대적으로 저렴하게 학습할 수 있다. - 지역별 강수 특성, 지형, 유역 반응, 현장 경험 등을 모델에 반영할 수 있다. - 이를 통해 중앙집중형 글로벌 모델을 지역 상황에 맞게 조정할 수 있다. ## CHMI와 Delft-FEWS 통합 사례 - Google은 체코 수문기상연구소(CHMI)와 협력해 모델의 실제 활용 가능성을 검증했다. - CHMI는 AI 모델의 예측 결과가 현지에서 보정된 전통적 개념형 수문 모델과 비슷한 수준임을 확인했다. - 또한 오픈소스 수문 프레임워크를 Delft-FEWS에 연결하는 어댑터를 개발했다. - Delft-FEWS는 국가·지역 수문 기관, NGO, 민간기업 등이 사용하는 운영 홍수 예측 플랫폼이다. - 이 통합 사례는 기존 예보 업무 흐름을 유지하면서 머신러닝 모델을 도입하는 방법을 보여주는 참고 모델이 된다. ## 라이선스와 기대 효과 - 모델 아키텍처, 문서, 학습 자료는 GitHub에 공개됐다. - Apache 2.0 라이선스를 적용해 연구자와 운영 기관이 폭넓게 사용할 수 있다. - 고가의 전통적 예보 인프라를 갖추기 어려운 지역도 고급 홍수 예측 기술에 접근할 수 있다. - 각국 기관이 독립적으로 모델을 개선함으로써 지역 맞춤형 조기경보 체계를 구축할 수 있다. - 장기적으로는 개방형·상호운용 가능한 수문 모델 생태계를 형성해 홍수 대응과 기후 적응 역량을 강화하는 것이 목표다. ## 실용적인 결론 이 프레임워크는 연구용 모델 공개를 넘어, 자체 관측 자료를 보유한 기상·수문 기관이 실제 경보 시스템에 AI를 도입할 수 있도록 만든 실무형 도구다. 도입을 검토하는 기관은 먼저 Caravan과 지역 유량 자료로 모델을 검증한 뒤, Delft-FEWS 같은 기존 운영 플랫폼과 연계하는 방식이 현실적이다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

혁신의 새로운 시대: I/O 2026에서의 Google Research

Google I/O 2026에서 Google Research는 AI를 과학적 발견과 헬스케어 혁신을 가속하는 ‘에이전트 시대’의 핵심 기술로 제시했다. 연구용 AI 에이전트가 가설 생성부터 코드 작성·실험·검증까지 수행하고, 건강 분야에서는 개인화된 코칭과 진료 준비를 지원한다. Google은 이러한 기술이 인간의 연구 역량을 증폭할 수 있다고 강조하면서도, 실제 연구자·의료진과의 협업 및 책임 있는 공개를 병행하고 있다. ## 과학적 발견을 가속하는 AI - **Gemini for Science** - 과학 연구 전 과정을 지원하는 실험적 도구 모음이다. - 가설 생성, 계산 실험, 문헌 분석, 연구용 에이전트 활용 등을 하나의 생태계로 묶는다. - Google Cloud, Google DeepMind, Google Labs와 협력해 개발됐다. - **Empirical Research Assistance(ERA)** - 과학자가 전문가 수준의 경험적 연구 소프트웨어를 작성하도록 돕는 연구 코딩 시스템이다. - 문제와 평가 기준을 입력하면 새로운 개념을 제안하고, 코드를 작성한 뒤 결과를 평가한다. - 트리 탐색을 사용해 수천 개의 코드 변형을 반복적으로 생성·검증하며 성능을 최적화한다. - 신경과학과 우주론 연구에 활용됐으며, 호흡기 질환 입원 예측과 캘리포니아 강 유역의 계절별 유출량 예측에도 적용됐다. - **Co-Scientist** - Gemini를 기반으로 한 다중 에이전트 협업 시스템이다. - 전문화된 여러 에이전트가 가설을 생성하고, 서로 평가·토론·수정한다. - 항균제 내성, 식물 면역, 간 섬유화 등 연구 난제를 다루는 데 활용되고 있다. - **Computational Discovery** - ERA와 AlphaEvolve를 결합한 에이전트형 연구 엔진이다. - 수천 개의 코드 변형을 병렬로 생성하고 점수화해, 사람이 수개월 걸려 시험할 모델과 가설을 빠르게 비교한다. - **Hypothesis Generation과 Literature Insights** - Hypothesis Generation은 연구자와 함께 문제를 정의한 뒤, 다중 에이전트 ‘아이디어 토너먼트’를 통해 가설을 생성·논쟁·평가한다. - 생성된 주장은 클릭 가능한 인용을 제공해 과학적 검증 가능성을 높인다. - Literature Insights는 NotebookLM을 활용해 방대한 과학 문헌의 결과를 요약하고 구조화한다. - 매년 수백만 편의 논문이 발표되는 상황에서 문헌 종합을 자동화하는 것을 목표로 한다. ## 연구 자동화와 과학 검증 - Google Antigravity 같은 에이전트형 코딩 플랫폼에서 사용할 수 있는 **Science Skills**를 제공한다. - 구조 생물정보학과 유전체 분석처럼 복잡한 연구 작업을 수시간이 아닌 수분 단위로 수행할 수 있도록 지원한다. - 학술대회의 논문 심사와 검증에도 AI를 실험적으로 적용하고 있다. - **Paper Assistant Tool(PAT)**은 ICML, STOC, NeurIPS 등에서 1만 편 이상의 논문을 검토했다. - PAT의 피드백을 통해 저자가 이론적 허점을 발견하거나 새로운 실험을 수행할 수 있었다. - **Gemini Deep Think**는 수학·물리학·컴퓨터과학 연구자들과 협력해 네트워크 퍼즐의 미해결 문제, 최적화 추측, 머신러닝 최적화 현상, 경매 경제학, 우주끈의 물리적 특이점 등 전문가 수준의 난제를 다뤘다. ## AI를 활용한 헬스케어 발전 - Google은 증상 이해부터 진료 준비, 의료 기록 해석, 진료 이후 관리까지 이어지는 건강 관리 여정 전반을 AI로 지원하려 한다. - 이러한 연구를 바탕으로 **Google Health 앱**과 **Google Health Coach**를 개발했다. - Google Health 앱은 기존 Fitbit 사용자에게 순차적으로 제공되며, 개인별 상황에 맞춘 종합적이고 적응형인 건강 코칭을 제공한다. ## 증상 분석과 진료 준비 지원 - **Symptom AI** - 대화형 건강 데이터를 분석해 사용자의 증상과 관련된 감별 진단을 추론하는 연구용 도구다. - Fitbit 앱을 통한 무작위 연구에 13,917명이 참여했다. - 독립 임상의의 맹검 비교에서 Symptom AI의 감별 진단이 다른 임상의의 결과보다 약 두 배 자주 선호됐다. - 이는 AI가 다양한 표현 방식과 실제 질병 분포를 반영한 대화 데이터를 활용할 가능성을 보여준다. - **Plan for Care** - 사용자가 의사와의 진료를 준비하도록 돕는 파일럿 연구다. - 1,779명이 참여했으며, 기준 모델과 비교해 진료 준비가 더 잘 됐다고 느낀 사용자가 15% 증가했다. - 진료를 최대한 활용할 자신감이 있다고 답한 사용자도 13% 늘었다. - **개인 건강 기록(PHR) 연구** - 모델의 문맥에 개인 건강 기록을 포함했을 때 건강 관련 AI의 효과가 어떻게 달라지는지 평가했다. - 제공된 글은 PHR 연구의 구체적인 결과가 이어지기 전에 중단되어 있어, 해당 부분의 결론은 확인할 수 없다. ## 실용적인 의미 Google이 제시한 방향은 AI를 단순한 답변 도구가 아니라 가설을 세우고 실험하며 결과를 검증하는 연구 파트너로 발전시키는 것이다. 다만 과학적 정확성, 의료 안전성, 개인정보 보호가 중요한 영역인 만큼, 실제 활용에서는 AI의 결과를 연구자와 의료진이 검토하고 제한된 범위에서 단계적으로 도입하는 접근이 필요하다.

원문 읽기(새 탭에서 열림)
google3분 읽기큐레이션 요약

제로 트러스트 집계를 통한 비공개 분석

개인정보 보호형 분석은 개별 기기 데이터를 노출하지 않고 인구 집단의 경향만 파악하기 위한 핵심 수단이다. 이 글은 새로운 격자 기반 암호 프로토콜과 TEE(신뢰 실행 환경)를 결합해, 단 한 번의 메시지 전송만으로 안전한 집계를 수행하는 제로 트러스트 분석 구조를 소개한다. 암호 기술은 원시 데이터의 복호화·재구성을 막고, TEE의 원격 검증은 공개된 코드가 의도대로 실행되는지 확인해 보안을 다층화한다. ## 온디바이스 AI 분석의 필요성 - 모델을 사용자 기기에서 실행해도 실제 성능과 실패 양상을 파악하려면 집단 수준의 분석이 필요하다. - 주요 분석 질문은 다음과 같다. - 특정 지역의 새로운 표현 때문에 번역 모델이 성능 저하를 겪는가? - 특정 조명이나 지역적 환경에서 이미지 분류기의 편향이 나타나는가? - Smart Reply처럼 기술적으로는 맞지만 사용자가 불편해하는 기능의 실제 오류율은 얼마인가? - 연합 분석은 여러 기기의 데이터를 집계하지만, 집계되기 전까지 개별 데이터가 보호되는 별도의 프라이빗 집계 경로가 필요하다. ## 하드웨어 보호와 암호학적 보호 - TEE는 프로세서와 메모리 일부를 격리된 보안 영역으로 만들며, 운영체제나 악성 하이퍼바이저가 손상돼도 내부 데이터를 보호하도록 설계된다. - 원격 검증(attestation)은 enclave에서 실행 중인 펌웨어와 소프트웨어 상태를 하드웨어 기반 암호 지문으로 증명한다. - Google은 Pixel Recorder에서 TEE 기반 차등 개인정보 보호 집계를 사용해 왔다. - 그러나 TEE는 사이드 채널 공격에 취약할 수 있으며, 새로운 취약점이 계속 발견될 가능성이 있다. - 암호 프로토콜은 수학적으로 개별 데이터 복원이 불가능하고 익명화된 집계 결과만 노출된다는 증명 가능한 보장을 제공한다. - 기존 다중 라운드 보안 집계는 기기가 장시간 온라인 상태를 유지해야 해 대규모 활용에 제약이 있었다. ## 제로 트러스트 기반 다층 방어 - 새 시스템은 암호학적 보호와 TEE를 함께 사용해 어느 한 구성요소에 대한 신뢰 의존도를 줄인다. - 암호 계층은 서버 메모리에서 개별 원시 데이터가 복호화되거나 재구성되지 않도록 한다. - 데이터가 오프디바이스에서 평문으로 처리되는 시점은 이미 집계·익명화된 최종 결과를 다룰 때뿐이다. - TEE의 attestation은 참여자들이 실제로 공개된 코드가 올바르게 컴파일되고 실행되는지 검증할 수 있게 한다. - 따라서 TEE가 공격받더라도 암호 계층이 개별 데이터 보호를 유지하는 방어 심층성을 제공한다. ## 한 번의 메시지로 수행하는 암호 집계 - 새로운 프로토콜은 사용자가 데이터를 여러 차례 주고받지 않고 한 번의 메시지로 제출할 수 있게 한다. - 클라이언트는 데이터를 암호화하며, 서버는 암호문을 직접 합산하면서 그 결과가 원래 메시지들의 합과 대응되도록 처리한다. - 암호화 키 역시 집계되므로, 서버가 얻을 수 있는 복호화 키는 개별 값이 아니라 집계값만 복호화할 수 있다. - 클라이언트 일부는 소규모 위원회(committee)를 구성해 집계값을 해제하는 데 필요한 힌트를 보유한다. - 위원회 구성원은 자주 참여하지 않으며, 복호화 권한은 여러 참여자에게 분산된다. - 추가 차등 개인정보 보호 노이즈가 집계값에 적용되어 개인 정보 노출 가능성을 더욱 낮춘다. - 이 구조는 기기가 여러 라운드 동안 온라인 상태로 유지될 필요를 제거한다. ## Android SafetyCore 적용 - SafetyCore는 Android 9 이상에서 동작하는 개인정보 보호형 시스템 서비스다. - 온디바이스 안전 기능이 실제 환경에서 어떤 위협을 탐지하고 어디서 개선이 필요한지 파악하려면 집계 분석이 필요하다. - Google은 Android SafetyCore 팀과 협력해 새 프라이빗 분석 시스템을 적용하고 있다. - 목표는 사용자 콘텐츠를 직접 공개하지 않으면서 탐지 성능과 놓치는 위협 유형 등 집단적 경향을 파악하는 것이다. ## 실용적인 결론 민감한 온디바이스 데이터를 분석할 때는 TEE만 단독으로 신뢰하기보다, 암호학적 집계·차등 개인정보 보호·TEE attestation을 함께 적용하는 것이 바람직하다. 특히 기기가 지속적으로 연결되기 어려운 환경에서는 일회성 메시지 기반 프로토콜이 운영 효율성과 개인정보 보호를 동시에 개선할 수 있다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

경험적 연구 지원(ERA): Nature 게재에서 계산적 발견 촉진까지

ERA는 Gemini를 활용해 과학 문헌을 탐색하고, 실험 코드를 작성·개선하며, 수천 가지 해결책을 비교하는 과학 연구 지원 도구다. Nature 논문에서 유전체학, 공중보건, 위성영상, 신경과학, 시계열 예측, 수학 등 다양한 벤치마크에서 전문가 수준의 성능을 보였다. Google은 ERA를 활용한 여러 과학 연구 결과를 공개하고, AlphaEvolve와 결합한 Computational Discovery를 Google Labs의 신뢰할 수 있는 테스터 프로그램으로 제공하기 시작했다. ## 과학 코드를 자동으로 탐색하고 최적화하는 ERA - 사용자가 과학적 문제와 성공 기준을 제시하면 ERA가 다음 작업을 수행한다. - 관련 과학 문헌 검색 - 분석 및 예측 코드 작성 - 여러 알고리즘과 기법 조합 - 실행 결과 평가 - 성능이 낮은 접근법 수정 및 반복 실험 - 트리 탐색(tree search) 방식으로 수천 가지 후보를 검토하고, 주어진 목표에 맞춰 코드를 최적화한다. - 단순한 코드 생성이 아니라, 가설과 구현 방법을 실험적으로 비교해 가장 성능이 좋은 계산 모델을 찾는 데 초점을 둔다. ## 다양한 과학 분야에서의 전문가 수준 성능 - Nature 논문에서는 다음 분야의 문제를 대상으로 ERA를 평가했다. - 유전체학 - 공중보건 - 위성영상 분석 - 신경과학 예측 - 일반 시계열 예측 - 수학 - 여러 벤치마크에서 전문가 수준의 결과를 달성했다. - 이 결과는 고급 계산 모델링 기술에 대한 접근성을 넓히고, 기존 전문가의 연구 역량도 확장할 가능성을 보여준다. ## 감염병 입원 환자 예측 - 미국 각 주의 독감, 코로나19, RSV 병원 입원 건수를 최대 4주 앞서 예측했다. - ERA 기반 예측은 세 감염병 모두에서 미국 질병통제예방센터(CDC) 예측 리더보드의 최상위권 또는 1위를 기록했다. - 다른 국가나 질병에도 비교적 쉽게 적용할 수 있는 기법을 사용했다는 점이 강조됐다. ## 캘리포니아 물 공급과 적설 유출량 예측 - 눈으로 물이 공급되는 캘리포니아 강 유역의 계절성 유출량을 예측하는 모델을 개발했다. - ERA 모델은 봄철 유출량을 조기에 예측하는 데 기존 공식 전망인 Bulletin 120(B120)보다 높은 정확도를 보였다. - 예측 정확도가 향상되면 농업과 주민 생활에 중요한 수자원 관리와 배분을 개선할 수 있다. ## 위성 데이터를 활용한 대기 CO₂ 지도 작성 - 정지궤도 기상위성 데이터와 추가 정보를 결합해 대기 중 CO₂ 농도를 추정했다. - 기존 위성인 Orbiting Carbon Observatory-2가 약 16일마다 특정 지점을 측정하는 것과 달리, ERA 모델은 넓은 지역의 CO₂ 농도를 약 10분 간격으로 추정할 수 있다. - 로스앤젤레스 분지의 도시 배출 증가를 식별하고, 식물이 낮 동안 CO₂를 흡수하면서 농도가 감소하는 현상도 포착했다. - 이러한 고해상도 추정치는 온실가스의 공간적·시간적 변화를 모니터링하고 모델링하는 데 활용될 수 있다. ## 태양에너지 장치 설계 최적화 - ERA와 Google Antigravity를 함께 사용해 3차원 태양에너지 포집 구조를 탐색했다. - ERA는 500개의 삼각형으로 구성된 입체 팬(volumetric fan) 형태가 산란된 태양광을 가두면서 후방 음영을 만들지 않아 에너지 포집을 극대화할 수 있다고 제안했다. - 이는 AI 시스템들이 서로 다른 설계·최적화 작업을 결합할 수 있음을 보여주는 사례다. ## 소매 판매 예측 - 미국 경제지표, Google Trends, 과거 판매 패턴, 소비자 심리 등을 입력으로 사용했다. - ERA가 설계한 모델은 상용 컨센서스 전망과 Chicago Fed의 CARTS 월간 소매 판매 예측을 충족하거나 넘어섰다. - 정확한 소매 예측은 재고 부족과 폐기물을 줄이고, 기업 운영과 경제 정책 수립을 지원할 수 있다. ## Computational Discovery로의 확장 - Google은 ERA와 AlphaEvolve를 결합한 Computational Discovery를 공개하기 시작했다. - Computational Discovery는 과학 문제를 계산적으로 탐구하는 보다 넓은 실험 도구로 소개됐다. - Gemini for Science의 다른 도구들과 역할이 구분된다. - Computational Discovery: 계산 실험과 모델 탐색 - Hypothesis Generation: AI Co-Scientist 기반의 가설 생성 - Literature Insights: 과학 문헌 분석 - 이 도구들은 과학적 방법의 서로 다른 단계를 지원하도록 설계됐다. ERA는 과학자의 반복적인 코드 작성과 실험 최적화 작업을 자동화해, 복잡한 계산 연구를 더 빠르고 폭넓게 수행하도록 돕는 도구다. 특히 감염병 예측, 수자원 관리, 기후 모니터링처럼 실제 정책과 공공복지에 직접 연결되는 문제에서 활용 가능성이 크며, 연구자는 ERA를 최종 판단을 대신하는 시스템이라기보다 다양한 계산적 가설을 빠르게 검증하는 연구 파트너로 활용하는 것이 적절하다.

원문 읽기(새 탭에서 열림)
google원문

글로벌 파트너십과 오픈 리소스를 통한 과학적 영향력 촉진 (새 탭에서 열림)

구글 리서치는 책임감 있고 포용적이며 엄격한 연구 원칙을 바탕으로 오픈 사이언스를 추진하며, 전 지구적 파트너십과 공개 리소스를 통해 과학적 발견의 가속화를 도모하고 있습니다. 오픈소스 소프트웨어와 데이터셋을 공유함으로써 연구자들이 성과를 재현하고 확장할 수 있는 환경을 조성하며, 이는 단순히 기술적 혁신에 머무르지 않고 전 세계적인 사회적 진보를 이끄는 촉매제 역할을 합니다. 구글은 트랜스포머 아키텍처부터 전문화된 의료 및 기후 모델에 이르기까지 다양한 자원을 공개하여 전 세계 연구 생태계의 역량을 강화하는 데 집중하고 있습니다. **글로벌 파트너십과 연구 생태계 협력** * 유씨 산타크루즈(UCSC) 유전체 연구소, 자넬리아 연구 캠퍼스, 인도 의학 연구소(AIIMS) 등 전 세계 주요 기관과 협력하여 전문 분야별 연구를 심화하고 있습니다. * 인간 범유전체 연구 컨소시엄(HPRC), 지구 바이오게놈 프로젝트(EBP), NIH BRAIN 이니셔티브와 같은 거대 글로벌 컨소시엄에 참여하여 인류 공통의 과제 해결에 기여합니다. * 인도, 한국, 일본, 호주를 시작으로 지역별 과학 개발자 커뮤니티를 구축하기 위한 투자를 확대하여 실질적인 기술 실천 공동체를 형성하고 있습니다. **분야별 핵심 오픈소스 도구 및 데이터셋** * **유전체학:** DeepVariant, DeepConsensus, DeepPolisher 등 딥러닝 기반 도구를 통해 DNA 분석의 정밀도를 높였으며, 이를 통해 전 세계적으로 250만 명의 전장 유전체 분석을 지원했습니다. * **뇌과학:** 1.4페타바이트 규모의 인간 뇌 조직 데이터셋(H01)과 쥐 시각 피질 지도(MICrONS)를 공개했으며, Neuroglancer 및 TensorStore 같은 도구로 페타스케일의 고해상도 뇌 지도를 탐색하고 분석할 수 있게 했습니다. * **지구 및 기상 모델링:** 18억 개의 건물 감지 데이터를 포함한 'Open Buildings', 하이브리드 기상 모델인 'NeuralGCM', 산불 연구를 위한 'FireBench' 등을 통해 기후 변화 대응과 재난 예측을 돕고 있습니다. * **헬스케어:** MedGemma를 포함한 의료용 파운데이션 모델(HAI-DEF)은 480만 회 이상의 다운로드를 기록 중이며, '오픈 건강 스택(OHS)'은 10개국 이상에서 6,500만 명의 수혜자를 위한 디지털 건강 솔루션 구축에 활용되고 있습니다. **오픈 사이언스가 창출한 실질적 성과** * **유전체 연구 혁신:** UCSC와의 협업을 통해 유전적 변이 식별 오류를 50% 줄였으며, 이는 인류의 다양성을 보다 정확하게 반영하는 범유전체 참조 자료 구축으로 이어졌습니다. * **기상 예측과 농업 지원:** 시카고 대학교 연구팀은 NeuralGCM을 활용해 인도 몬순의 시작을 한 달 전 예측하는 데 성공했으며, 이 정보는 3,800만 명의 인도 농민에게 전달되어 작물 재배 최적화에 기여했습니다. * **의학적 발견:** 존스 홉킨스 대학교 연구진은 구글이 공개한 H01 뇌 데이터셋을 분석하여 기존 학설에 없던 새로운 신경 세포 통신 방식을 발견했으며, 이는 알츠하이머와 같은 질환 연구에 새로운 전기를 마련했습니다. * **인도주의적 활동:** UN 난민기구(UNHCR)는 Open Buildings 데이터를 활용하여 난민 거주지의 재난 대응 샘플링을 최적화하고 해수면 상승에 따른 위험도를 평가하고 있습니다. 오픈 사이언스는 기술적 장벽을 허물고 전 세계 연구자들이 동등한 출발선에서 혁신을 이룰 수 있게 합니다. 연구자와 개발자들은 구글 리서치가 공개한 MedGemma나 NeuralGCM과 같은 특화된 모델과 방대한 데이터셋을 적극 활용함으로써, 각자의 도메인에서 연구의 재현성을 확보하고 사회적 임팩트가 큰 발견을 더 빠르게 도출할 수 있을 것입니다.

google원문

구글 리서치 과학자들이 경험적 연구 지원을 활용해 온 네 가지 방법 (새 탭에서 열림)

Google Research의 '경험적 연구 지원(Empirical Research Assistance, ERA)' 시스템은 과학자들이 전문가 수준의 소프트웨어를 생성하여 복잡한 실제 과학 문제를 해결할 수 있도록 돕는 혁신적인 AI 도구입니다. 이 기술은 단순한 개념 증명을 넘어 역학, 우주론, 기후 모니터링 등 다양한 분야에서 기존 모델을 능가하거나 풀리지 않았던 난제를 해결하며 과학적 발견의 속도를 비약적으로 높이고 있습니다. ERA는 계산 모델링의 접근성을 민주화하고, 데이터에서 더 깊은 통찰력을 추출하며, 해석 가능하고 물리적으로 정확한 솔루션을 제공하는 데 기여하고 있습니다. ### 공중보건: 독감 및 코로나19 입원 예측 * ERA를 활용해 독감, 코로나19, 호흡기 세포융합 바이러스(RSV)로 인한 미국 내 입원 환자 수를 예측하고 질병통제예방센터(CDC)에 매주 실시간 예측치를 제출하고 있습니다. * CDC의 공개 리더보드 분석 결과, Google의 예측 모델은 기존의 주요 연구 기관 및 CDC 자체 도구와 대등하거나 이를 상회하는 수준의 정확도를 기록하며 최상위권을 유지하고 있습니다. * 이는 고가의 장비나 복잡한 역학 모델링 인프라 없이도 신종 전염병을 효과적으로 추적하고 공중보건 대응력을 높일 수 있는 가능성을 보여줍니다. ### 우주론: 우주 끈과 중력 에너지 복사 문제 해결 * 초기 우주에서 형성된 것으로 추측되는 '우주 끈(Cosmic strings)'의 중력 에너지 복사 스펙트럼 산출 과정에서 발생하는 수학적 특이점 문제를 해결했습니다. * 기존에는 GPT-5를 이용해 특정 조건(90도 각도)에서의 부분적인 해만 구했으나, Google은 ERA와 'Gemini Deep Think'를 결합해 보다 복잡한 일반해와 점근 한계(asymptotic limit)에 대한 간결한 공식을 도출했습니다. * 고급 언어 모델(LLM)과 ERA의 결합이 우주론의 최전선에서 정밀하고 새로운 수학적 해법을 찾아내는 강력한 도구가 될 수 있음을 입증했습니다. ### 기후 및 지속 가능성: 기상 위성을 활용한 이산화탄소 모니터링 * 이산화탄소(CO2) 관측 전용 위성이 아닌, 10분마다 지표면을 스캔하는 일반 기상 위성(GOES East) 데이터를 활용해 고해상도 CO2 지도를 생성하는 기술을 개발했습니다. * ERA를 통해 물리 법칙이 가이드된 신경망(physics-guided neural network)을 설계했으며, 16개 파장 대역 데이터와 기상 데이터를 결합해 기존 전용 위성보다 훨씬 높은 시공간 해상도로 CO2 변화를 추적합니다. * 지상 관측 데이터와의 비교를 통해 모델의 정확성을 검증했으며, 이는 자원 집약적인 위성 미션 대신 기존 관측 자산의 가치를 극대화할 수 있는 경제적인 대안을 제시합니다. ERA는 과학자들이 방대한 데이터를 해석 가능한 지식으로 전환하고, 복잡한 물리적 공식을 코드로 구현하는 과정에서 발생하는 병목 현상을 제거해 줍니다. 이러한 AI 기반 연구 지원은 단순히 효율성을 높이는 것에 그치지 않고, 그동안 데이터 부족이나 수학적 난제로 인해 멈춰있던 영역에서 새로운 발견을 이끌어내는 핵심 동력이 될 것입니다.

google원문

핵심은 각도: 사진의 재구성 (새 탭에서 열림)

구글은 기존 사진의 구도와 카메라 각도를 촬영 후에 자유롭게 재구성할 수 있는 '오토 프레임(Auto frame)' 기능을 구글 포토에 도입했습니다. 이 기술은 단순한 크롭(자르기)이나 줌을 넘어, 2D 사진을 3D 장면으로 해석하고 생성형 AI를 활용해 가상의 카메라 위치에서 바라본 새로운 시점의 이미지를 구현합니다. 이를 통해 사용자는 인물의 왜곡을 바로잡거나 촬영 당시 놓쳤던 배경까지 포함된 완벽한 구도의 사진을 얻을 수 있습니다. **기존 편집 방식의 한계와 새로운 접근법** * 전통적인 크롭이나 줌 방식은 이미 고정된 시점 내에서만 작동하므로 시차(Parallax)를 변경하거나 프레임 밖의 영역을 보여줄 수 없다는 근본적인 한계가 있었습니다. * 구글의 새로운 방식은 사진을 단순한 평면이 아닌 '시간 속에 얼어붙은 3D 장면'으로 취급하여, 가상 공간 안에서 카메라의 위치와 각도를 자유롭게 이동시키는 방식을 취합니다. * 이 과정은 원래 보였던 부분을 유지하면서도 이전에 가려졌던 콘텐츠를 지능적으로 생성하여 실제와 같은 새로운 원근감을 형성합니다. **3D 장면 추정과 카메라 파라미터 최적화** * 내부적인 3D 포인트 맵(3D point map) 추정 모델을 통해 사진 속 모든 픽셀의 깊이와 표면 정보를 파악하며, 특히 인물의 정체성을 보존하기 위해 신체와 얼굴 재구성에 특화된 모델을 사용합니다. * 원래 사진 촬영 당시의 초점 거리(Focal length)를 근사치로 계산하여 가상 카메라의 위치(Pose)와 내부 파라미터(Intrinsics)를 정교하게 조정할 수 있게 합니다. * 이러한 3D 추정 단계와 이미지 생성 단계를 분리함으로써, 단순한 픽셀 변형이 아닌 물리적으로 타당한 카메라 조작이 가능해졌습니다. **생성형 잠재 확산 모델을 통한 공백 보완** * 가상 카메라를 이동시키면 원래 렌즈에 포착되지 않았던 배경 영역에 '구멍(Holes)'이 생기는데, 이를 해결하기 위해 생성형 잠재 확산 모델(Latent Diffusion Model)을 사용하여 자연스럽게 채워 넣습니다. * 이 모델은 카메라 파라미터 데이터셋을 기반으로 훈련되었으며, 렌더링된 추정치를 보정하고 보충하여 최종 이미지를 완성합니다. * 추론 시에는 특정 지역 스케일링(Regional scaling) 기법이 포함된 분류기 가이드 방식을 사용하여 원본의 핵심 콘텐츠를 충실히 유지하면서도 생성형 AI의 창의성을 발휘해 빈 공간을 메웁니다. **지능형 자동 프레이밍 및 왜곡 수정** * 머신러닝 모델이 주요 피사체의 얼굴 위치와 3D 방향을 감지하여 포트레이트 사진에 최적화된 구도를 자동으로 계산하고 제안합니다. * 특히 광각 전면 카메라로 촬영 시 발생하는 원근 왜곡(가까운 피사체가 비정상적으로 크게 보이는 현상)을 자동으로 감지합니다. * 가상 카메라의 특성을 조정해 피사체에서 물리적으로 한 발짝 뒤로 물러나 찍은 듯한 효과를 주어, 훨씬 더 자연스럽고 보기 좋은 비율을 복원합니다. 현재 이 기술은 구글 포토의 '오토 프레임' 기능 내에서 자동 편집 옵션으로 제공되고 있습니다. 사용자는 별도의 복잡한 작업 없이 클릭 한 번으로 3D 인지 기술이 적용된 최적의 구도를 추천받을 수 있으므로, 구도가 아쉬운 인물 사진이나 왜곡이 심한 셀피를 개선하는 데 유용하게 활용할 수 있습니다.

google원문

ReasoningBank: 에이전트가 경험을 통해 학습할 수 있도록 하기 (새 탭에서 열림)

ReasoningBank는 에이전트가 배포된 이후에도 성공과 실패의 경험으로부터 일반화된 추론 전략을 추출하여 스스로 진화할 수 있게 돕는 새로운 메모리 프레임워크입니다. 기존 방식이 단순히 실행 기록을 저장하거나 성공 사례만 수집했던 것과 달리, ReasoningBank는 고차원의 전략적 통찰을 구조화하여 저장함으로써 에이전트의 성공률과 작업 효율성을 동시에 개선합니다. 이는 에이전트가 반복적인 실수를 방지하고 복잡한 환경에서 지속적으로 학습하는 '지속적 학습자(Continuous Learner)'로 거듭나게 하는 핵심 기술입니다. **전략적 통찰의 구조화와 추출** - ReasoningBank는 단순히 과거의 행동을 기록하는 것이 아니라, 제목(Title), 설명(Description), 내용(Content)으로 구성된 고차원의 구조화된 메모리 항목을 생성합니다. - '검색-추출-통합'의 연속적인 폐쇄 루프(Closed-loop)를 통해 작동하며, LLM-as-a-judge 기능을 활용해 에이전트의 궤적을 스스로 평가하고 통찰을 도출합니다. - 특히 실패한 경험에서 '반사실적 신호(Counterfactual signals)'를 분석하여, "무한 스크롤 함정에 빠지지 않기 위해 현재 페이지 식별자를 먼저 확인하라"와 같은 예방적 가드레일을 구축하는 데 탁월합니다. **메모리 기반 테스트 시간 확장(MaTTS)** - 추론 시점의 컴퓨팅 자원 확장(Test-time scaling)을 메모리와 결합하여 학습 신호를 극대화하는 MaTTS 기법을 도입했습니다. - **병렬 확장(Parallel scaling):** 동일한 쿼리에 대해 여러 경로를 생성하고 이를 상호 비교함으로써 더 견고한 전략을 합성하고 고품질의 메모리를 생성합니다. - **순차 확장(Sequential scaling):** 단일 작업 내에서 추론을 반복적으로 정제하며, 시행착오 과정에서 발생하는 중간 단계의 통찰을 메모리에 기록합니다. - 이 과정에서 고품질 메모리는 확산된 탐색을 유망한 전략으로 안내하고, 확장된 상호작용은 다시 메모리를 풍부하게 만드는 시너지 효과를 냅니다. **성능 향상 및 전략적 성숙도의 발현** - WebArena 및 SWE-Bench-Verified 벤치마크 평가 결과, 메모리가 없는 기본 모델 대비 성공률이 최대 8.3% 향상되었으며, 작업당 실행 단계는 평균 3단계 가량 단축되었습니다. - 에이전트가 축적된 지식을 바탕으로 점진적으로 발전하는 '전략적 성숙도'가 관찰되었습니다. 초기의 단순한 절차적 체크리스트가 시간이 흐름에 따라 복잡한 조건부 논리 구조를 가진 고급 메모리로 진화했습니다. - 실험 결과 ReasoningBank는 자기 평가 과정의 일부 노이즈에도 강건하게 작동하며, 확장(Scaling)과 결합했을 때 효율성이 더욱 극대화됨이 증명되었습니다. 단순히 성공한 워크플로우를 저장하는 것을 넘어, 실패로부터 배우고 추론 과정을 일반화하는 ReasoningBank의 접근법은 자율형 에이전트의 실용성을 높이는 강력한 도구입니다. 복잡한 소프트웨어 엔지니어링이나 동적인 웹 환경에서 작동하는 에이전트를 설계한다면, 실행 시간의 연산량을 메모리 업데이트로 전환하는 MaTTS 방식의 도입을 적극 고려해 볼 수 있습니다.

google원문

AI가 생성한 합성 뉴런으로 뇌 지도 제작 가속화 (새 탭에서 열림)

Google Research는 뇌의 복잡한 연결망을 재구성하는 커넥토믹스(Connectomics) 분야의 효율을 높이기 위해 합성 뉴런 형태를 생성하는 AI 모델 'MoGen'을 개발했습니다. MoGen이 생성한 합성 데이터를 기존 재구성 모델인 PATHFINDER의 학습에 활용한 결과, 재구성 오류를 4.4% 줄였으며 이는 생쥐 뇌 전체 지도를 제작할 때 약 157년의 수동 검토 시간을 절약할 수 있는 획기적인 성과입니다. 이번 연구는 현대적인 생성형 AI 기법을 활용해 대규모 뇌 지도 제작의 최대 병목 구간인 인적 검증 과정을 크게 단축할 수 있음을 입증했습니다. **커넥토믹스의 거대한 규모와 수동 검증의 한계** * 커넥토믹스는 뇌세포인 뉴런을 재구성하여 뇌의 배선도를 만드는 분야로, 최근 초파리 뇌 전체 지도를 완성했으나 생쥐나 인간의 뇌는 그보다 수천 배 더 커서 현재 기술로는 한계가 있습니다. * 현미경 영상을 3D 뉴런 형상으로 변환하는 과정에서 AI가 사용되지만, 최종 결과물에 대한 전문가의 수동 검토(Proofreading) 단계가 여전히 가장 많은 시간을 소요하는 병목 현상으로 작용합니다. * 뉴런은 가늘고 긴 축삭(Axon)과 복잡하게 가지를 친 수지상 돌기(Dendrite) 등 매우 불규칙하고 복잡한 기하학적 구조를 가지고 있어 AI가 이를 정확히 파악하는 데 어려움을 겪습니다. **MoGen: 포인트 클라우드 기반의 뉴런 형태 생성** * 연구진은 'PointInfinity' 포인트 클라우드 흐름 매칭(flow matching) 모델을 기반으로 한 MoGen(Neuronal Morphology Generation)을 개발했습니다. * 이 모델은 무작위적인 3D 점들의 집합(포인트 클라우드)을 점진적으로 변형시켜 실제 뉴런과 흡사한 3D 형상을 생성합니다. * 검증된 생쥐 대뇌 피질의 축삭 데이터를 학습한 MoGen은 실제 뉴런의 구부러짐, 뒤틀림, 가지치기 등의 특성을 완벽하게 재현하며, 인간 전문가조차 실제와 합성 데이터를 구별하지 못할 정도의 정교함을 보여주었습니다. **재구성 모델 PATHFINDER의 성능 최적화** * 뉴런 재구성 모델인 PATHFINDER를 학습시킬 때 MoGen이 생성한 수백만 개의 합성 데이터를 10% 비중으로 포함했습니다. * 그 결과, 서로 다른 뉴런이 하나로 합쳐지는 '병합 오류(Merge error)'를 중심으로 전체 오류율이 4.4% 감소하는 성과를 거두었습니다. * 단순한 수치처럼 보일 수 있으나, 생쥐 뇌 전체 규모로 환산하면 전문가 한 명이 157년 동안 작업해야 하는 분량의 수동 수정을 대체할 수 있는 경제적 효과를 가집니다. **오픈 소스화 및 향후 확장 계획** * Google Research는 MoGen 모델과 종별로 학습된 모델들을 오픈 소스로 공개하여 커뮤니티의 연구를 지원하고 있습니다. * 향후에는 특정 뉴런 유형(길이, 분기 수 등)을 조절하여 생성하거나, 재구성 오류가 자주 발생하는 특정 기하학적 구조를 집중적으로 학습시켜 모델을 고도화할 계획입니다. * 생쥐 외에도 금화조, 초파리 등 다양한 종의 뉴런 생성 모델을 개발 중이며, 합성 뉴런을 활용해 전자현미경 이미지를 생성하는 방식 등 공정 전반에 걸친 데이터 증강을 모색하고 있습니다. 이 기술은 향후 생쥐 뇌 전체 지도 제작과 같은 거대 프로젝트를 수행하는 데 필수적인 기반 도구가 될 것으로 보이며, 연구자들은 MoGen을 통해 확보한 데이터로 뇌 과학 연구의 속도를 한층 더 높일 수 있을 것입니다.

google원문

현실 세계를 위한 합성 데이터셋 설계: 메커니즘 설계와 제1원칙에 기반한 추론 (새 탭에서 열림)

구글 연구진이 발표한 'Simula' 프레임워크는 합성 데이터 생성을 개별 샘플 최적화가 아닌 '데이터셋 수준의 메커니즘 설계'로 재정의하여 전문화된 AI 모델 학습의 데이터 부족 문제를 해결합니다. 추론 모델을 활용해 제1원칙(First principles)부터 데이터셋을 설계하는 이 방식은 데이터의 범위, 복잡성, 품질을 독립적으로 제어할 수 있는 확장 가능한 솔루션을 제공합니다. 특히 보안이나 법률과 같이 데이터가 희소하거나 개인정보에 민감한 영역에서 실제 세계의 데이터를 대체하거나 보완할 수 있는 고품질의 합성 데이터를 생성하는 데 탁월한 성능을 보입니다. **기존 합성 데이터 생성의 한계와 메커니즘 설계의 필요성** * **실제 데이터의 제약:** 수동 데이터 제작은 비용이 많이 들고 오류가 잦으며, 정적인 특성 때문에 모델의 안전성을 테스트하기 위한 에지 케이스(Edge case)를 선제적으로 생성하기 어렵습니다. * **기존 합성 방식의 문제:** 수동 프롬프트나 진화 알고리즘에 의존하는 방식은 확장성이 떨어지고, 생성 과정이 '블랙박스' 형태여서 설명 가능성이 부족하며, 개별 샘플 단위의 최적화에 그친다는 한계가 있습니다. * **프로그래밍 가능한 워크플로우:** Simula는 데이터를 코드처럼 버전 관리하고 재현하며 검사할 수 있는 '데이터 우선(Synthetic-first)' 접근법을 제안하며, 이를 위해 데이터셋 전체의 구조를 설계하는 메커니즘 디자인을 도입했습니다. **Simula: 추론 기반의 데이터 생성 4단계** * **전역적 다양화(Global Diversification):** 무작위 샘플링 대신 추론 모델을 사용해 대상 도메인의 개념 공간을 계층적 분류 체계(Taxonomy)로 맵핑합니다. '제안-수정' 루프를 통해 인간의 시드 데이터 없이도 도메인의 롱테일 영역까지 포괄하는 샘플링 토대를 구축합니다. * **지역적 다양화(Local Diversification):** 특정 개념 내에서의 변주를 확보하기 위해 '메타 프롬프트'를 생성합니다. 예를 들어 'SQL 인젝션'이라는 노드에서 수많은 서로 다른 시나리오를 파생시켜 데이터가 특정 형태에 매몰되는 '모드 붕괴(Mode collapse)'를 방지합니다. * **복잡화(Complexification):** 난이도를 독립적인 축으로 설정하여, 의미적 범위는 유지한 채 메타 프롬프트를 더 정교하고 어렵게 정제합니다. 이를 통해 실무자는 데이터셋의 난이도 분포를 자유롭게 조정할 수 있습니다. * **품질 검증(Quality Checks):** 인간의 개입 없이 정답의 정확성을 보장하기 위해 '이중 비평(Dual-critic)' 루프를 실행합니다. 이는 모델이 그럴싸한 답변에 무조건 동조하는 '아첨(Sycophancy)' 현상을 방지하고 레이블의 신뢰도를 높입니다. **추론 중심의 새로운 평가 지표** * **기존 지표의 한계:** 임베딩 기반의 코사인 유사도와 같은 표준 지표는 합성 데이터의 실제 유용성이나 구체적인 개선 방향을 제시하는 데 한계가 있습니다. * **새로운 측정 도구:** Simula는 분류 체계 기반의 '범위(Taxonomic Coverage)'와 LLM 간의 배치 비교를 통해 개별 데이터에 체스식 점수를 매기는 '보정된 복잡성 점수(Calibrated Complexity Scoring, Elo rating)'를 도입하여 데이터의 질을 입체적으로 평가합니다. **실험을 통해 증명된 합성 데이터의 원칙** * **메커니즘 설계의 필수성:** 사이버 보안, 법률, 수학 등 다양한 도메인에서 Simula로 생성된 데이터셋은 단순한 베이스라인 방식보다 일관되게 높은 성능을 기록했습니다. * **맥락에 따른 데이터 맞춤화:** 수학적 추론에서는 높은 복잡성이 성능을 10% 향상시켰으나, 법률 분야에서는 오히려 성능을 저하시켰습니다. 이는 데이터를 소비할 모델의 역량에 맞춰 데이터 난이도를 최적화해야 함을 시사합니다. * **양보다 질의 법칙:** 고품질의 합성 데이터는 적은 샘플 수로도 더 높은 성능을 달성했으며, 이는 AI 모델의 스케일링 법칙이 단순한 데이터의 양이 아닌 데이터의 내재적 속성에 의해 주도됨을 확인시켜 줍니다. 성공적인 AI 모델 전문화를 위해서는 단순히 데이터를 많이 생성하는 것이 아니라, 도메인의 지식 구조를 반영한 정교한 설계가 선행되어야 합니다. Simula 프레임워크와 같이 추론 모델을 활용해 데이터셋의 다양성과 복잡성을 능동적으로 제어하는 방식은 향후 데이터가 부족한 특수 분야 AI 개발의 핵심적인 방법론이 될 것입니다.

google원문

생성형 AI를 활용한 미래 대응 역량 강화를 향하여 (새 탭에서 열림)

구글 리서치는 뉴욕대학교(NYU)와의 협력을 통해 생성형 AI를 활용하여 '미래 역량(future-ready skills)'을 측정하는 연구 프로젝트인 'Vantage'를 공개했습니다. 이 시스템은 AI 아바타와의 대화를 통해 협업, 비판적 사고 등 정량화하기 어려운 인간의 역량을 시뮬레이션 환경에서 평가하며, 연구 결과 AI의 채점 정확도가 인간 전문가 수준에 도달했음을 입증했습니다. Vantage는 현재 구글 랩스(Google Labs)를 통해 영어 버전으로 제공되어 교육 현장에서의 활용 가능성을 탐색하고 있습니다. **미래 역량 측정의 난제와 시뮬레이션의 도입** * 비판적 사고, 협업, 창의적 사고와 같은 미래 역량은 현대 사회에서 필수적이지만, 기존의 표준화된 시험으로는 그 사고 과정이나 상호작용을 포착하기 어렵습니다. * 실제 인간 간의 상호작용을 통해 평가하는 방식은 자원 소모가 크고, 모든 학생에게 동일한 갈등 상황이나 과제를 부여하기 어려워 표준화된 채점이 불가능하다는 한계가 있습니다. * Vantage는 이러한 문제를 해결하기 위해 AI 아바타와 함께 과제를 수행하는 역동적인 다자간 대화 환경(Sandbox)을 구축하여 실제 세계와 유사한 평가 시나리오를 제공합니다. **Executive LLM을 활용한 적응형 평가 엔진** * **Executive LLM의 역할:** 대화의 흐름을 실시간으로 분석하고 평가 루브릭(평가 기준표)에 따라 AI 아바타들을 통제합니다. 사용자가 특정 역량을 드러낼 수 있도록 의도적으로 의견을 반박하거나 갈등을 도입하는 등 동적인 도전을 제시합니다. * **데이터 밀도 최적화:** 단순한 대화에 그치지 않고, 평가에 필요한 핵심 정보를 단시간 내에 이끌어낼 수 있도록 대화를 유도하는 '차세대 적응형 평가 엔진' 역할을 수행합니다. * **AI 평가기(Evaluator):** 대화가 종료되면 AI 평가기가 전체 대화 기록을 분석하여 정밀한 기술 지도(Skill map)와 정성적인 피드백을 제공함으로써, 보이지 않던 인간의 역량 발달 과정을 시각화합니다. **연구를 통한 기술적 타당성 검증** * **대화 유도 능력:** 실험 결과, Executive LLM은 독립적인 AI 모델들보다 대화 흐름을 자연스럽게 유지하면서도 평가에 필요한 기술 관련 정보를 훨씬 더 높은 밀도로 이끌어내는 것으로 나타났습니다. * **채점 정확도:** AI 평가자가 매긴 점수와 NYU 전문가들이 매긴 점수를 비교했을 때, 두 집단 간의 일치도는 인간 전문가들 사이의 일치도와 유사한 수준을 기록했습니다. 이는 AI가 복잡한 인간 역량을 신뢰할 수 있는 수준으로 자동 채점할 수 있음을 의미합니다. * **확장성:** 구글은 스타트업 OpenMic과의 협력을 통해 창의성 및 영어 영문학 과제 등 다른 교과 영역에서도 AI 평가기의 성능을 확인하며 적용 범위를 넓히고 있습니다. **실용적인 시사점** Vantage는 교육자가 학생들의 소프트 스킬을 객관적으로 파악하고 이를 기반으로 맞춤형 수업을 설계할 수 있도록 돕는 강력한 도구가 될 수 있습니다. 기술의 발전으로 정답이 없는 복합적인 문제 해결 능력이 중요해진 만큼, 이러한 AI 기반 시뮬레이션 평가 도구를 학습 과정에 도입하여 학생들에게 안전한 실패와 성장의 기회를 제공할 것을 권장합니다.