Google Research

158 개의 포스트

research.google/blog

태그로 필터

google원문

야생동물이 거니는 곳 (새 탭에서 열림)

구글 리서치가 개발하여 오픈소스로 공개한 SpeciesNet은 카메라 트랩(무인 카메라)에 포착된 야생동물을 AI로 자동 식별하는 혁신적인 도구입니다. 약 2,500종의 동물을 분류할 수 있는 이 모델은 전 세계 보존 파트너들이 제공한 650만 개의 라벨링된 이미지를 통해 학습되었으며, 연구자들이 수년이 걸릴 방대한 양의 데이터를 단 며칠 만에 분석할 수 있게 해줍니다. 현재 이 도구는 생태계 모니터링 속도를 획기적으로 높이고 멸종 위기종 보호를 위한 실시간 의사결정을 지원하며 전 세계 환경 보호 활동의 필수적인 자산으로 자리 잡았습니다. **카메라 트랩 기반의 자동화된 야생동물 모니터링** - 열이나 움직임에 의해 작동하는 카메라 트랩은 수천에서 수백만 장의 이미지를 생성하며, 이를 수동으로 분류하는 데는 막대한 시간과 인력이 소모됩니다. - SpeciesNet은 딥러닝 기술을 활용하여 이미지 내 동물의 종을 자동 식별함으로써 연구 데이터 분석 효율성을 극대화합니다. - 동물의 개체 수 건강 상태 파악, 기후 변화에 따른 이동 경로 추적, 멸종 위기종의 서식지 확인 등 근거 중심의 보존 조치를 가능하게 합니다. **SpeciesNet의 기술적 사양과 성능** - **모델 협업:** 이미지 내에서 동물이 포함된 픽셀을 먼저 찾아내는 'MegaDetector' 모델과 연동되어 작동하며, 종 이름과 함께 신뢰도(Confidence level)를 출력합니다. - **처리 능력:** 일반 노트북에서는 하루 약 3만 장, 보급형 게이밍 GPU 환경에서는 하루 25만 장 이상의 이미지를 처리할 수 있는 높은 효율성을 자랑합니다. - **학습 데이터:** CNN(합성곱 신경망) 구조를 기반으로 하며, 'Wildlife Insights' 플랫폼의 6,500만 장 이상의 검증된 이미지 데이터를 학습하여 조도나 촬영 각도가 불리한 환경에서도 높은 성능을 발휘합니다. - **정확도:** 테스트 데이터셋 기준 동물이 포함된 이미지를 찾아내는 비율은 99.4%이며, 종 수준까지 분류하는 비율은 83%, 그중 예측 정확도는 94.5%에 달합니다. **전 세계 연구 현장의 적용 사례** - **탄자니아 세렝게티:** 2010년부터 축적된 1,100만 장의 이미지를 현장에서 단 며칠 만에 분석하여, 동물의 출현 패턴에 따라 카메라를 실시간으로 재배치하는 등 유연한 연구를 지원합니다. - **호주(WildObs):** 오픈소스 특성을 활용해 호주 특유의 종인 사향쥐캥거루 등을 식별할 수 있도록 모델을 지역 맞춤형으로 재학습시켜 사용하고 있습니다. - **미국 아이다호:** 주 정부 야생동물국(IDFG)의 업무 흐름에 SpeciesNet을 통합하여 곰, 사슴, 엘크 등 산림 지역 동물의 모니터링 속도를 높이고 인간의 검증 단계를 대폭 단축했습니다. - **플랫폼 확장성:** Animl(웹 플랫폼), AddaxAI(데스크톱 도구) 등 다양한 공공 및 민간 플랫폼에 통합되어 생태학자들이 자신의 컴퓨터에서 직접 AI 모델을 실행할 수 있는 환경을 제공합니다. SpeciesNet은 구글 어스 AI(Google Earth AI) 프로젝트의 일환으로, 대규모 환경 데이터와 실행 가능한 보존 통찰력 사이의 간극을 메우고 있습니다. 방대한 이미지 데이터를 처리해야 하는 연구 기관이나 개인 활동가는 Wildlife Insights 클라우드 플랫폼을 활용하거나 SpeciesNet 오픈소스를 직접 다운로드하여 로컬 워크플로우에 통합함으로써, 단순 반복 작업인 라벨링 시간을 줄이고 본연의 생태 분석 및 보호 활동에 집중할 것을 권장합니다.

google원문

LLM에게 베이지안처럼 추 (새 탭에서 열림)

거대언어모델(LLM)이 사용자와 상호작용하며 최적으로 추론하도록 하기 위해, 베이즈 정리(Bayes' rule)를 따르는 모델의 예측 과정을 모방하도록 학습시키는 '베이지안 티칭(Bayesian teaching)' 프레임워크가 제안되었습니다. 기존 LLM은 새로운 정보가 주어져도 확률적 추론에 한계를 보이며 성능이 정체되는 경향이 있었으나, 최적의 베이지안 모델을 파인튜닝 지표로 삼음으로써 불확실성을 관리하고 신념을 업데이트하는 능력을 크게 개선했습니다. 연구 결과, 이 방식은 특정 작업의 성능을 높일 뿐만 아니라 학습하지 않은 새로운 도메인으로의 일반화 가능성까지 입증하며 LLM의 근본적인 추론 기술 향상 가능성을 보여주었습니다. **LLM의 확률적 추론 능력 평가** * **항공편 추천 시뮬레이션:** 출발 시간, 소요 시간, 경유 횟수, 비용 등 다양한 선호도를 가진 가상 사용자와 5단계에 걸쳐 상호작용하며 최적의 항공편을 추천하는 과제를 수행했습니다. * **베이지안 어시스턴트와 비교:** 최적의 베이지안 전략을 따르는 모델을 기준점으로 삼아, LLM이 새로운 정보에 따라 사용자 선호도 추정치를 얼마나 잘 업데이트하는지 측정했습니다. * **성능 정체 현상 발견:** 일반적인 LLM은 첫 번째 상호작용 이후 성능이 정체되는 반면, 베이지안 모델은 정보가 쌓일수록 정확도가 지속적으로 향상되는 격차를 보였습니다. 이는 LLM이 새로운 정보를 통합하여 내부 표현을 수정하는 데 취약함을 의미합니다. **베이지안 티칭 프레임워크의 구조** * **사전 신념과 사후 신념의 순환:** 모델이 가진 기존 지식(Prior)을 새로운 증거(Evidence)와 결합하여 업데이트된 지식(Posterior)으로 전환하는 과정을 지도 학습(Supervised Fine-tuning)으로 구현했습니다. * **오라클 티칭(Oracle Teaching):** 사용자의 실제 정답(완벽한 선호도 정보)만을 학습 데이터로 제공하는 방식으로, 모델이 항상 정답만을 맞히도록 유도합니다. * **베이지안 티칭(Bayesian Teaching):** 베이지안 어시스턴트가 정보가 부족한 상황에서 내린 '확률적인 최선의 추측' 과정을 모방하게 하는 일종의 증류(Distillation) 기법입니다. * **불확실성 학습:** 베이지안 티칭은 모델에게 정답뿐만 아니라, 정보가 불충분할 때 가질 수 있는 불확실성을 유지하고 논리적으로 추론하는 법을 가르칩니다. **학습 결과 및 추론 기술의 일반화** * **추론 정확도 역전:** 베이지안 티칭을 거친 LLM은 정답 데이터만을 학습한 오라클 티칭 모델보다 실제 사용자 선택을 예측하는 데 더 높은 성과를 거두었습니다. * **베이지안 모델과의 높은 일치도:** 파인튜닝된 LLM은 정보 업데이트 방식에서 베이지안 모델과 유사한 패턴을 보였으며, 이는 모델이 단순 암기가 아닌 확률적 사고방식을 체득했음을 보여줍니다. * **도메인 확장성:** 훈련에 사용되지 않은 다른 유형의 작업에서도 베이지안 추론 방식을 적용하는 능력이 향상되었습니다. 이는 LLM이 예시를 통해 일반적인 추론 기술을 학습하고 이를 새로운 영역으로 전이할 수 있음을 시사합니다. LLM을 단순한 챗봇을 넘어 지능형 에이전트로 활용하기 위해서는 단순히 정답(Ground Truth)만을 학습시키기보다, 베이지안 모델과 같은 최적의 사고 과정을 데이터화하여 학습시키는 전략이 유효할 것으로 보입니다. 이는 특히 사용자 개인화가 중요한 추천 시스템이나 복잡한 의사결정 지원 시스템 구축에 실용적인 해결책이 될 수 있습니다.

google원문

AI에게 지도 읽는 법 가 (새 탭에서 열림)

구글 연구진은 멀티모달 거대언어모델(MLLM)이 지도의 기하학적 구조를 이해하고 경로를 추적할 수 있도록 돕는 합성 데이터 생성 파이프라인인 'MapTrace'를 제안했습니다. 기존 모델들이 이미지 내 객체 인식에는 능숙하지만 벽과 길을 구분하는 정밀한 공간 추론에는 한계를 보인다는 점에 착안하여, 200만 개의 데이터 쌍을 자동으로 생성해 학습시키는 방법론을 정립했습니다. 연구 결과, 이러한 합성 데이터를 통한 미세 조정(Fine-tuning)만으로도 모델의 공간 추론 능력을 비약적으로 향상시킬 수 있음이 증명되었습니다. **공간 추론 능력 결여와 데이터 확보의 어려움** * 기존 MLLM은 물리적 세계에 대한 '접지(Grounding)'가 부족하여 지도의 선을 벽으로 인식하지 못하고 통과하는 등 물리적 제약을 무시하는 경향이 있습니다. * 이를 해결하기 위한 정밀한 경로 데이터는 수동으로 구축하기에 비용이 지나치게 비싸고, 쇼핑몰이나 테마파크 같은 복잡한 지도는 대개 저작권 문제로 수집이 어렵습니다. * 결과적으로 모델은 지도를 구조화된 공간이 아닌 단순한 픽셀의 집합으로만 인식하게 되는 '데이터 병목 현상'을 겪게 됩니다. **MapTrace: 4단계 합성 데이터 생성 파이프라인** * **다양한 지도 생성:** LLM이 동물원, 쇼핑몰 등 다양한 장소에 대한 묘사를 생성하면, 이를 이미지 생성 모델(Imagen-4 등)에 입력하여 복잡한 지도 이미지를 얻습니다. * **이동 가능 영역 식별(Mask Critic):** 색상 기반 클러스터링으로 통행 가능한 경로 마스크를 추출한 뒤, MLLM '마스크 비평가'가 실제 사람이 다닐 수 있는 길인지 품질을 검증합니다. * **내비게이션 그래프 구축:** 검증된 2D 마스크를 노드(교차로)와 엣지(길)로 구성된 디지털 그래프 형태로 변환하여 계산 가능한 네트워크를 만듭니다. * **최적 경로 생성 및 검증(Path Critic):** 다익스트라(Dijkstra) 알고리즘으로 최단 경로를 계산한 후, 최종적으로 '경로 비평가' MLLM이 해당 경로가 논리적이고 인간의 이동 양식에 부합하는지 최종 승인합니다. **성능 검증 및 기술적 성과** * 연구진은 생성된 200만 개의 Q&A 쌍 중 일부(23,000개)만으로 Gemma 3 27B 및 Gemini 2.5 Flash 모델을 학습시켰으며, 실제 지도 데이터셋인 MapBench에서 성능 향상을 확인했습니다. * 성능 측정에는 두 좌표 시퀀스 사이의 거리를 비교하는 NDTW(Normalized Dynamic Time Warping) 지표를 활용하여 경로의 정확도를 정밀하게 평가했습니다. * 이미지 생성 과정에서 텍스트 렌더링 오류가 간혹 발생하지만, 경로 추적의 정확성 측면에서는 합성 데이터만으로도 충분한 학습 효과를 거둘 수 있음을 시사합니다. **실용적 제언** AI 모델에 물리적 공간에 대한 상식을 부여하고 싶다면 대규모 수동 레이블링 대신 '비평가(Critic)' 모델이 포함된 자동화된 합성 데이터 파이프라인을 구축하는 것이 비용 효율적입니다. 특히 복잡한 제약 조건이 있는 도메인일수록 모델의 크기를 키우는 것보다 특정 태스크에 맞춤화된 '공간 문법'을 데이터로 가르치는 것이 더 효과적입니다.

google원문

변화하는 세상에서의 스케 (새 탭에서 열림)

클라우드 인프라의 가용 자원이 끊임없이 변동하는 환경에서 중단 없이 실행되어야 하는 비선점형(Non-preemptive) 작업들을 효율적으로 배치하기 위한 새로운 알고리즘이 제시되었습니다. Google Research는 이번 연구를 통해 가용량이 시간에 따라 변하는 환경에서도 작업 처리량(Throughput)을 최대로 확보할 수 있는 최초의 상수 요인(Constant-factor) 근사 알고리즘을 개발했습니다. 이 알고리즘은 변동성이 큰 클라우드 환경에서 작업 손실을 최소화하고 스케줄러의 안정성을 이론적으로 보장하는 기틀을 마련했습니다. ### 동적 클라우드 환경과 스케줄링의 난제 * 현대 클라우드 환경은 하드웨어 장애, 유지보수, 고순위 작업의 자원 점유 등으로 인해 가용 자원이 실시간으로 변동하는 특성을 가집니다. * 특히 비선점형 작업은 한 번 시작하면 중간에 멈출 수 없으며, 자원 부족으로 중단될 경우 지금까지의 모든 작업 진행 내용이 소실되는 리스크가 있습니다. * 스케줄러는 각 작업의 방출 시간(Release time), 마감 기한(Deadline), 처리 시간, 가중치를 고려하여 전체 처리량의 합계(가중치 또는 작업 수)를 극대화해야 합니다. ### 오프라인 설정에서의 최적화 전략 * 미래의 작업 도착 정보와 자원 변동 추이를 미리 알고 있는 오프라인 환경에서는 단순한 그리디(Greedy) 전략이 효과적임이 입증되었습니다. * 가장 먼저 끝나는 작업을 우선 배치하는 그리디 알고리즘은 동일 가치 작업들을 스케줄링할 때 최적해의 최소 1/2 성능을 보장(1/2-approximation)합니다. * 작업마다 가치가 다른 가중치 모델의 경우, Primal-dual 프레임워크를 활용하여 최적해의 1/4 성능을 보장하는 알고리즘을 구현했습니다. ### 온라인 환경의 복잡성과 중단 모델 * 실시간으로 작업이 도착하는 온라인 환경에서는 단 하나의 잘못된 결정(긴 작업 배치)이 미래의 수많은 짧은 작업을 막을 수 있어 기존 방식의 효율성이 급격히 떨어집니다. * **재시작 허용 모델(Interruption with restarts):** 작업 중단 시 진행 데이터는 소실되지만 나중에 다시 시도할 수 있는 모델로, 오프라인과 동일하게 1/2 수준의 경쟁비(Competitive ratio)를 달성할 수 있습니다. * **재시작 불가 모델(Interruption without restarts):** 중단된 작업을 영구히 폐기해야 하는 엄격한 모델로, 일반적인 상황에서는 효율적인 스케줄링이 어렵지만 '공통 마감일'이 있는 실무적 시나리오에서는 해결책을 찾았습니다. ### 공통 마감일 시나리오를 위한 상수 경쟁 알고리즘 * 모든 작업이 동일한 마감 시한을 가지는 실제 배치 작업 환경을 위해 최초의 상수 경쟁 알고리즘(1/11 경쟁비)을 설계했습니다. * 이 알고리즘은 새로운 작업이 도착할 때마다 다음 네 가지 우선순위에 따라 잠정적 스케줄을 갱신합니다. 1. 빈 시간대에 작업 추가. 2. 기존에 예약된 미래 작업보다 현저히 작은 작업으로 교체. 3. 현재 실행 중인 작업의 남은 시간보다 도착한 작업이 더 짧을 경우 실행 중인 작업 중단 및 교체. 4. 위 조건에 해당하지 않을 경우 새 작업 폐기. 이 연구 결과는 자원 공급이 불규칙한 클라우드 시스템에서 이론적 보장을 갖춘 견고한 스케줄러를 구축할 수 있는 근거를 제공하며, 특히 저순위 배치 작업의 효율성을 극대화하는 데 실질적인 도움을 줄 수 있습니다.

google원문

Draft 1: 일대일을 (새 탭에서 열림)

DialogLab은 기존의 1:1 대화 모델을 넘어 복잡한 다자간 대화 시뮬레이션을 가능하게 하는 오픈소스 연구 프로토타입입니다. 이 프레임워크는 구조화된 스크립트의 예측 가능성과 생성형 AI의 즉흥성을 결합하여, 사용자가 사회적 역학 관계를 정의하고 동적인 대화 흐름을 설계 및 테스트할 수 있도록 지원합니다. 이를 통해 개발자와 디자이너는 실제 인간의 대화와 유사한 복잡한 그룹 상호작용을 효율적으로 구현하고 검증할 수 있습니다. ### 사회적 구조와 대화 흐름의 분리 DialogLab의 핵심은 대화의 '사회적 설정'과 '시간적 흐름'을 독립적인 차원으로 분리하여 관리하는 데 있습니다. * **그룹 역학(Group Dynamics):** 대화의 사회적 구조를 정의합니다. 전체 컨테이너인 '그룹', 특정 역할을 가진 하위 그룹인 '파티(Parties)', 그리고 개별 참여자나 공유 콘텐츠인 '엘리먼트(Elements)'로 구성됩니다. * **대화 흐름 역학(Conversation Flow Dynamics):** 대화가 시간에 따라 전개되는 방식을 정의합니다. 대화의 단계를 '스니펫(Snippets)'으로 나누어 각 단계별 참여자, 대화 순서, 상호작용 스타일(협력적 혹은 논쟁적 등)을 설정할 수 있습니다. * **세밀한 규칙 설정:** 단순한 대화를 넘어 끼어들기(Interruptions)나 백채널링(Backchanneling, 맞장구)과 같은 세밀한 규칙을 추가하여 실제와 유사한 대화 환경을 조성합니다. ### 저작-시뮬레이션-검증의 통합 워크플로우 DialogLab은 시각적 인터페이스를 통해 대화를 설계하고 즉시 테스트하며 분석할 수 있는 효율적인 단계를 제공합니다. * **시각적 저작 도구:** 드래그 앤 드롭 방식의 캔버스를 통해 아바타와 콘텐츠를 배치하고, 인스펙터 패널에서 페르소나와 상호작용 패턴을 세부적으로 설정할 수 있습니다. AI가 대화 프롬프트를 자동 생성하는 기능을 지원하여 설계 속도를 높입니다. * **인간 중심 시뮬레이션(Human-in-the-loop):** 라이브 프리뷰 패널에서 대화 내용을 실시간으로 확인하며, '인간 제어' 모드를 통해 AI가 제안하는 답변을 수정, 수락 또는 거부하며 대화의 방향을 직접 조정할 수 있습니다. * **분석 및 검증 대시보드:** 대화가 끝난 후 타임라인 뷰와 사후 분석 도구를 통해 참여자 간의 발언 분포, 감정의 흐름 등을 시각적으로 분석하여 대화의 품질을 검증합니다. ### 실제 테스트 결과 및 사용자 경험 게임 디자인, 교육, 사회과학 분야의 전문가 14명을 대상으로 실시한 평가에서 DialogLab은 다자간 대화 설계의 유연성을 입증했습니다. * **세 가지 테스트 조건:** 사용자가 직접 AI의 반응을 제어하는 '인간 제어형', 미리 정의된 순서대로 반응하는 '자율형', 직접적인 언급에만 반응하는 '반응형' 모델을 비교했습니다. * **높은 몰입감과 현실성:** 전문가들은 '인간 제어형' 모드에서 가장 높은 몰입감과 현실성을 느꼈다고 평가했으며, 이는 복잡한 사회적 시뮬레이션에서 인간의 개입과 제어 능력이 중요함을 시사합니다. * **효율적인 이터레이션:** 시각적인 드래그 앤 드롭 인터페이스와 자동 생성 프롬프트 덕분에 대화 시나리오를 빠르게 반복 수정하고 테스트하는 과정이 매우 직관적이라는 피드백을 받았습니다. DialogLab은 교육용 시뮬레이션, 게임 캐릭터 간의 상호작용 설계, 혹은 복잡한 사회적 역동성을 연구하는 학술적 목적에 특히 유용합니다. 단순히 AI와 대화하는 것을 넘어, AI가 포함된 그룹 내에서의 인간 관계와 소통 방식을 정교하게 설계하고자 하는 기획자들에게 강력한 도구가 될 것입니다.

google원문

조류 데이터를 학습한 (새 탭에서 열림)

구글 딥마인드의 바이오어쿠스틱 파운데이션 모델인 Perch 2.0은 주로 조류와 육상 동물의 소리로 학습되었음에도 불구하고, 수중 환경의 고래 음향 분류 작업에서 탁월한 성능을 보여주었습니다. 이 모델은 직접적인 수중 데이터를 학습하지 않고도 전이 학습(Transfer Learning)을 통해 다양한 해양 생물 종과 생태형을 정밀하게 식별할 수 있음을 입증했습니다. 이는 대규모 데이터로 학습된 범용 모델이 물리적 환경이 전혀 다른 영역에서도 강력한 일반화 능력을 발휘할 수 있음을 시사하며, 해양 생태계 연구의 효율성을 획기적으로 높일 수 있는 가능성을 제시합니다. **전이 학습을 활용한 효율적인 음향 분류** * **임베딩 생성**: Perch 2.0과 같은 사전 학습된 모델은 복잡한 오디오 데이터를 '임베딩(Embedding)'이라고 불리는 작은 특징 배열로 압축합니다. * **저비용 모델 구축**: 대규모 신경망 전체를 처음부터 학습시키는 대신, 추출된 임베딩을 입력값으로 사용하는 단순한 로지스틱 회귀(Logistic Regression) 분류기만 추가하여 새로운 소리를 학습할 수 있습니다. * **자원 절약**: 이 방식은 연구자가 고성능 컴퓨팅 자원을 대량으로 소모하지 않고도 몇 개의 라벨링된 샘플(Few-shot)만으로 특정 해양 생물에 최적화된 맞춤형 분류기를 신속하게 만들 수 있게 해줍니다. **다양한 해양 데이터셋을 통한 성능 검증** * **평가 데이터셋**: 혹등고래, 대왕고래 등 발린고래류를 포함한 'NOAA PIPAN', 산호초의 생물학적 소음이 담긴 'ReefSet', 그리고 범고래의 세부 생태형(Ecotype)을 구분하는 'DCLDE' 데이터셋을 사용하여 모델을 평가했습니다. * **비교 모델**: 기존의 수중 전용 모델인 SurfPerch를 비롯하여 Perch 1.0, 조류 전용 모델인 BirdNet, 그리고 AVES 등 타사의 바이오어쿠스틱 모델들과 성능을 대조했습니다. * **분류 정확도**: Perch 2.0은 거의 모든 테스트 데이터셋과 샘플 수(4~32개) 조건에서 1위 혹은 2위의 AUC_ROC 점수를 기록하며, 수중 오디오로 학습된 모델들에 뒤지지 않거나 오히려 앞서는 성능을 보였습니다. **조류 모델이 수중 소리를 잘 식별하는 이유** * **일반화 능력**: 대규모의 다양한 데이터셋으로 학습된 거대 파운데이션 모델은 특정 종의 소리에 국한되지 않고 소리의 본질적인 패턴을 파악하는 능력이 뛰어납니다. * **음향적 유사성**: 조류의 지저귐과 고래의 노랫소리는 주파수나 구조적 측면에서 공통적인 특징을 공유하는 경우가 많아, 육상 동물 데이터로 구축된 특징 추출 메커니즘이 수중 환경에도 유효하게 작용합니다. * **연구 확장성**: 구글은 연구자들이 이 기술을 쉽게 활용할 수 있도록 Google Colab 튜토리얼을 제공하며, 이를 통해 NOAA의 수동 음향 데이터 아카이브를 활용한 맞춤형 고래 분류기 구축을 지원합니다. 해양 생물학 연구자들은 Perch 2.0의 임베딩 기능을 활용함으로써 방대한 수중 녹음 데이터에서 미지의 소리를 분류하는 시간을 단축할 수 있습니다. 특히 새롭게 발견된 '바이오트왱(Biotwang)'과 같은 정체불명의 소리를 식별하거나, 특정 지역의 범고래 하위 집단을 구분하는 정밀한 연구에 이 모델을 적극적으로 활용해 볼 것을 권장합니다.

google원문

AI 도구가 접근성을 높 (새 탭에서 열림)

구글 리서치는 장애인 커뮤니티와의 긴밀한 협력을 통해 사용자의 고유한 요구에 실시간으로 적응하는 '기본 적응형 인터페이스(Natively Adaptive Interfaces, NAI)' 프레임워크를 공개했습니다. NAI는 정적인 디자인에서 벗어나 멀티모달 AI 에이전트를 활용함으로써, 디지털 환경을 단순한 도구가 아닌 사용자의 맥락을 이해하는 능동적인 협업자로 변모시키는 것을 핵심으로 합니다. 이를 통해 기술이 사용자의 특성에 맞춰 스스로 형태를 바꾸는 진정한 의미의 유니버설 디자인을 구현하고, 기능 출시와 보조 기술 지원 사이의 시차인 '접근성 격차'를 해소하고자 합니다. **공동 설계: "우리 없이 우리에 대해 논하지 말라"** * 장애인 커뮤니티의 오랜 원칙인 "Nothing About Us Without Us"를 개발 생애 주기 전반에 도입하여 실질적인 생활 경험을 기술의 중심에 두었습니다. * RIT/NTID, The Arc, RNID, Team Gleason과 같은 전문 단체들과 협력하여 다양한 의사소통 방식을 이해하는 AI 도구를 공동 개발하고 있습니다. * 이러한 협력 모델은 단순히 도구를 만드는 것을 넘어, 장애인 커뮤니티 내의 경제적 역량 강화와 고용 기회 창출로 이어지는 선순환 구조를 지향합니다. **에이전트 중심의 다중 시스템 아키텍처** * 복잡한 메뉴를 사용자가 직접 탐색하는 대신, 중앙 관리자인 '오케스트레이터(Orchestrator)'가 사용자의 문맥을 파악하고 적절한 하위 에이전트에게 작업을 할당합니다. * **요약 에이전트(Summarization Agent):** 방대한 정보를 분석하여 사용자가 이해하기 쉬운 핵심 통찰로 변환합니다. * **설정 에이전트(Settings Agent):** 텍스트 크기 조절 등 UI 요소를 실시간으로 동적 변경하여 최적의 가독성을 제공합니다. * 이를 통해 사용자는 특정 기능을 찾기 위해 버튼을 헤맬 필요 없이, 시스템과 직관적으로 상호작용하며 문제를 해결할 수 있습니다. **멀티모달 유창성을 활용한 주요 프로토타입** * 제미나이(Gemini) 모델의 시각, 음성, 텍스트 동시 처리 능력을 활용하여 주변 환경을 실시간으로 설명하고 질의응답을 주고받는 기능을 구현했습니다. * **StreetReaderAI:** 시각 장애인을 위한 가상 가이드로, 과거 시각 프레임을 기억하여 "방금 지나친 버스 정류장이 어디인가요?"와 같은 질문에 "뒤로 12미터 지점에 있습니다"라고 구체적으로 답변합니다. * **MAVP (Multimodal Agent Video Player):** 정적인 음성 해설을 넘어, 검색 증강 생성(RAG) 기술을 통해 사용자가 영상 속 특정 세부 사항(예: 등장인물의 의상)을 질문하면 실시간으로 응답하는 양방향 비디오 시청 경험을 제공합니다. * **Grammar Laboratory:** 미국 수어(ASL)와 영어를 동시에 지원하는 이중 언어 AI 학습 플랫폼으로, 사용자의 학습 패턴에 맞춘 맞춤형 콘텐츠와 피드백을 제공합니다. **유니버설 디자인의 확장: 커브 컷 효과** * 장애인을 위해 설계된 기능이 결과적으로 모든 사용자의 편의를 증진하는 '커브 컷 효과(Curb-cut effect)'를 강조합니다. * 시각 장애인을 위해 개발된 음성 인터페이스가 멀티태스킹이 필요한 비장애인에게도 유용하게 쓰이듯, NAI 프레임워크는 모든 사용자에게 더 나은 디지털 경험을 제공합니다. * 학습 장애를 지원하기 위한 요약 및 합성 도구는 복잡한 정보를 빠르게 파악해야 하는 모든 현대인에게 보편적인 가치를 제공하게 됩니다. AI 기술은 이제 단순한 접근성 지원 도구를 넘어, 모든 사람의 고유한 개성과 상황에 맞춰 인터페이스가 스스로 진화하는 '개인화된 유니버설 디자인' 시대를 열고 있습니다. 개발자와 디자이너들은 설계 초기 단계부터 장애인 사용자를 파트너로 참여시키고, 멀티모달 AI를 활용해 정적인 UI를 동적인 에이전트 시스템으로 전환함으로써 더욱 포용적인 디지털 세상을 구축할 수 있습니다.

google원문

순차적 어텐션: 정확 (새 탭에서 열림)

구글 리서치에서 발표한 **Sequential Attention**은 대규모 머신러닝 모델의 효율성을 극대화하기 위해 개발된 서브셋 선택(Subset Selection) 알고리즘입니다. 이 기술은 모델 학습 과정 중에 가장 정보 가치가 높은 구성 요소(특징, 레이어, 블록 등)를 순차적·적응적으로 선택함으로써, 정확도 손실 없이 모델의 크기를 줄이고 추론 속도를 높입니다. 특히 복잡한 비선형 상호작용을 효과적으로 포착하면서도 기존 탐욕적 선택 알고리즘의 막대한 계산 비용 문제를 해결했다는 점이 핵심입니다. ### 서브셋 선택의 난제와 순차적 접근 * **비선형 상호작용의 복잡성:** 현대 딥러닝에서 특정 특징(Feature)은 단독으로는 무의미해 보일 수 있으나 다른 특징과 결합할 때 필수적이 되기도 하며, 반대로 단독으로는 중요해 보여도 다른 특징에 의해 중복 처리가 될 수 있습니다. * **NP-난해(NP-hard) 문제:** 수많은 변수 중 최적의 조합을 찾는 것은 수학적으로 매우 어려운 문제이며, 이를 해결하기 위한 전통적인 탐욕 알고리즘은 모델을 반복해서 재학습시켜야 하므로 비용이 너무 큽니다. * **통합적 최적화:** Sequential Attention은 가중치 프루닝(Pruning), 임베딩 차원 튜닝, 특징 선택 등 다양한 최적화 문제를 '서브셋 선택'이라는 하나의 틀로 보고 접근합니다. ### Sequential Attention의 작동 원리 * **순차적 의사결정:** 모든 후보를 한 번에 평가하는 일반적인 '원샷(one-shot)' 어텐션과 달리, 이미 선택된 구성 요소들을 컨텍스트로 활용하여 '그다음으로 가장 중요한' 요소를 하나씩 찾아냅니다. * **소프트맥스 기반 중요도 평가:** 어텐션 메커니즘의 소프트맥스 점수를 활용하여 후보들의 상대적 중요도를 수치화합니다. * **한 번의 학습 내 최적화:** 별도의 반복적인 재학습 없이, 단일 모델 학습 프로세스 내에서 선택 과정을 통합하여 연산 오버헤드를 최소화합니다. ### 주요 장점 및 기대 효과 * **한계 이득(Marginal Gain) 반영:** 이미 선택된 특징들과의 중복성을 고려하여 점수를 재계산하므로, 모델이 불필요한 중복 정보를 배제하고 가장 효율적인 구조를 갖추게 합니다. * **해석 가능성(Interpretability):** 연구자들은 산출된 어텐션 점수를 통해 모델이 특정 결정을 내릴 때 어떤 입력값에 우선순위를 두었는지 명확하게 파악할 수 있습니다. * **이론적 보장:** 선형 회귀 모델에 적용할 경우 검증된 알고리즘인 OMP(Orthogonal Matching Pursuit)와 수학적으로 동일함이 증명되어 성능의 신뢰성을 뒷받침합니다. ### 실제 적용 사례: 특징 선택 및 블록 희소화 * **특징 선택(Feature Selection):** 이미지 인식, 활동 인식 등 다양한 벤치마크에서 기존 방식보다 적은 특징으로도 업계 최고 수준(SOTA)의 정확도를 달성했습니다. * **블록 희소화(Block Sparsification):** 'SequentialAttention++'를 통해 불필요한 매개변수 블록을 제거합니다. 이는 단순한 가중치 제거를 넘어 하드웨어 가속에 최적화된 블록 단위의 희소성을 구현하여 실제 추론 속도를 대폭 향상시킵니다. * **미분 가능한 프루닝과의 결합:** 학습 가능한 파라미터를 사용하는 방식과 조합 최적화 알고리즘의 장점을 결합하여 더욱 정교한 모델 구조를 설계합니다. 모델의 비대화로 인한 비용 효율성 문제가 중요해지는 시점에서, Sequential Attention은 대규모 신경망의 성능을 유지하면서도 자원 소모를 줄일 수 있는 실용적인 프레임워크를 제공합니다. 효율적인 모델 배포가 필요한 엔지니어라면 이 알고리즘을 통해 특징 선택이나 블록 단위 프루닝을 최적화하는 것을 고려해 볼 수 있습니다.

google원문

실제 가상 진료 환경 (새 탭에서 열림)

구글은 가상 진료 서비스 제공업체인 '인클루디드 헬스(Included Health)'와 협력하여 실제 의료 현장에서 대화형 AI의 성능을 평가하는 대규모 전국 단위 무작위 연구를 시작합니다. 이번 연구는 시뮬레이션이나 과거 데이터를 분석하던 기존 방식에서 벗어나, 실제 임상 워크플로우 내에서 AI의 안전성과 효용성을 검증하는 것을 목표로 합니다. 이를 통해 의료 AI 기술이 전문적인 의료 지식에 대한 접근성을 높이고 의료진의 업무 부담을 줄이는 데 실질적으로 기여할 수 있는지에 대한 엄격한 증거를 구축할 계획입니다. ### 실규모 전국 단위 연구의 목표와 체계 * **실제 진료 환경에서의 검증:** 시뮬레이션이 아닌 실제 가상 진료 워크플로우에 AI를 적용하여 전국 각지의 환자와 다양한 질환군을 대상으로 대규모 데이터를 수집합니다. * **무작위 대조군 시험(RCT):** 동의한 참여자를 대상으로 표준 임상 관행과 AI 기반 진료를 비교하는 무작위 대조군 시험 방식을 채택하여 연구의 신뢰도를 높입니다. * **책임감 있는 기술 도입:** 의학적 개입에 요구되는 수준과 유사한 높은 증거 생성 기준을 적용함으로써, AI 시스템이 환자와 의료진에게 안전하고 유익하다는 신뢰를 구축하고자 합니다. ### 단계적 연구 진화 과정 * **초기 진단 역량 연구:** 초기에는 AI의 진단 추론 능력과 의사 보조 효과를 확인하였으며, 모의 환자를 활용하여 1차 진료 의사와의 대화 역량을 비교하는 실험을 거쳤습니다. * **단일 센터 타당성 조사:** 베스 이스라엘 데이커니스 의료센터(BIDMC)와 협력하여 실제 임상 현장에서의 안전성(안전 감독자의 개입 빈도 등)을 측정하는 소규모 연구를 선행했습니다. * **전국 단위 확산:** 단일 기관 연구를 통해 확인된 안전성 지표를 바탕으로, 이제 전국 단위의 규모 확장을 통해 임상적 유용성과 환자 경험을 심층 분석하는 단계로 진입했습니다. ### AI 시스템의 기반이 되는 핵심 기술 * **AMIE (진단 및 관리 추론):** 시뮬레이션 학습을 통해 1차 진료 의사 수준의 진단 정확도와 대화 품질을 확보한 기술로, 환자 이력과 임상 가이드라인을 바탕으로 후속 치료 계획을 수립합니다. * **PHA (개인화된 건강 통찰):** 웨어러블 기기의 데이터를 분석하여 수면 및 활동 패턴에 따른 맞춤형 건강 코칭을 제공하며, 환자의 일상적인 건강 맥락을 파악하는 역할을 합니다. * **Wayfinding AI (정보 탐색 지원):** 사용자가 온라인에서 건강 정보를 검색할 때 능동적인 가이드를 제공하여, 실질적인 건강 여정에 필요한 정확한 정보를 찾을 수 있도록 돕습니다. 이번 연구는 실험실 수준의 '가능성'을 증명하는 단계를 넘어, 대규모 임상 데이터를 통해 AI가 의료 시스템의 표준으로 자리 잡을 수 있는 근거를 마련한다는 점에서 큰 의의가 있습니다. 향후 이러한 엄격한 증거 기반 접근 방식은 의료 AI가 단순한 기술적 혁신을 넘어 환자 치료 결과(Outcome)를 실질적으로 개선하는 신뢰할 수 있는 도구로 인정받는 표준이 될 것으로 기대됩니다.

google원문

에이전트 시스템 확장의 과학 (새 탭에서 열림)

구글 리서치는 AI 에이전트 시스템 설계에 있어 '에이전트 수가 많을수록 좋다'는 기존의 통념을 깨고, 과업의 특성에 따라 최적의 아키텍처가 달라짐을 실증적으로 분석했습니다. 180가지 에이전트 설정에 대한 대규모 실험 결과, 병렬 처리가 가능한 과업에서는 멀티 에이전트가 성능을 크게 향상시키지만 순차적 추론이 필요한 과업에서는 오히려 성능을 저하시킨다는 점을 발견했습니다. 연구팀은 이러한 정량적 원칙을 바탕으로 새로운 과업에 대해 최적의 구조를 87% 확률로 예측하는 모델을 제시하며 '에이전트 스케일링의 과학'을 제안합니다. ## 에이전트 시스템의 5가지 핵심 아키텍처 연구팀은 에이전트의 확장 방식을 이해하기 위해 다음과 같은 다섯 가지 표준 아키텍처를 정의하고 비교했습니다. * **단일 에이전트 (SAS):** 혼자서 모든 추론과 행동 단계를 순차적으로 수행하며 단일 메모리 스트림을 유지합니다. * **독립형 (Independent):** 여러 에이전트가 통신 없이 병렬로 하위 작업을 수행한 뒤 최종 결과만 합산합니다. * **중앙 집중형 (Centralized):** 중앙 조정자(Orchestrator)가 작업을 할당하고 결과를 합성하는 '허브 앤 스포크' 모델입니다. * **분산형 (Decentralized):** 에이전트들이 직접 소통하며 정보를 공유하고 합의에 도달하는 P2P 방식입니다. * **하이브리드 (Hybrid):** 계층적 감독과 에이전트 간 직접 통신을 결합하여 유연성과 통제력의 균형을 맞춥니다. ## 과업 특성에 따른 성능 차이: 병렬성과 순차성 에이전트 시스템의 성능은 과업이 가진 본질적인 구조에 따라 극명하게 갈리는 것으로 나타났습니다. * **병렬 과업의 이점:** 금융 분석처럼 하위 작업 분해가 용이한 과업에서는 중앙 집중형 아키텍처가 단일 에이전트 대비 80.9%의 성능 향상을 기록했습니다. * **순차적 추론의 페널티:** 엄격한 순서가 필요한 계획 수립(PlanCraft) 과업에서는 멀티 에이전트 구조 도입 시 성능이 오히려 39~70% 급락했습니다. 이는 통신 비용이 추론에 필요한 '인지 예산'을 잠식하기 때문입니다. * **도구 사용의 병목 현상:** 사용하는 도구의 개수가 많아질수록 에이전트 간 조율에 드는 비용이 기하급수적으로 증가하는 '도구-조율 트레이드오프'가 발생합니다. ## 신뢰성 보장을 위한 아키텍처의 역할 실제 배포 상황에서 중요한 오류 확산 방지 측면에서도 아키텍처별 성능 차이가 뚜렷했습니다. * **오류 증폭 위험:** 에이전트 간 소통이 없는 독립형 시스템은 한 에이전트의 실수가 최종 결과에 미치는 악영향이 단일 에이전트보다 17.2배나 높았습니다. * **중앙 관리의 검증 효과:** 중앙 집중형 시스템은 조정자가 '검증 병목(Validation Bottleneck)' 역할을 수행하여 오류 증폭을 4.4배 수준으로 낮추며 가장 안정적인 결과를 보였습니다. ## 최적의 에이전트 설계를 위한 제언 연구팀은 과업의 도구 수와 분해 가능성 등 측정 가능한 속성을 통해 최적의 아키텍처를 결정할 수 있는 예측 모델을 개발했습니다. * 무조건 에이전트 수를 늘리기보다, 과업이 병렬 처리에 적합한지(금융 분석 등) 혹은 순차적 정확도가 중요한지(코딩, 계획 등)를 먼저 파악해야 합니다. * 시스템의 복잡도가 높아질수록 오류 확산을 막기 위해 중앙 조정자를 둔 계층적 구조를 채택하는 것이 안정성 측면에서 유리합니다. * 이 연구에서 제시된 예측 모델을 활용하면 새로운 도메인에서도 80% 이상의 정확도로 가장 효율적인 에이전트 구성을 사전에 선택할 수 있습니다.

google원문

ATLAS: 다국어 모델 (새 탭에서 열림)

ATLAS는 400개 이상의 언어를 포함한 대규모 실험을 통해 다국어 언어 모델의 성능과 효율성을 최적화하는 새로운 스케일링 법칙을 제시합니다. 이 연구는 특정 목표 언어의 성능을 극대화하기 위해 모델 크기, 학습 데이터 양, 그리고 언어 간의 혼합 비율을 어떻게 설정해야 하는지에 대한 구체적인 데이터 기반 지침을 제공합니다. 특히 다국어 학습 시 발생하는 성능 저하를 방지하기 위해 모델 용량과 데이터 규모를 확장하는 정량적 공식을 확립하여 실무적인 모델 구축 가이드를 제안합니다. ### ATLAS의 구성과 작동 원리 * 기존의 단일 언어 중심 스케일링 법칙을 확장하여, 복잡한 다국어 환경에서 목표 언어의 성능을 최적화하기 위한 모델 크기와 데이터 볼륨을 결정합니다. * 학습 데이터 소스를 목표 언어, 유사 언어 그룹(예: 카탈루냐어의 경우 스페인어, 이탈리아어 등), 그리고 나머지 전체 언어의 세 가지 범주로 분류하여 각 소스가 성능에 미치는 긍정적/부정적 영향을 분석합니다. * 다국어 환경에서 효율적으로 모델을 확장하기 위한 가이드와, 특정 언어를 위해 모델을 처음부터 사전 학습할지 혹은 기존 다국어 체크포인트에서 미세 조정을 할지 결정하는 규칙을 포함합니다. ### 교차 언어 전이 행렬과 시너지 분석 * 1,400개의 언어 쌍을 분석하여 특정 언어의 학습이 다른 언어의 성능 향상에 기여하는 정도를 수치화한 전이 행렬을 생성했습니다. * 분석 결과, 동일한 문자 체계(Script)나 언어 가족을 공유하는 언어들 사이에서 가장 강력한 긍정적 전이 효과가 나타났습니다 (p < .001). * 영어, 프랑스어, 스페인어는 웹 데이터의 높은 품질과 다양성 덕분에 대부분의 언어 학습에 도움을 주는 '보편적 조력자' 역할을 수행하며, 언어 간의 전이 효과는 항상 대칭적이지 않다는 점을 발견했습니다. ### '다국어의 저주' 극복을 위한 확장 규칙 * 지원하는 언어 수가 늘어날수록 모델 용량의 한계로 인해 개별 언어의 성능이 하락하는 '다국어의 저주(Curse of Multilinguality)' 현상을 정량적인 스케일링 법칙으로 정립했습니다. * 연구에 따르면 지원 언어 수를 2배로 늘릴 때 기존 성능을 유지하려면 모델 크기는 1.18배, 전체 데이터 양은 1.66배 증가시켜야 합니다. * 이 규칙을 따르면 개별 언어당 할당되는 데이터 비중이 줄어들더라도, 언어 간의 시너지 효과를 통해 모델 용량 제한에 따른 성능 저하를 상쇄할 수 있습니다. ### 사전 학습 vs 미세 조정의 전환점 * 특정 언어 모델 구축 시 처음부터 사전 학습을 할지, 아니면 다국어 모델을 미세 조정할지 결정하는 기준을 연산 자원(Compute) 투입량에 따라 제시합니다. * 가용 자원이 적은 초기 단계에서는 강력한 다국어 체크포인트를 활용한 미세 조정이 유리하지만, 학습량이 일정 수준을 넘어서면 처음부터 학습하는 방식이 성능상 우위를 점하게 됩니다. * 20억(2B) 파라미터 모델 기준, 이러한 역전 현상은 언어에 따라 약 1,440억에서 2,830억 토큰 사이에서 발생하는 것으로 나타났습니다. 실무적으로 다국어 모델을 구축할 때는 ATLAS의 전이 행렬을 참고하여 목표 언어와 시너지가 큰 언어들을 우선적으로 혼합하고, 지원 언어 수 증가에 맞춰 제시된 비율(모델 1.18배, 데이터 1.66배)로 자원을 확장하는 것이 가장 효율적입니다.

google원문

]" or "[Name] 소개: (새 탭에서 열림)

Google Research가 발표한 GIST(Greedy Independent Set Thresholding) 알고리즘은 거대 데이터셋에서 데이터의 다양성과 효용성을 동시에 극대화하는 혁신적인 샘플링 기술입니다. 이 알고리즘은 수학적으로 증명 가능한 성능 보장을 제공하며, 이미지 분류와 같은 기계 학습 작업에서 기존의 최첨단 벤치마크 모델들을 능가하는 효율적인 데이터 부분 집합 선택을 가능하게 합니다. 이를 통해 모델 학습에 필요한 컴퓨팅 자원을 획기적으로 줄이면서도 모델의 정확도를 유지할 수 있는 최적의 데이터 구성이 가능해졌습니다. ### 데이터 다양성과 효용성의 충돌 데이터 샘플링 과정에서는 중복을 피하는 '다양성'과 정보의 가치를 높이는 '효용성'이라는 두 가지 상충하는 목표를 균형 있게 달성해야 합니다. * **다양성(Diversity):** 데이터 포인트 간의 최소 거리를 최대화(Max-min diversity)하여 중복을 제거하고 데이터의 전체적인 분포를 포괄하는 것을 목표로 합니다. * **효용성(Utility):** 단조 부차함수(Monotone submodular functions)를 기반으로, 선택된 데이터셋이 가진 고유 정보의 총합을 극대화하는 것입니다. * **복잡성:** 다양성만 추구하면 관련 없는 데이터가 섞일 수 있고, 효용성만 따지면 유사한 고가치 데이터가 밀집되는 문제가 발생하며, 이 둘을 동시에 최적화하는 것은 NP-난해(NP-hard) 문제로 알려져 있습니다. ### GIST의 작동 원리와 알고리즘 단계 GIST는 복잡한 최적화 문제를 해결하기 위해 거리 임계값(Threshold)을 설정하고 이를 기반으로 독립 집합(Independent Set)을 근사화하는 방식을 취합니다. * **거리 임계값 설정:** 특정 최소 거리를 기준으로 그보다 가까운 데이터 포인트들을 그래프로 연결합니다. 이 연결된 포인트들은 서로 너무 유사하여 동시에 선택될 수 없는 '갈등' 관계로 간주됩니다. * **최대 독립 집합 문제 해결:** 연결된 포인트(중복 데이터)를 피하면서 전체 효용성을 극대화하는 '최대 독립 집합' 문제를 해결합니다. 이는 전산학에서 매우 어려운 문제이므로 GIST는 이를 효율적으로 풀기 위한 근사 기법을 사용합니다. * **이중 기준 그리디(Bicriteria Greedy) 알고리즘:** 다양한 거리 임계값을 체계적으로 테스트하며, 각 단계에서 이미 선택된 데이터와 일정 거리를 유지하면서도 가장 가치가 높은 데이터를 선택하여 최적의 '스위트 스폿'을 찾아냅니다. ### 기술적 성과 및 이론적 보장 GIST는 이론적 성능 보장과 실제 적용 결과 모두에서 기존 방식들을 압도하는 성과를 보여주었습니다. * **수학적 보장:** GIST는 이론적 최적해의 최소 50% 이상의 가치를 보장하는 최초의 알고리즘입니다. 연구진은 최적값의 56% 이상을 찾는 것이 수학적으로 불가능함을 증명함으로써 GIST가 이론적 한계치에 근접했음을 입증했습니다. * **실전 벤치마크 결과:** 무작위 추출(Random), 모델 불확실성 기반 추출(Margin), 기하학적 커버리지 중심의 k-center 방식보다 높은 성능을 기록했습니다. * **범용성:** 이미지 분류 등 다양한 ML 애플리케이션에서 데이터 중복은 줄이고 유용한 정보량은 극대화하는 안전장치(Safety net) 역할을 수행합니다. 방대한 데이터를 다루는 LLM이나 고해상도 비전 모델의 학습 비용을 절감하고자 하는 연구자와 개발자에게 GIST는 매우 유용한 도구입니다. 특히 데이터의 중복성이 높거나 학습 자원이 제한된 환경에서 수학적으로 검증된 샘플링 전략을 통해 효율적인 모델 학습 파이프라인을 구축할 것을 권장합니다.

google원문

작은 모델, 큰 결과 (새 탭에서 열림)

구글 연구진은 대규모 멀티모달 모델(LLM) 대신 소형 모델을 사용하여 사용자의 UI 상호작용 의도를 효과적으로 추출하는 '분해(Decomposition)' 접근 방식을 제안했습니다. 이 방법은 전체 과정을 각 화면별 요약과 최종 의도 추출이라는 두 단계로 나누어 처리함으로써, 개인정보 보호와 비용 효율성이 중요한 온디바이스(On-device) 환경에서도 대형 모델인 Gemini Pro에 비견되는 높은 성능을 기록했습니다. 결과적으로 복잡한 추론 과정을 세분화하는 것만으로도 소형 모델의 한계를 극복하고 정교한 사용자 의도 파악이 가능함을 증명했습니다. ### 단계별 분해를 통한 의도 추출 워크플로우 * **1단계: 개별 화면 요약:** 사용자의 상호작용이 일어나는 각 화면을 소형 멀티모달 모델이 독립적으로 요약합니다. 이때 현재 화면을 중심으로 이전과 다음 화면을 포함한 3개의 화면(Sliding Window)을 참조합니다. * **요약의 구성 요소:** 모델은 "관련된 화면 컨텍스트는 무엇인가?", "사용자가 방금 수행한 작업은 무엇인가?", "이 상호작용을 통해 사용자가 달성하려는 목적은 무엇인가?(추측)"라는 세 가지 핵심 질문에 답하며 요약을 생성합니다. * **2단계: 요약본 기반 의도 추출:** 1단계에서 생성된 시계열 요약 데이터들을 입력값으로 하여, 파인튜닝된 소형 모델이 최종적으로 사용자의 전체 의도를 한 문장으로 추출합니다. ### 소형 모델의 성능 극대화 기술 * **레이블 정제(Label Preparation):** 학습 데이터의 의도 문장에 요약본에 없는 세부 정보가 포함되어 있으면 모델이 환각(Hallucination)을 일으킬 수 있습니다. 이를 방지하기 위해 요약본에 포함되지 않은 정보는 학습용 레이블에서 미리 제거하는 과정을 거칩니다. * **추측 데이터의 전략적 제거:** 1단계에서 생성한 '사용자 목적에 대한 추측' 데이터는 1단계 요약의 품질은 높여주지만, 2단계 의도 추출 시에는 오히려 혼란을 줄 수 있습니다. 따라서 최종 의도 추출 단계에서는 이 추측 부분만 제외하고 실제 행동 요약만 활용하는 것이 성능 향상에 도움이 됨을 확인했습니다. * **자동화 데이터셋 활용:** 고품질의 의도 문장 예시를 학습시키기 위해, 의도와 행동 시퀀스가 잘 매칭된 공개 자동화 데이터셋을 활용하여 모델을 파인튜닝했습니다. ### Bi-Fact 기반의 정밀한 성능 평가 * **원자적 사실(Atomic Facts) 분해:** 모델이 예측한 의도와 실제 정답(Reference) 의도를 더 이상 쪼갤 수 없는 최소 단위인 '원자적 사실'들로 분해합니다. (예: "런던행 편도 항공권" -> "런던행 항공권", "편도 여정"으로 분해) * **정밀도와 재현율 측정:** 분해된 사실들을 바탕으로 모델이 예측한 사실 중 정답이 얼마나 있는지(Precision), 그리고 정답 중 모델이 얼마나 맞췄는지(Recall)를 계산하여 F1 점수를 산출합니다. * **단계별 오류 추적:** 이 평가 방식을 통해 요약 단계에서 정보가 누락되었는지, 아니면 추출 단계에서 환각이 발생했는지를 정교하게 추적하여 시스템을 개선했습니다. ### 실험 결과 및 성과 * **대형 모델 수준의 성능:** 분해 전략을 적용한 Gemini 1.5 Flash 8B 모델은 훨씬 거대한 모델인 Gemini 1.5 Pro와 대등한 수준의 F1 점수를 기록했습니다. * **기존 기법 대비 우위:** 단순한 Chain-of-Thought(CoT) 프롬프팅이나 엔드투엔드(E2E) 파인튜닝 방식보다 모바일 및 웹 환경 모두에서 일관되게 뛰어난 성능을 보였습니다. * **실용적 가치:** 저비용·고속 처리가 가능한 소형 모델로도 복잡한 UI 궤적을 이해할 수 있게 됨에 따라, 향후 모바일 기기 내에서 개인정보 노출 없이 실시간으로 사용자를 돕는 지능형 비서 기능의 핵심 기술로 활용될 전망입니다.

google원문

건강 인사이트의 발견 (새 탭에서 열림)

구글 연구팀은 대규모 검증 연구를 통해 스마트워치가 보행 지표를 정밀하게 추정할 수 있는 매우 신뢰할 수 있는 플랫폼임을 입증했습니다. 이 연구는 기존의 고가 실험 장비나 스마트폰 위치의 제약에서 벗어나, 손목 위 기기만으로 보행 속도와 보폭 등 복합적인 시공간적 보행 지표를 연속적으로 모니터링할 수 있는 기술적 기반을 마련했습니다. 결과적으로 스마트워치는 스마트폰과 대등한 수준의 정확도를 보여주며 비침습적인 건강 관리 및 질병 모니터링 도구로서의 가능성을 확인했습니다. **손목 데이터를 위한 딥러닝 모델 설계** * **다중 출력 TCN 모델:** 기존 연구들이 시점 추정 후 계산 과정을 거치는 것과 달리, 시계열 컨볼루션 네트워크(TCN) 기반의 다중 출력(Multi-head) 모델을 사용하여 모든 보행 지표를 직접 추정합니다. * **입력 데이터 및 전처리:** 사용자의 키(신장) 정보와 픽셀 워치에서 수집한 50Hz 샘플링 속도의 3축 가속도계 및 3축 자이로스코프(IMU) 신호를 결합하여 입력값으로 사용합니다. * **추정 지표:** 보행 속도(Gait speed), 양발 지지 시간(Double support time)과 같은 양측성 지표와 보폭(Step length), 유각기 시간(Swing time), 입각기 시간(Stance time) 등 좌우 각각의 단측성 지표를 동시에 산출합니다. * **오차 최적화:** 서로 다른 단위를 가진 다양한 지표들의 상대적 정확도를 높이기 위해 평균 절대 백분율 오차(MAPE)를 손실 함수로 사용하여 모델을 최적화했습니다. **대규모 임상 연구 및 엄격한 검증** * **방대한 데이터셋:** 미국과 일본의 246명 참여자로부터 수집한 약 7만 개의 보행 세그먼트를 활용해 모델의 성능을 검증했습니다. * **기준 장비(Ground Truth):** 실험실 등급의 보행 분석 시스템인 'Zeno Gait Walkway'를 기준점으로 삼아 스마트워치 추정값의 정확도를 비교했습니다. * **다양한 보행 시나리오:** 6분 걷기 테스트, 빠른 걸음뿐만 아니라 무릎 보조기를 착용하여 인위적으로 비대칭 보행을 유도하는 등 실제 환경에서 발생할 수 있는 다양한 보행 패턴을 포함했습니다. * **교차 검증:** 데이터 누수를 방지하기 위해 특정 참가자의 데이터가 훈련과 테스트에 동시에 포함되지 않도록 5-겹 교차 검증(5-fold cross-validation) 전략을 채택했습니다. **주요 연구 결과 및 성능 분석** * **높은 신뢰도 및 타당성:** 보행 속도, 보폭, 유각기/입각기 시간 등 주요 지표에서 피어슨 상관계수(r)와 내적 상관계수(ICC) 모두 0.80 이상의 우수한 수치를 기록했습니다. * **스마트폰과의 성능 비교:** 스마트폰을 앞뒤 주머니에 넣었을 때의 결과와 비교했을 때, 모든 보행 지표에서 통계적으로 유의미한 차이가 없음을 확인했습니다(p > 0.05). * **양발 지지 시간 측정:** 추적이 까다로운 양발 지지 시간 지표에서도 0.56~0.60의 수용 가능한 신뢰도를 보이며, 손목 기기만으로도 복합적인 보행 분석이 가능함을 보여주었습니다. 이 연구 결과는 스마트워치가 신경계 질환이나 근골격계 상태의 진행 상황을 모니터링하는 데 있어 스마트폰보다 더 실용적이고 일관된 플랫폼이 될 수 있음을 시사합니다. 일상적인 활동 중에도 정확한 보행 데이터를 수집할 수 있으므로, 의료진과 사용자는 임상 방문 사이의 공백 기간 동안 발생하는 건강 변화를 더욱 정밀하게 파악할 수 있을 것입니다.

google원문

동적 표면 코드, 양자 (새 탭에서 열림)

구글 퀀텀 AI(Google Quantum AI) 연구팀은 기존의 정적 방식에서 벗어나 회로 구조를 유연하게 변경하는 '동적 표면 코드(Dynamic Surface Codes)'를 성공적으로 시연했습니다. 이 방식은 더 적은 수의 커플러를 사용하면서도 리크(leakage)와 같은 상관 오류를 효과적으로 억제하며, 다양한 종류의 양자 게이트를 활용할 수 있는 유연성을 제공합니다. 이번 연구 결과는 하드웨어 설계의 복잡성을 낮추면서도 논리적 큐비트의 안정성을 비약적으로 높일 수 있음을 입증하여 실용적인 양자 컴퓨팅 구현을 위한 새로운 경로를 제시했습니다. **동적 표면 코드와 시공간적 감지 영역의 변화** * 양자 오류 정정(QEC)은 물리적 오류가 논리적 정보에 영향을 주지 않도록 오류를 '감지 영역(detecting region)' 안에 국소화하는 것이 핵심입니다. * 기존의 정적 회로는 매 사이클마다 동일한 물리적 연산과 타일링 구조를 반복하지만, 동적 회로는 매 사이클마다 감지 영역의 타일링 형상을 동적으로 변경합니다. * 이러한 유연성은 특정 큐비트나 커플러가 작동하지 않는 '드롭아웃(dropout)' 상황을 우회하게 해주며, 하드웨어 제약 조건 속에서도 최적의 오류 정정 성능을 유지하게 합니다. **육각형 격자 구조를 통한 하드웨어 설계 최적화** * 기존 사각형 격자 구조는 큐비트당 4개의 커플러가 필요하지만, 동적 회로를 적용하면 큐비트당 3개의 커플러만 사용하는 육각형 격자에서도 QEC를 수행할 수 있습니다. * 구글의 윌로우(Willow) 프로세서에서 실험한 결과, 육각형 코드는 기존 정적 회로와 대등한 수준의 오류 억제 성능(코드 거리 3에서 5로 확장 시 오류율 2.15배 개선)을 보여주었습니다. * 커플러 수를 줄이면 칩 제조 및 제어 복잡도가 낮아지며, 시뮬레이션상으로는 최적화 알고리즘의 효율성이 높아져 오류 억제 인자가 약 15% 향상되는 효과를 거둘 수 있습니다. **리크 오류 억제를 위한 '워킹' 회로와 iSWAP 게이트 활용** * 측정 큐비트의 위치를 매 사이클마다 이동시키는 '워킹(walking)' 방식을 도입하여, 계산 공간을 벗어나는 리크 현상과 상관 오류가 누적되는 것을 방지했습니다. * 표준적인 CZ 게이트 외에도 iSWAP과 같은 비표준적 2-큐비트 얽힘 게이트를 사용하는 동적 회로를 시연함으로써 하드웨어 특성에 맞는 다양한 게이트 선택권을 확보했습니다. * 이러한 기법들은 물리적 큐비트의 결함을 보완하고, 더 정교한 오류 정정 아키텍처를 설계할 수 있는 기술적 토대가 됩니다. 동적 표면 코드는 고정된 하드웨어 구조에 소프트웨어를 맞추는 것이 아니라, 오류 정정 알고리즘에 맞춰 하드웨어 운용 방식을 유연하게 최적화할 수 있음을 보여줍니다. 특히 육각형 격자 구조의 채택은 칩의 배선 복잡도를 획기적으로 줄여주므로, 향후 수천 개 이상의 큐비트를 포함하는 대규모 양자 프로세서를 설계할 때 핵심적인 전략이 될 것으로 권장됩니다.