self-supervised-learning

4 개의 포스트

meta4분 읽기큐레이션 요약

메타 광고 딥 퍼널 최적화를 위한 계층적 관심사 표현 탐구

Hierarchical Interest Representation은 사용자와 광고주·제품·서비스를 하나의 그래프로 연결하고, 이들의 잠재적 관심사를 여러 수준의 임베딩으로 학습하는 Meta Ads의 상위 표현 계층이다. 희소한 광고 참여 신호에 텍스트·이미지·영상 기반의 세계 지식을 결합해, 사용자의 잠재 관심과 광고주의 상품을 연결하고 딥 퍼널 광고 성과를 높이는 것이 목표다. 수십억 건의 상호작용을 이용해 학습한 범용 임베딩과 관심 토큰은 검색, 개인화, 추천, 감독 신호, 랭킹 모델 전반에 활용될 수 있다. ## 딥 퍼널 광고 최적화를 위한 표현 계층 - 사용자가 스크롤, 클릭, 반응, 구매 등으로 표현한 선호를 바탕으로 명시적·암묵적 관심사를 추론한다. - 광고주가 제공하는 상품·서비스와 사용자의 잠재 관심을 연결해, 단순 노출이나 클릭을 넘어 전환 등 딥 퍼널 목표를 최적화한다. - Meta의 Generative Ads Model(GEM), Andromeda, Adaptive Ranking Model 등 광고 추천 생태계의 여러 단계에서 사용할 수 있는 상위 표현 계층을 지향한다. - 대규모 참여 데이터에서 안정적인 관심 앵커를 추출해, 사용자가 아직 직접 반응하지 않은 광고의 발견 가능성도 높인다. ## 광고 생태계를 그래프로 모델링 - 사용자, 광고주, 제품, 서비스, 캠페인 등을 그래프의 노드로 표현한다. - 노드 사이의 노출, 클릭, 참여, 구매 등의 활동과 이벤트는 엣지가 된다. - Meta의 광고 네트워크는 매월 수백만 광고주와 수백만 개 광고가 수십억 명의 사용자에게 제공되는 초대형 그래프다. - 사용자와 특정 광고 사이의 직접적인 딥 퍼널 신호는 희소하기 때문에, 그래프에서 멀리 떨어진 연결과 공통 패턴을 함께 학습해야 한다. ## 희소한 신호와 동적인 관심사 - 사용자는 ‘관심 있음/관심 없음’ 같은 직접 피드백뿐 아니라 광고 참여 행동으로도 관심을 표현한다. - 광고 노출 기회와 전환 피드백은 광고·상품의 전체 규모에 비해 제한적이다. - 개별 사용자와 광고의 연결만 보면 데이터가 부족하므로, 관련 사용자·상품·광고주 사이의 장거리 관계를 활용해야 한다. - 대규모 그래프에서 장거리 관계를 계산하려면 메모리 효율적인 어텐션 커널과 고성능 학습 알고리즘이 필요하다. ## 차원 축소와 관심 원시 단위 - 원시 광고 그래프를 학습된 잠재 관심 단위인 ‘슈퍼 노드’ 중심의 슈퍼 그래프로 변환한다. - 원래는 희소했던 사용자-광고 연결을 공통 관심 원시 단위로 묶어 더 조밀한 관계로 만든다. - 관심 원시 단위의 어휘는 개별 광고보다 안정적이고 정적이므로, 광고 비즈니스와 상품 구성이 바뀌어도 재사용하기 쉽다. - 이를 통해 개별 광고에 대한 충분한 이력이 없는 사용자나 상품에도 일반화할 수 있다. ## 멀티모달 지식 보강 - 광고주와 제품의 페이지 메타데이터, 카탈로그 속성, 텍스트, 이미지, 영상 정보를 활용한다. - 언어 모델과 비전 모델로 콘텐츠를 처리해, 사용자가 해당 상품과 어떻게 상호작용했는지뿐 아니라 상품 자체가 무엇인지도 표현한다. - 참여 데이터가 부족한 희귀하거나 새롭게 등장한 광고주·제품에 대해서도 의미적 유사성을 바탕으로 추론할 수 있다. - 실제 세계의 지식과 행동 기반 신호를 결합해 콜드스타트와 신호 부족 문제를 완화한다. ## 통합 관계 임베딩 - 사용자, 광고주, 제품, 서비스와 잠재 관심 원시 단위를 하나의 거리 기반 공간에 배치한다. - 임베딩 간 거리를 이용해 다음 관계를 추정할 수 있다. - 사용자와 관심 원시 단위의 근접성 - 광고·광고주가 어떤 관심사를 제공하는지 - 관심 원시 단위끼리의 유사성 - 유사한 사용자, 광고, 제품의 이웃 관계 - 서로 다른 유형의 엔터티 간 친화도 - 동일한 표현 공간을 사용하므로 사용자 관심과 광고 상품의 의미적 연결을 직접 계산할 수 있다. ## 여러 계층의 관심 표현 - 상위 계층은 여행·스포츠·패션처럼 안정적이고 넓은 관심사를 표현한다. - 하위 계층은 특정 브랜드, 세부 상품, 구매 의도처럼 희소하지만 정밀한 관심사를 표현한다. - 조밀하고 안정적인 관계는 더 거친 계층으로, 드물고 구체적인 관계는 더 세밀한 계층으로 표현한다. - 여러 계층을 연쇄적으로 학습하면 검색·개인화에는 넓은 관심 표현을, 최종 랭킹에는 구체적인 의도 표현을 선택적으로 사용할 수 있다. ## 트랜스포머 기반 그래프 학습 - LLM에서 영감을 받은 트랜스포머 구조를 대규모 광고 그래프에 적용한다. - 희소 어텐션을 사용해 모든 노드 간 연결을 계산하지 않고도 장거리 그래프 관계를 포착한다. - 편향을 고려한 어텐션과 자기지도 방식의 교차 뷰 지식 증류를 활용해 여러 관점의 그래프 정보를 통합한다. - 사용자 행동의 시간적 변화와 광고주·제품 콘텐츠의 의미 정보를 함께 학습한다. - 전체 시스템은 실제 Meta 광고 데이터의 수십억 건 상호작용으로 엔드투엔드 학습된다. ## 범용 임베딩과 Bag-of-Meaning 토큰 - 광고 생태계의 사용자·광고주·제품·서비스에 대한 범용 임베딩을 생성한다. - 여러 의미 단위로 구성된 ‘Bag-of-Meaning’ 관심 토큰은 사용자의 관심과 광고의 의미를 공통 어휘로 표현한다. - 이 결과는 다음 용도로 확장될 수 있다. - 광고 및 상품 검색·후보 생성 - 개인화 추천 - 랭킹 모델의 입력 특성 - 학습을 위한 감독 신호 - 특정 도메인에 최적화된 전문 랭킹 아키텍처 실용적으로는 직접적인 전환 데이터가 부족한 광고·상품을 다뤄야 하거나, 신규 엔터티와 장기적인 관심 관계를 포착해야 하는 시스템에 특히 유용하다. 다만 범용 임베딩을 실제 광고 순위에 적용할 때는 최신성, 사용자 프라이버시, 관심사 편향, 계층별 표현의 검증을 함께 관리해야 한다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

SensorFM: 웨어러블 헬스 데이터를 위한 범용 지능과 인터페이스를 향하여

SensorFM은 500만 명의 웨어러블 사용자에게서 수집한 1조 분 이상의 센서 데이터를 학습한 대규모 웨어러블 건강 파운데이션 모델이다. 라벨이 거의 없는 현실 데이터를 자기지도학습으로 처리해 심혈관·대사·수면·정신건강 등 35개 과제에 전이 가능한 생리학 표현을 학습한다. 데이터와 모델 규모를 함께 키울수록 성능이 계속 향상됐으며, 적은 라벨만으로도 새로운 건강 예측 과제에 적용할 수 있음을 보였다. ## 웨어러블 건강 데이터가 가진 가능성과 한계 - 심박수, 움직임, 피부 온도, 혈중산소, 수면 등 웨어러블 데이터는 예방적·개인화 건강관리의 중요한 기반이다. - 사람마다 기본 생리 상태와 생활습관이 달라 같은 신호도 개인별 의미가 다를 수 있다. - 확진 진단, 검사 결과, 검증된 설문 같은 학습 라벨은 수집 비용이 높고 과거 데이터에 retrospectively 적용하기 어렵다. - 기존 모델은 특정 질환이나 결과 하나씩을 대상으로 설계돼 다른 건강 영역으로 일반화하기 어려웠다. ## 1조 분 분량의 다중 센서 사전학습 - 데이터는 2024년 9월부터 2025년 9월 사이 수집된 비식별화 데이터다. - 연구 활용에 동의한 500만 명의 참여자가 포함됐으며, 100개 이상 국가와 미국 50개 주, Fitbit·Pixel Watch 20개 이상 모델을 포괄한다. - 각 참여자에게서 수 주간의 데이터를 추출해 총 20억 시간, 1조 분 이상의 분 단위 신호를 구성했다. - 5개 센서 모달리티에서 도출한 34개 1분 집계 특성을 사용한다. - PPG: 심박수, 심박변이도, 혈중산소포화도 - 가속도계: 움직임과 걸음 수 - 피부전기활동(EDA): 피부 전도도 - 피부 온도 - 고도계: 활동 및 환경 변화 정보 - 데이터는 하루 24시간의 생리·행동 흐름을 표현한다. ## 결측 데이터를 활용하는 자기지도학습 - SensorFM은 정답 라벨 대신 마스킹된 센서 신호를 복원하는 방식으로 학습한다. - 웨어러블 데이터에는 센서 전원 주기, 기기 탈착, 절전 모드, 센서 비활성화 등으로 인한 결측과 단절이 일상적으로 발생한다. - 일반적인 자기지도학습은 이런 구간을 인위적으로 보간하거나 불완전한 구간을 버리지만, 두 방식 모두 편향을 만들거나 데이터를 낭비할 수 있다. - SensorFM의 AIM(Adaptive and Inherited Masking) 방식은 실제 결측 구간과 학습을 위해 인위적으로 가린 구간을 동일하게 취급한다. - 따라서 모델은 결측을 단순한 오류가 아니라 센서 데이터의 자연스러운 특성으로 학습하며, 불완전한 기록에서도 유용한 표현을 생성한다. ## 모델과 데이터 규모를 함께 확장한 효과 - 사전학습 데이터는 약 200만 시간부터 20억 시간까지, 모델은 10만 개부터 1억 개 파라미터까지 네 자릿수 범위로 실험했다. - 데이터와 모델 용량이 증가할수록 복원 손실과 실제 건강 과제 성능이 예측 가능하게 개선됐다. - 전체 데이터로 학습한 최대 모델 SensorFM-B는 가장 작은 모델보다: - 복원 손실 31% 감소 - 분류 과제 평균 AUC 9% 향상 - 회귀 과제 평균 피어슨 상관계수 21% 향상 - 데이터만 또는 모델 크기만 키우는 것보다 두 요소를 함께 확장할 때 가장 큰 효과가 나타났다. - 최대 모델은 35개 과제 중 33개에서 가장 높은 성능을 기록했으며, 성능 포화 징후도 나타나지 않았다. ## 하나의 표현으로 여러 건강 영역에 전이 - 3개 독립적이고 기관생명윤리위원회(IRB) 승인을 받은 전향적 연구에서 총 13,985명의 데이터를 활용했다. - 평가 과제는 다음 6개 영역의 35개 분류·예측 문제로 구성됐다. - 심혈관 건강 - 대사 위험 - 정신건강 - 수면 - 인구통계 - 생활습관 - SensorFM 인코더를 고정하고 그 위에 간단한 선형 헤드만 학습하는 방식으로 성능을 측정했다. - 센서에서 직접 설계한 특징을 이용한 지도학습 기준선보다 35개 중 34개 과제에서 우수했다. - 나이·성별 같은 인구통계 정보를 추가하면 성능이 소폭 상승했지만, 모델이 커질수록 추가 효과는 감소했다. - 이는 대형 모델이 사전학습만으로도 생리학적으로 의미 있는 개인 특성을 어느 정도 학습한다는 점을 시사한다. - 우울증과 불안처럼 센서 신호가 약하고 개인차가 큰 상태에서도 규모 확장의 효과가 특히 컸다. - 라벨 데이터가 일부만 있어도 인구통계 기반이나 수작업 특징 기반 모델을 빠르게 넘어섰다. ## 예측 헤드 구축을 자동화하는 에이전트 구조 - 범용 임베딩을 실제 예측 시스템에 적용하려면 과제별 특징 설계, 모델 구조 선택, 하이퍼파라미터 조정이 필요하다. - 연구진은 이 과정을 자동화하기 위해 여러 LLM 에이전트가 협력하고 경쟁하는 ‘교실(classroom)’ 구조를 만들었다. - 이 구조는 새로운 건강 예측 엔드포인트마다 수작업으로 예측 헤드를 설계해야 하는 부담을 줄이는 것을 목표로 한다. - 제공된 글은 해당 에이전트 시스템의 소개 도중 끝나므로, 구체적인 구성과 성능 수치는 본문만으로 확인할 수 없다. SensorFM의 실용적 의미는 웨어러블 데이터를 질환별 개별 모델이 아니라 재사용 가능한 공통 생리학 표현으로 다룬다는 데 있다. 다만 실제 의료 적용에는 데이터 편향, 개인정보 보호, 임상적 검증, 예측 결과의 해석 가능성에 대한 추가 평가가 필요하므로, 연구 성능을 곧바로 진단 도구로 간주해서는 안 된다.

원문 읽기(새 탭에서 열림)
google원문

현대 세계 매핑하기: S2Vec이 우리 도시의 언어를 학습하는 방법 (새 탭에서 열림)

Google Research가 발표한 S2Vec은 도로, 건물, 인프라와 같은 인위적 환경(Built Environment)의 복잡한 데이터를 범용적인 임베딩으로 변환하는 자기지도 학습(Self-supervised) 프레임워크입니다. 이 모델은 지리 공간 데이터를 컴퓨터 비전 모델이 이해할 수 있는 래스터(Raster) 이미지 형태로 변환하고 마스크 오토인코딩(MAE) 기법을 적용하여, 수동 레이블링 없이도 전 세계의 사회경제적 및 환경적 패턴을 정밀하게 예측합니다. 결과적으로 S2Vec은 미학습 지역에 대한 지리적 적응력에서 뛰어난 성능을 보이며, 위성 이미지 데이터와 결합했을 때 더욱 강력한 지리 공간 지능을 제공합니다. ### 지리 공간 데이터의 래스터화와 S2 기하학 활용 * **데이터 구조화의 어려움 해결:** 도시 블록은 수백 개의 데이터 포인트를 갖는 반면 농촌은 거의 없는 등 데이터의 밀도 편차가 크다는 문제를 해결하기 위해 S2 Geometry 라이브러리를 사용합니다. * **계층적 셀 분할:** 지구 표면을 계층적인 셀로 나누어 국가 단위부터 수 평방미터 단위까지 다양한 해상도로 데이터를 효율적으로 조회하고 관리합니다. * **특징 래스터화(Feature Rasterization):** 각 S2 셀 내의 건물이나 도로 유형을 계산하여 다층 이미지 형태로 재구성합니다. 예를 들어 특정 셀의 커피숍과 공원 수를 이미지의 '색상' 채널처럼 처리함으로써 성숙한 컴퓨터 비전 기술을 지리 데이터 분석에 그대로 적용할 수 있게 합니다. ### 마스크 오토인코딩(MAE)을 통한 자기지도 학습 * **레이블링 병목 현상 제거:** 전 지구적 데이터를 수동으로 태깅하는 것은 불가능하므로, 데이터의 일부를 가리고(Masking) 주변 맥락을 통해 이를 재구성하도록 학습시키는 MAE 기법을 도입했습니다. * **문맥 논리 학습:** 고층 아파트와 지하철역이 있는 곳에는 식료품점이 있을 가능성이 높다는 식의 도시 구성 요소 간 상관관계를 모델 스스로 파악합니다. * **범용 임베딩 생성:** 수백만 번의 학습 과정을 통해 특정 위치의 고유한 특성을 수학적 수치(임베딩)로 압축하며, 이는 별도의 추가 학습 없이도 다양한 분석 작업에 활용될 수 있습니다. ### 사회경제적 예측 성능 및 다중 모달 융합 * **우수한 지리적 적응성(Extrapolation):** 학습 데이터에 포함되지 않은 새로운 지역의 인구 밀도나 가구 소득 중앙값을 예측하는 제로샷(Zero-shot) 과제에서 기존 이미지 기반 모델들보다 뛰어난 성능을 입증했습니다. * **다중 모달 융합(Multimodal Fusion):** S2Vec의 인위적 환경 데이터와 위성 이미지 임베딩(RS-MaMMUT 등)을 결합했을 때 가장 높은 성능을 기록했습니다. * **환경 지표의 한계:** 탄소 배출량 예측에는 효과적이었으나, 수목 피복도(Tree cover)나 고도와 같은 자연 환경 요소 예측에는 건물 수 중심의 데이터만으로는 한계가 있어 위성 이미지와의 결합이 필수적임을 확인했습니다. S2Vec은 지리 공간 AI가 수동으로 제작된 니치 모델에서 벗어나 확장 가능한 파운데이션 모델로 나아가는 중요한 단계입니다. 도시 계획가나 연구자들은 이 임베딩을 활용해 인프라 변화가 지역 사회의 보건이나 경제에 미치는 영향을 전 지구적 규모에서 더욱 정확하게 분석할 수 있을 것으로 기대됩니다. 구체적인 환경 분석이 필요한 경우, S2Vec 단독 사용보다는 위성 이미지 모델과 결합하여 데이터의 상호보완성을 극대화하는 방식을 추천합니다.

google원문

LSM-2: 불 (새 탭에서 열림)

Google Research는 실제 환경의 웨어러블 센서 데이터에서 빈번하게 발생하는 데이터 공백(missingness) 문제를 해결하기 위해 LSM-2(Large Sensor Model-2)를 공개했습니다. 이 모델은 데이터가 불완전하더라도 이를 억지로 채우거나 삭제하지 않고, '적응형 상속 마스킹(AIM)' 기법을 통해 데이터의 결손 자체를 자연스러운 특징으로 학습합니다. 그 결과, LSM-2는 대규모 데이터셋을 바탕으로 분류, 회귀, 생성 등 다양한 건강 관련 태스크에서 기존의 보간(imputation) 방식보다 뛰어난 성능과 견고함을 입증했습니다. **웨어러블 데이터의 결손 문제와 한계** * 충전, 기기 미착용, 움직임에 의한 노이즈, 배터리 절약 모드 등으로 인해 실제 웨어러블 센서 데이터에는 필연적으로 공백이 발생합니다. * 연구팀이 분석한 160만 개의 일일 데이터 창 중에서 결손율이 0%인 샘플은 단 하나도 없었을 정도로 데이터의 불완전성은 보편적인 문제입니다. * 기존의 자가 지도 학습(SSL)은 완벽한 데이터를 가정하며, 결손이 있을 경우 데이터를 임의로 채우는 보간법을 쓰거나 불완전한 샘플을 삭제해 버리는데, 이는 데이터 편향을 초래하거나 귀중한 정보를 손실하는 결과를 낳습니다. **AIM(Adaptive and Inherited Masking) 프레임워크** * AIM은 결손된 데이터를 오류로 처리하는 대신, 이를 데이터의 고유한 속성으로 간주하고 직접 학습하는 새로운 자가 지도 학습 방식입니다. * 마스킹 방식은 데이터에 원래 존재하는 공백인 '상속된 마스크(Inherited Mask)'와 학습을 위해 의도적으로 가린 '인공적 마스크(Artificial Mask)'를 결합하여 구성됩니다. * **토큰 드롭아웃(Token Drop-out):** 계산 효율성을 위해 고정된 비율의 마스킹된 토큰을 인코더 처리 과정에서 제외합니다. * **어텐션 마스킹(Attention Masking):** 고정된 비율을 초과하여 발생하는 가변적인 데이터 공백은 트랜스포머 블록 내에서 어텐션 마스킹을 통해 유연하게 처리합니다. **LSM-2의 학습 및 성능 지표** * 약 6만 명 이상의 참가자로부터 수집한 4,000만 시간 분량의 익명화된 웨어러블 데이터(Fitbit 및 Pixel Watch)를 사용하여 LSM-2를 사전 학습했습니다. * LSM-2는 심박수 신호, 수면 패턴, 활동량 등 다중 모드(multimodal) 데이터를 통합적으로 이해하며, 이전 모델인 LSM-1보다 향상된 성능을 보여줍니다. * 특히 센서가 일시적으로 작동하지 않거나 특정 시간대 데이터가 통째로 누락된 상황에서도, 보간법을 사용한 모델들에 비해 성능 저하가 훨씬 적고 견고한 예측력을 유지합니다. **실용적인 결론 및 추천** 현실 세계의 웨어러블 기기 데이터를 다루는 개발자나 연구자라면, 불완전한 데이터를 정제하거나 채우는 데 리소스를 쏟기보다 LSM-2와 같이 결손 자체를 학습 프로세스에 통합하는 접근법을 고려해야 합니다. AIM 기법은 데이터의 가변적인 파편화를 자연스럽게 수용하므로, 고혈압 예측과 같은 실제 임상적 다운스트림 태스크에서 더욱 정확하고 일반화된 결과를 도출하는 데 효과적입니다.