transformer

23 개의 포스트

meta5분 읽기큐레이션 요약

사용자 시퀀스에서 스케일링 법칙까지: Meta 광고 순위를 위한 다단계 아키텍처

Meta는 사용자 행동의 순서와 시간 정보를 활용하는 시퀀스 학습을 광고 추천 시스템에 확장하기 위해 두 가지 구조적 혁신을 제시한다. 첫째, 오프라인 사용자 모델과 온라인 랭킹 모델을 분리해 긴 사용자 이력을 효율적으로 처리하고, 둘째, dense tokenization과 target-aware attention으로 광고와 사용자 행동 간 상호작용을 모델이 직접 학습하도록 했다. 이 플랫폼은 Instagram 전환율 6%, Facebook 전환율 3%, Facebook 광고 클릭률 3.5%의 누적 향상에 기여했으며, Meta의 GEM(Generative Ads Recommendation Model)의 핵심 요소로 활용되고 있다. ## 기존 시퀀스 모델의 한계 - 광고 추천 시스템은 밀리초 단위로 수천 개의 광고를 검색·순위화해야 하며, 초당 수백만 개의 후보를 처리해야 한다. - 기존 방식은 보통 다음과 같은 하이브리드 구조를 사용했다. - 한 모델은 사용자 행동 시퀀스를 처리한다. - 다른 모델은 희소 피처 간 상호작용을 처리한다. - 이 구조는 운영 효율성은 높지만 다음과 같은 문제가 있다. - 두 모델 사이의 지식 전달이 손실될 수 있다. - 희소 피처를 조합하기 위한 수작업 피처 엔지니어링이 계속 필요하다. - 시퀀스 모델과 랭킹 모델의 규모를 동시에 키울 때 서로 간섭해 확장성이 제한된다. - 시퀀스 길이와 Transformer 규모를 키울수록 모델 복잡도와 실시간 추론 비용 사이의 균형을 맞추기 어려워진다. ## 오프라인 사용자 모델과 온라인 랭킹 모델의 분리 - 다단계 시퀀스 모델은 무거운 사용자 모델링과 실시간 광고 순위화를 두 단계로 분리한다. - 오프라인 사용자 모델 - 사용자의 긴 행동 이력을 비동기적으로 처리한다. - 수천 개 수준의 시퀀스 길이와 여러 Transformer 레이어를 사용할 수 있다. - 사용자 행동에서 장기적인 관심사와 패턴을 추출해 사용자 임베딩을 생성한다. - 계산 결과는 사용자 단위로 미리 계산하고 캐시한다. - 광고 후보나 특정 문맥 정보와 분리해, 특정 광고에 종속되지 않는 사용자 표현을 만든다. - 온라인 랭킹 모델 - 캐시된 사용자 임베딩에 최신 사용자 신호와 광고 후보 정보를 결합한다. - 실시간 요청에서 최종 광고 순위를 계산한다. - 엄격한 지연 시간 예산을 만족하도록 가볍고 빠르게 설계된다. - 이 분리를 통해 오프라인 모델의 용량과 복잡도는 크게 늘리면서도 온라인 서빙 비용과 지연 시간의 급증을 피할 수 있다. ## Dense Tokenization으로 희소 피처 통합 - 기존 추천 시스템은 희소 ID 피처 간 상호작용을 표현하기 위해 사람이 직접 조합 피처를 설계하는 경우가 많았다. - Dense tokenization은 희소 피처와 순차적 행동 데이터를 하나의 조밀한 토큰 어휘로 통합한다. - 통합된 토큰 표현을 사용하면 attention 메커니즘이 데이터에서 직접 피처 간 관계를 발견할 수 있다. - 결과적으로 다음과 같은 장점이 있다. - 수작업으로 정의한 교차 피처에 대한 의존도가 낮아진다. - 사용자 행동, 광고 속성, 문맥 정보 사이의 복잡한 관계를 통합적으로 학습할 수 있다. - 시퀀스 모델이 전통적인 희소 피처 모델의 역할까지 흡수할 수 있다. ## Target-Aware Multi-Head Attention - 사용자 행동 시퀀스와 광고 후보 정보를 함께 토큰화한 뒤, 광고별로 사용자 과거 행동의 중요도를 다르게 계산한다. - 각 attention 레이어는 현재 평가 중인 광고를 기준으로 사용자의 과거 행동을 참조한다. - 여러 개의 정렬된 attention 블록을 쌓아 다음을 수행한다. - 광고와 과거 행동 사이의 1차 상호작용을 학습한다. - 이후 레이어에서 더 높은 차원의 상호작용을 포착한다. - 긴 사용자 시퀀스를 광고별로 중요한 정보만 포함한 압축 표현으로 점진적으로 변환한다. - 이 방식은 모든 광고에 동일한 사용자 표현을 사용하는 대신, 각 광고 후보에 맞는 사용자 관심사 표현을 생성한다. ## 예측 가능한 LLM 스타일 확장 법칙 - 실제 광고 트래픽에서 모델 성능은 계산량(FLOPs)이 증가할수록 로그-선형적으로 향상되는 경향을 보였다. - 이는 대규모 언어 모델에서 관찰된 scaling law와 유사하다. - 성능은 다음 요소를 확장할 때 측정됐다. - Transformer 깊이 - 모델 폭 - 사용자 시퀀스 길이 - 콘텐츠·의미 정보의 풍부함 - 기존 Transformer 기반 시퀀스 모델보다 계산량 증가에 따른 확장 효율도 개선됐다. - 광고 추천은 텍스트처럼 조밀한 데이터만 처리하지 않고 희소 ID 피처와 시간 순서 정보를 함께 다루지만, 그럼에도 예측 가능한 확장 법칙이 나타났다는 점이 아키텍처의 적합성을 뒷받침한다. ## 성능 확장을 위한 네 가지 조절 요소 ### 균형 잡힌 모델 구조 - 깊이, 폭, 시퀀스 길이를 균형 있게 확장해야 한다. - 한 축만 키우면 다른 축이 병목이 되어 성능 향상이 둔화될 수 있다. - 이는 모델 확장에서 각 구성 요소 간의 시너지가 필요하다는 “scaling synergy principle”로 설명된다. ### 다단계 모델의 독립적 조정 - 오프라인 사용자 모델과 온라인 랭킹 모델을 서로 독립적으로 확장할 수 있다. - 온라인 모델 확장은 단위 계산량당 더 큰 성능 향상을 가져올 수 있지만, 요청 처리 시간과 서빙 지연 시간에 제한된다. - 오프라인 모델은 비동기 추론이 가능하므로 지연 시간 제약 없이 모델 규모를 점진적으로 키울 수 있다. ### 시퀀스 구성의 다양성 - 더 긴 사용자 행동 시퀀스를 사용할수록 성능이 향상된다. - 단순히 유사한 유형의 행동을 많이 넣는 것보다 다양한 행동 유형을 균형 있게 포함하는 것이 더 효과적이다. - 즉, 시퀀스의 길이뿐 아니라 행동 데이터의 다양성이 사용자 의도와 관심사를 표현하는 데 중요하다. ### 모델·데이터 확장의 결합 - 광고 추천에서는 모델 크기만 키우는 것으로 충분하지 않다. - 희소 피처, 의미 정보, 사용자 행동의 시간적 범위와 다양성을 함께 확장해야 한다. - 다단계 구조는 각 확장 요소가 온라인 비용과 오프라인 비용에 미치는 영향을 분리해 조정할 수 있게 한다. ## 실용적인 결론 대규모 추천 시스템에서는 모든 계산을 실시간으로 수행하기보다, 긴 사용자 이력은 오프라인에서 깊게 모델링하고 실시간 단계에서는 캐시된 표현과 최신 광고 신호를 결합하는 구조가 효과적이다. 또한 수작업 피처 조합을 계속 늘리기보다 dense tokenization과 target-aware attention을 통해 모델이 광고별 사용자 행동 상호작용을 직접 학습하도록 설계하는 것이 확장성과 성능 향상에 유리하다.

원문 읽기(새 탭에서 열림)
line4분 읽기큐레이션 요약

오픈챗 이름 및 설명 글로 유해성 판단하는 모델 개발하기

LINE AI Services Lab은 오픈챗 이름과 설명을 바탕으로 징계 수위와 사유를 예측하는 자동 모니터링 모델을 개발했다. 기존 모델의 적용 범위를 넓히기 위해 데이터를 정제하고, 안전성 모더레이션에 특화된 2B 규모의 Granite Guardian 3.1 2B를 LoRA로 학습했다. 최종적으로 자연어 단일 토큰과 토큰별 확률을 활용해 실시간 운영에 적합한 분류 구조를 구현했다. ## 오픈챗 모니터링의 목적 - 오픈챗은 생성되거나 이름·설명 글이 수정될 때마다 운영 정책 위반 여부를 검수해야 한다. - LINE은 글로벌 서비스로 생성·수정되는 오픈챗이 많아, 사람의 수동 검수만으로는 대응하기 어렵다. - 기존 모니터링 모델은 여러 국가에서 효과를 보였지만, 국가별로 세분화된 판단 기준이 필요한 경우에는 자동 검수가 제한됐다. - 이번 프로젝트의 목표는 자동 검수 적용 국가와 범위를 확대하고, 기존 적용 국가의 정확도도 높이는 것이었다. ## 중복 데이터와 불일치 라벨 정제 - 현재 가이드라인과 일치하도록 해당 가이드라인이 적용된 기간의 수동 검수 데이터만 학습에 사용했다. - 동일한 오픈챗 이름과 설명에 서로 다른 징계 결과가 부여된 사례를 하나의 최종 라벨로 통합했다. - 징계 코드 처리 기준: - 가장 높은 수위의 징계가 2회 이상이면 해당 징계를 최종 라벨로 선택한다. - 최고 수위 징계가 한 번만 나타나면 노이즈일 가능성을 고려해 두 번째로 높은 수위의 징계를 선택한다. - 징계 사유 처리 기준: - 동일 그룹에서 가장 많이 등장한 사유를 우선한다. - 빈도가 같으면 전체 데이터에서 더 드문 사유를 선택한다. - 이는 희귀한 사유가 해당 데이터를 더 구체적으로 설명할 수 있다는 TF-IDF의 발상에서 착안했다. ## Granite Guardian 3.1 2B 선정 - 사전 학습 모델은 다음 조건으로 검토했다. - 디코더 기반 모델 - 안전성 모더레이션 과제로 튜닝된 모델 - 약 2B 규모 - 상업적 활용이 가능한 Apache 라이선스 - 실시간으로 대량의 오픈챗을 처리해야 하므로, 대형 모델보다 추론 비용과 응답 속도가 낮은 모델이 필요했다. - Granite Guardian은 입력이 유해한지에 대해 `Yes` 또는 `No` 토큰을 생성하는 방식으로 안전성을 판별한다. - 특정 후보 토큰의 생성 확률을 비교하므로 출력 형식이 흔들리지 않고, 확률을 신뢰도로 활용해 운영 임계값을 조정하기 쉽다. ## 징계 코드와 사유를 함께 예측하는 학습 구조 - 오픈챗 검수는 단순한 유해·무해 이진 분류가 아니다. - 유해성의 정도에 따라 징계 수위가 달라진다. - 징계 사유도 함께 예측하고 안내해야 한다. - 이를 위해 모델 응답을 다음과 같은 구조로 정의했다. ```text Action:{징계 코드 토큰} Reason:{징계 사유 토큰} ``` - Cross Entropy Loss를 사용하되, 전체 프롬프트가 아니라 모델의 응답 영역에 대해서만 손실을 계산했다. - 입력 문장을 복사하는 능력보다 징계 코드와 사유를 정확히 예측하는 능력이 중요하기 때문이다. - 전체 파라미터 대신 LoRA를 적용했다. - 기존 모델 파라미터는 고정한다. - 학습해야 할 변화량을 작은 행렬 두 개의 곱으로 근사한다. - 업데이트 파라미터와 메모리 사용량을 줄이면서 사전 학습 능력을 유지한다. ## 자연어 단일 토큰을 활용한 추론 - 실제 징계 코드와 사유 코드는 알파벳·숫자 조합이라 토크나이저에 의해 여러 토큰으로 분할될 수 있다. - 여러 토큰으로 나뉘면 각 코드의 생성 확률을 직접 비교하기 어렵다. - 따라서 코드와 사유를 의미 있는 자연어 표현으로 매핑하고, 각각 하나의 토큰으로 표현되도록 구성했다. - 자연어 토큰은 임의의 코드값보다 모델이 의미를 학습하기에도 유리할 것으로 판단했다. ## 단계별 확률 계산과 KV 캐싱 - 첫 번째 단계에서 모델의 마지막 출력 로짓 중 징계 코드 토큰에 해당하는 값만 추출한다. - 해당 값에 softmax를 적용해 코드별 확률을 계산하고, 가장 높은 확률의 징계 코드를 선택한다. - 이후 선택된 코드와 `Reason:` 프롬프트를 모델에 추가 입력해 징계 사유를 예측한다. - 징계 사유 역시 사유 토큰 후보의 확률만 비교해 최종 결과를 선택한다. - 두 번째 단계에서는 첫 번째 추론의 `past_key_values`를 재사용하는 KV 캐싱을 적용해 반복적인 계산을 줄였다. ## 실용적인 결론 이 사례는 대규모 생성 모델을 그대로 사용하는 대신, 작은 안전성 특화 디코더 모델에 구조화된 출력 형식과 LoRA를 결합해 실시간 콘텐츠 모니터링에 맞춘 접근이다. 운영 환경에서는 단순 정확도뿐 아니라 라벨 품질, 토큰별 신뢰도, 임계값별 검수량과 오탐·미탐 비용을 함께 평가하는 것이 중요하다.

원문 읽기(새 탭에서 열림)
meta4분 읽기큐레이션 요약

메타 광고 딥 퍼널 최적화를 위한 계층적 관심사 표현 탐구

Hierarchical Interest Representation은 사용자와 광고주·제품·서비스를 하나의 그래프로 연결하고, 이들의 잠재적 관심사를 여러 수준의 임베딩으로 학습하는 Meta Ads의 상위 표현 계층이다. 희소한 광고 참여 신호에 텍스트·이미지·영상 기반의 세계 지식을 결합해, 사용자의 잠재 관심과 광고주의 상품을 연결하고 딥 퍼널 광고 성과를 높이는 것이 목표다. 수십억 건의 상호작용을 이용해 학습한 범용 임베딩과 관심 토큰은 검색, 개인화, 추천, 감독 신호, 랭킹 모델 전반에 활용될 수 있다. ## 딥 퍼널 광고 최적화를 위한 표현 계층 - 사용자가 스크롤, 클릭, 반응, 구매 등으로 표현한 선호를 바탕으로 명시적·암묵적 관심사를 추론한다. - 광고주가 제공하는 상품·서비스와 사용자의 잠재 관심을 연결해, 단순 노출이나 클릭을 넘어 전환 등 딥 퍼널 목표를 최적화한다. - Meta의 Generative Ads Model(GEM), Andromeda, Adaptive Ranking Model 등 광고 추천 생태계의 여러 단계에서 사용할 수 있는 상위 표현 계층을 지향한다. - 대규모 참여 데이터에서 안정적인 관심 앵커를 추출해, 사용자가 아직 직접 반응하지 않은 광고의 발견 가능성도 높인다. ## 광고 생태계를 그래프로 모델링 - 사용자, 광고주, 제품, 서비스, 캠페인 등을 그래프의 노드로 표현한다. - 노드 사이의 노출, 클릭, 참여, 구매 등의 활동과 이벤트는 엣지가 된다. - Meta의 광고 네트워크는 매월 수백만 광고주와 수백만 개 광고가 수십억 명의 사용자에게 제공되는 초대형 그래프다. - 사용자와 특정 광고 사이의 직접적인 딥 퍼널 신호는 희소하기 때문에, 그래프에서 멀리 떨어진 연결과 공통 패턴을 함께 학습해야 한다. ## 희소한 신호와 동적인 관심사 - 사용자는 ‘관심 있음/관심 없음’ 같은 직접 피드백뿐 아니라 광고 참여 행동으로도 관심을 표현한다. - 광고 노출 기회와 전환 피드백은 광고·상품의 전체 규모에 비해 제한적이다. - 개별 사용자와 광고의 연결만 보면 데이터가 부족하므로, 관련 사용자·상품·광고주 사이의 장거리 관계를 활용해야 한다. - 대규모 그래프에서 장거리 관계를 계산하려면 메모리 효율적인 어텐션 커널과 고성능 학습 알고리즘이 필요하다. ## 차원 축소와 관심 원시 단위 - 원시 광고 그래프를 학습된 잠재 관심 단위인 ‘슈퍼 노드’ 중심의 슈퍼 그래프로 변환한다. - 원래는 희소했던 사용자-광고 연결을 공통 관심 원시 단위로 묶어 더 조밀한 관계로 만든다. - 관심 원시 단위의 어휘는 개별 광고보다 안정적이고 정적이므로, 광고 비즈니스와 상품 구성이 바뀌어도 재사용하기 쉽다. - 이를 통해 개별 광고에 대한 충분한 이력이 없는 사용자나 상품에도 일반화할 수 있다. ## 멀티모달 지식 보강 - 광고주와 제품의 페이지 메타데이터, 카탈로그 속성, 텍스트, 이미지, 영상 정보를 활용한다. - 언어 모델과 비전 모델로 콘텐츠를 처리해, 사용자가 해당 상품과 어떻게 상호작용했는지뿐 아니라 상품 자체가 무엇인지도 표현한다. - 참여 데이터가 부족한 희귀하거나 새롭게 등장한 광고주·제품에 대해서도 의미적 유사성을 바탕으로 추론할 수 있다. - 실제 세계의 지식과 행동 기반 신호를 결합해 콜드스타트와 신호 부족 문제를 완화한다. ## 통합 관계 임베딩 - 사용자, 광고주, 제품, 서비스와 잠재 관심 원시 단위를 하나의 거리 기반 공간에 배치한다. - 임베딩 간 거리를 이용해 다음 관계를 추정할 수 있다. - 사용자와 관심 원시 단위의 근접성 - 광고·광고주가 어떤 관심사를 제공하는지 - 관심 원시 단위끼리의 유사성 - 유사한 사용자, 광고, 제품의 이웃 관계 - 서로 다른 유형의 엔터티 간 친화도 - 동일한 표현 공간을 사용하므로 사용자 관심과 광고 상품의 의미적 연결을 직접 계산할 수 있다. ## 여러 계층의 관심 표현 - 상위 계층은 여행·스포츠·패션처럼 안정적이고 넓은 관심사를 표현한다. - 하위 계층은 특정 브랜드, 세부 상품, 구매 의도처럼 희소하지만 정밀한 관심사를 표현한다. - 조밀하고 안정적인 관계는 더 거친 계층으로, 드물고 구체적인 관계는 더 세밀한 계층으로 표현한다. - 여러 계층을 연쇄적으로 학습하면 검색·개인화에는 넓은 관심 표현을, 최종 랭킹에는 구체적인 의도 표현을 선택적으로 사용할 수 있다. ## 트랜스포머 기반 그래프 학습 - LLM에서 영감을 받은 트랜스포머 구조를 대규모 광고 그래프에 적용한다. - 희소 어텐션을 사용해 모든 노드 간 연결을 계산하지 않고도 장거리 그래프 관계를 포착한다. - 편향을 고려한 어텐션과 자기지도 방식의 교차 뷰 지식 증류를 활용해 여러 관점의 그래프 정보를 통합한다. - 사용자 행동의 시간적 변화와 광고주·제품 콘텐츠의 의미 정보를 함께 학습한다. - 전체 시스템은 실제 Meta 광고 데이터의 수십억 건 상호작용으로 엔드투엔드 학습된다. ## 범용 임베딩과 Bag-of-Meaning 토큰 - 광고 생태계의 사용자·광고주·제품·서비스에 대한 범용 임베딩을 생성한다. - 여러 의미 단위로 구성된 ‘Bag-of-Meaning’ 관심 토큰은 사용자의 관심과 광고의 의미를 공통 어휘로 표현한다. - 이 결과는 다음 용도로 확장될 수 있다. - 광고 및 상품 검색·후보 생성 - 개인화 추천 - 랭킹 모델의 입력 특성 - 학습을 위한 감독 신호 - 특정 도메인에 최적화된 전문 랭킹 아키텍처 실용적으로는 직접적인 전환 데이터가 부족한 광고·상품을 다뤄야 하거나, 신규 엔터티와 장기적인 관심 관계를 포착해야 하는 시스템에 특히 유용하다. 다만 범용 임베딩을 실제 광고 순위에 적용할 때는 최신성, 사용자 프라이버시, 관심사 편향, 계층별 표현의 검증을 함께 관리해야 한다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

TabFM 소개: 표 형식 데이터를 위한 제로샷 파운데이션 모델

TabFM은 표 형식 데이터를 위한 제로샷 파운데이션 모델로, 별도의 모델 학습·하이퍼파라미터 튜닝·복잡한 피처 엔지니어링 없이 분류와 회귀를 수행한다. 전체 학습 데이터와 예측 대상 행을 하나의 문맥으로 입력해 인컨텍스트 러닝(ICL) 방식으로 관계를 파악하며, 단 한 번의 순전파로 예측을 생성한다. Google은 TabArena 평가에서 TabFM이 기존의 튜닝된 트리 기반 모델들과 경쟁력 있는 성능을 보였다고 설명하며, BigQuery의 `AI.PREDICT` SQL 명령으로 제공할 계획이다. ## 기존 표 형식 머신러닝의 한계 - 고객 이탈 예측, 금융 사기 탐지 등 표 데이터 기반 분류·회귀 문제는 기업의 핵심 업무에 널리 사용된다. - AdaBoost, XGBoost, 랜덤 포레스트 같은 지도학습 트리 모델이 오랫동안 강력한 성능을 보여왔다. - 하지만 새로운 데이터셋마다 다음 작업을 반복해야 한다. - 모델 학습 - 하이퍼파라미터 최적화 - 도메인별 피처 엔지니어링 - 검증 및 재학습 - 따라서 단순히 `.fit()`을 호출하는 것만으로는 실무에서 신뢰할 만한 성능을 얻기 어렵다는 문제가 있다. ## 표 데이터를 위한 인컨텍스트 러닝 - TabFM은 기존처럼 데이터셋별로 모델 가중치를 업데이트하지 않는다. - 과거의 학습 행과 예측할 테스트 행을 하나의 통합된 입력 문맥으로 제공한다. - 모델은 추론 시점에 행과 열 사이의 관계를 분석해 새로운 작업을 수행한다. - 이는 대규모 언어 모델이 예시와 지시문만으로 새로운 작업을 수행하는 제로샷·인컨텍스트 러닝과 유사하다. - 결과적으로 데이터셋별 반복 학습, 튜닝, 수작업 피처 설계가 필요하지 않다. ## 행·열 구조를 반영한 하이브리드 아키텍처 표는 자연어처럼 일렬로 정렬된 토큰 시퀀스가 아니라, 행과 열로 구성된 2차원 구조이며 행이나 열의 순서를 바꿔도 의미가 본질적으로 달라지지 않는다. TabFM은 이를 처리하기 위해 TabPFN과 TabICL의 아이디어를 결합한 구조를 사용한다. - **행·열 교차 어텐션** - 여러 층의 어텐션 모듈이 열 방향과 행 방향을 번갈아 처리한다. - 각 피처의 상호작용과 각 샘플 간의 관계를 함께 학습한다. - 기존 피처 엔지니어링이 담당하던 복잡한 변수 간 의존성 추출을 모델 내부에서 수행한다. - **행 압축** - 각 행에서 얻은 풍부한 문맥 정보를 하나의 밀집 벡터로 압축한다. - 이후 단계가 원본 2차원 테이블 전체가 아니라 압축된 행 표현을 사용하도록 만든다. - **압축 표현 기반 ICL** - 전용 Transformer가 압축된 행 벡터들의 시퀀스에 어텐션을 적용한다. - 원시 테이블 전체에 직접 어텐션하는 방식보다 계산량이 크게 줄어든다. - 데이터셋 규모가 커져도 비교적 효율적으로 예측할 수 있도록 설계됐다. ## 합성 데이터로 대규모 사전 학습 - 산업용 표 데이터는 기업의 독점 스키마와 민감한 정보를 포함하는 경우가 많아 공개된 대규모 학습 데이터가 부족하다. - TabFM은 이 문제를 해결하기 위해 수억 개의 합성 데이터셋으로만 학습됐다. - 합성 데이터는 구조적 인과 모델(SCM)을 이용해 동적으로 생성된다. - 다양한 무작위 함수와 데이터 분포, 복잡한 피처 관계를 포함하도록 설계됐다. - 실제 데이터를 직접 대량 확보하지 않고도 다양한 표 구조를 학습해, 보지 못한 실제 데이터셋에 일반화하는 것을 목표로 한다. ## TabArena 벤치마크와 두 가지 모델 설정 - TabArena에서 분류 38개, 회귀 13개 데이터셋을 대상으로 평가했다. - 데이터셋 크기는 약 700개에서 150,000개 샘플까지 다양하다. - 모델 간 일대일 승률을 바탕으로 Elo 점수를 계산해 성능을 비교한다. - **TabFM** - 기본 제공 모델이다. - 튜닝이나 교차 검증 없이 한 번의 순전파로 예측한다. - 제로샷 사용 편의성을 중시한 설정이다. - **TabFM-Ensemble** - 성능 향상을 위해 교차 피처와 SVD(특이값 분해) 피처를 추가한다. - 비음수 최소제곱법으로 32개 모델 앙상블의 최적 가중치를 계산한다. - 분류 문제에서는 Platt scaling을 이용해 예측 확률을 보정한다. - 기본 TabFM보다 추가 계산과 처리 과정이 필요하지만 더 높은 성능을 목표로 한다. ## 제공 방식과 기대 효과 - TabFM은 Hugging Face와 GitHub를 통해 공개된다. - Google BigQuery에도 통합될 예정이며, 사용자는 `AI.PREDICT` SQL 명령으로 분류·회귀를 실행할 수 있다. - 별도의 머신러닝 전문 지식이나 전통적인 모델 개발 파이프라인 없이 표 데이터 예측을 수행하는 것이 목표다. 실무에서는 빠른 기준선 모델이나 반복적인 데이터셋별 모델 개발을 줄이는 용도로 TabFM을 먼저 적용할 수 있다. 다만 중요한 의사결정에 사용할 때는 데이터 누수, 예측 확률의 보정, 기존 모델과의 실제 데이터셋별 비교 및 비용·지연 시간까지 함께 검증하는 것이 좋다.

원문 읽기(새 탭에서 열림)
netflix4분 읽기큐레이션 요약

GenPage: 넷플릭스의 엔드투엔드 생성형 홈페이지 구축을 향해

Netflix의 **GenPage**는 기존의 다단계 추천 파이프라인 대신, 하나의 생성형 Transformer가 사용자·요청 맥락을 입력으로 받아 홈페이지 전체를 한 번에 생성하는 방식이다. 행(row), 콘텐츠(entity), 배치(layout)를 함께 생성하므로 페이지 전체의 사용자 만족도와 콘텐츠 간 상호작용을 최적화할 수 있다. 실제 A/B 테스트에서 기존 운영 시스템보다 핵심 참여 지표를 유의미하게 개선했고, 전체 서빙 지연 시간도 20% 줄였다. ## 홈페이지 전체를 생성하는 GenPage - 기존 Netflix 홈페이지는 다음 요소를 별도 단계에서 처리했다. - 어떤 추천 행을 노출할지 결정 - 각 행 안의 콘텐츠 후보 생성 및 랭킹 - 행과 콘텐츠의 최종 배치 - GenPage는 사용자 이력과 요청 맥락을 프롬프트처럼 사용하고, 홈페이지 전체를 자기회귀적으로 생성한다. - 일반적인 생성형 추천기가 평평한 콘텐츠 목록만 생성하는 것과 달리, GenPage는 다음을 함께 생성한다. - 추천 행 - 각 행의 콘텐츠 - 페이지 내 배치 순서와 구조 ## 다단계 추천 시스템에서 엔드투엔드 모델로 - 하나의 Transformer가 원시 입력 신호에서 최종 페이지를 만들기 때문에 여러 모델 간 목표 불일치를 줄일 수 있다. - 후보 생성, 행 랭킹, 콘텐츠 랭킹 등 여러 모델을 유지·운영해야 하는 부담이 감소한다. - 기존의 복잡한 특성 공학(feature engineering)을 줄이고, 데이터·연산량·모델 규모를 늘려 성능을 개선하기 쉬운 구조를 제공한다. - 새로운 콘텐츠 유형이나 UI를 도입할 때 아키텍처를 크게 바꾸지 않고 확장할 수 있다. - 라이브 이벤트 - 게임 - 팟캐스트 - 개인화된 UI 컴포넌트 - 콘텐츠별 개인화 아트워크 ## 페이지 단위 최적화와 강화학습 - 기존 시스템은 주로 개별 콘텐츠나 행의 클릭·시청 가능성을 최적화한다. - GenPage는 페이지 전체를 생성하므로 행과 콘텐츠 사이의 상호작용을 페이지 보상으로 학습할 수 있다. - 예를 들어 상단의 ‘Continue Watching’ 행은 즉각적인 만족도를 높일 수 있지만, 사용자가 다른 행을 탐색하는 양은 줄일 수 있다. - 강화학습(RL)을 적용하면 다음과 같은 전체 페이지 수준의 효과를 고려할 수 있다. - 콘텐츠 다양성 - 여러 행의 탐색성과 시청 유도력 간 균형 - 사용자 만족도와 페이지 탐색량의 trade-off - 흥미롭게도 오프라인 평가에서는 다양성을 직접 보상 목표에 포함하지 않았음에도 RL 후처리 학습 이후 홈페이지 다양성이 증가했다. ## 홈페이지 데이터를 토큰 시퀀스로 표현 - 각 학습 샘플은 홈페이지 노출 한 번을 나타내며 다음 세 요소로 구성된다. - **Context**: 사용자 행동 이력, 프로필 속성, 요청 맥락 - **Page**: 실제 노출된 추천 행과 콘텐츠, 레이아웃 순서 - **Feedback**: 재생, 좋아요, 이탈 등 사용자 반응 - Context와 Page는 모델 입력·출력으로 토큰화한다. - Feedback은 직접 생성하는 대상이 아니라 내부 보상 시스템을 통해 학습 신호로 변환한다. - 결과적으로 모델은 일반 텍스트가 아닌, 구조화된 홈페이지 표현을 생성한다. ## 도메인 특화 토크나이저 - 일반적인 LLM용 텍스트 토크나이저 대신 Netflix 추천 도메인에 맞춘 전용 토크나이저를 사용한다. - 예를 들어 “사용자가 30일 전에 특정 작품을 50분 시청했다”는 이벤트를 다음과 같이 압축할 수 있다. - 엔터티 ID - 행동 유형 - 시간 구간 - 시청 지속시간 구간 - 일반 GPT 계열 토크나이저로 16개 토큰이 필요한 정보를 4개 토큰으로 표현할 수 있어 시퀀스 길이와 추론 비용을 줄인다. - 행과 콘텐츠가 특정 토큰과 직접 대응하므로 제품·비즈니스 규칙을 적용하기도 쉽다. - 생성 결과에 허용되지 않는 콘텐츠나 구조가 포함되지 않도록 제어할 수 있다는 점도 장점이다. ## 사용자 맥락 토큰 - 사용자 행동 이력은 다음 메타데이터를 포함한 행동 시퀀스로 표현한다. - 행동 유형 - 콘텐츠 ID - 발생 시점 - 행동 지속시간 - 명시적 신호와 암묵적 신호를 모두 포함한다. - 명시적 신호: 재생, ‘My List’ 추가, 좋아요 - 암묵적 신호: 예고편 시청, 상세 페이지 방문 - 사용자 프로필에는 언어, 프로필 유형 등을 넣는다. - 요청 맥락에는 시간대, 요일, 사용 기기 등의 정보를 포함한다. - 전체 노출 이력처럼 지나치게 긴 데이터는 요약해서 사용한다. - 이 요약 과정은 모델이 원시 데이터를 완전히 직접 학습하는 대신 사람이 설계한 프롬프트 엔지니어링을 일부 남긴다는 한계가 있다. - 장기적으로는 긴 이력을 엔드투엔드 방식으로 압축하는 것이 중요한 연구 과제다. ## 운영 환경의 주요 과제 - 홈페이지를 실시간 생성해야 하므로 서빙 지연 시간이 핵심 제약이다. - 계속 변화하는 콘텐츠 카탈로그에서 신규 콘텐츠의 콜드 스타트 문제를 해결해야 한다. - 사용자의 관심사와 문화적 트렌드 변화에 맞춰 모델을 지속적으로 최신화해야 한다. - 생성 결과에도 콘텐츠 정책, 제품 요구사항, 비즈니스 규칙을 적용해야 한다. - Netflix는 이러한 제약을 고려하면서도 운영 환경에 GenPage를 적용했다. ## 실험 및 운영 결과 - 성숙하고 최적화된 기존 다단계 추천 시스템과 비교한 온라인 A/B 테스트에서: - 출시 판단에 사용하는 핵심 사용자 참여 지표가 통계적으로 유의미하게 향상됐다. - 전체 엔드투엔드 서빙 지연 시간이 20% 감소했다. - 오프라인 분석에서는 모델 규모를 키우는 것보다 프롬프트에 더 풍부한 정보를 넣는 것이 현재 조건에서 더 큰 효과를 보였다. - 강화학습은 명시적으로 다양성을 최적화하지 않았음에도 페이지 다양성을 높였다. GenPage는 홈페이지를 개별 콘텐츠의 집합이 아니라 하나의 최적화 대상인 페이지로 다룬다는 점에서 의미가 있다. 다만 실시간 지연, 신규 콘텐츠, 최신성, 생성 결과 제어가 핵심 과제이므로, 실제 도입 시에는 도메인 특화 토큰화와 강력한 규칙 검증 계층을 함께 설계하는 것이 현실적인 접근이다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

동결된 멀티 토큰 예측으로 Pixel에서 Gemini Nano 모델 가속하기

기존 Gemini Nano v3 모델을 다시 학습하지 않고도 Multi-Token Prediction(MTP)을 추가해 Pixel 기기에서 온디바이스 추론을 가속하는 방법을 소개한다. 별도의 드래프터 모델 대신 본 모델에 가벼운 MTP 헤드를 붙이고, 기존 KV 캐시를 공유하는 zero-copy 구조를 사용해 메모리와 지연 시간을 줄였다. 그 결과 Pixel 9·10의 일부 기능에서 토큰 생성 속도가 50% 이상 향상되고, 인스턴스당 최대 130MB의 메모리를 절약했다. ## 모바일에서 자동회귀 생성이 느린 이유 - 기존 언어 모델은 한 번에 하나의 토큰만 생성하므로, N개 토큰을 만들려면 대형 모델의 추론을 N번 수행해야 한다. - 모바일 기기는 서버보다 RAM과 전력 예산이 제한적이다. - 토큰을 순차적으로 생성하는 과정은 연산 자원을 충분히 활용하지 못하고 메모리 대역폭과 배터리를 많이 소모한다. - 알림 요약, 메시지 교정처럼 짧은 응답도 빠르게 처리해야 하므로 추론 효율이 사용자 경험에 직접 영향을 준다. ## 별도 드래프터의 한계와 MTP - speculative decoding은 다음과 같은 두 단계로 동작한다. - **Draft:** 작은 드래프터 모델이 여러 후보 토큰을 빠르게 생성한다. - **Verify:** 대형 모델이 후보들을 병렬로 검증하고, 일치하는 토큰만 수용한다. - 별도 드래프터 모델은 추가 파라미터와 RAM을 필요로 한다. - 본 모델이 이미 계산한 풍부한 의미 정보를 활용하지 못하고, 텍스트 이력만으로 후보를 예측한다. - MTP는 별도 언어 모델 대신 본 모델의 마지막 층에 경량 Transformer 기반 MTP 헤드를 추가한다. - MTP 헤드는 본 모델의 hidden state를 이용해 여러 미래 토큰을 예측하고, 본 모델은 이를 병렬 검증한다. - 이러한 구조를 글에서는 본 모델의 깊은 지점에서 빠져나와 토큰을 예측하는 **“late exit” 전략**으로 설명한다. ## 동결된 백본에 MTP 헤드 추가 - 이미 배포된 Gemini Nano v3의 가중치는 그대로 동결한다. - 새로 학습하는 부분은 미래 토큰 예측을 담당하는 MTP 헤드뿐이다. - 기존 모델 전체를 다시 사전 학습하거나 별도 드래프터를 작업별로 미세 조정할 필요가 없다. - 백본을 동결하므로 기본 모델의 성능과 안전 정렬을 변경하지 않는다. - 잘못된 후보 토큰은 검증 단계에서 폐기되기 때문에 최종 출력은 기존 대형 모델과 비트 단위로 동일하다. - 따라서 기존 모델과의 하위 호환성을 유지하면서 추론 효율만 개선할 수 있다. ## KV 캐시를 공유하는 zero-copy 구조 - 일반적인 별도 드래프터는 자체 KV 캐시를 생성하고 유지해야 하므로 메모리를 중복 사용한다. - 제안된 MTP 헤드는 본 모델의 KV 캐시에 직접 cross-attention으로 접근한다. - 별도 프롬프트 처리(prefill)나 독립적인 과거 문맥 저장이 필요하지 않다. - 주요 효과는 다음과 같다. - 드래프터가 프롬프트를 다시 처리하지 않아 prefill 지연 감소 - 드래프터 전용 임베딩 테이블과 attention 구조 제거 - 애플리케이션별 튜닝 파라미터 및 중복 KV 캐시 절감 - standalone 드래프터와 비교해 인스턴스당 최대 130MB의 메모리를 절약했다. ## 풍부한 표현이 만드는 예측 정확도 향상 - MTP 헤드는 대형 백본이 이미 계산한 최종 hidden state를 활용하므로 별도 드래프터보다 정확한 후보를 생성한다. - Pixel 9에서 비슷한 규모의 standalone 드래프터보다 작업에 따라 50% 이상의 속도 향상을 보였다. - 복잡한 지시를 따르는 요약·재작성 작업에서 MTP가 크게 우수했다. - 스마트 답장처럼 문장 구조가 예측 가능한 작업에서는 본 모델의 구문 패턴을 잘 학습했다. - 이런 작업에서는 토큰 수용률이 최대 55% 향상됐다. ## Pixel 실사용 결과 - Gemini Nano MTP는 Pixel 9 및 Pixel 10 시리즈에 배포됐다. - 검증과 드래프팅 사이의 의존성을 처리하도록 온디바이스 추론 스택도 함께 재설계했다. - AI 알림 요약과 Proofread 같은 실제 작업에서 추론 한 번당 평균 약 2개의 추가 토큰을 정확히 예측했다. - 수용되는 토큰이 많아지면서 전체 검증 횟수가 감소했다. - 무거운 프로세서를 깨우는 횟수도 줄어들어 응답 시간이 짧아지고 배터리 사용량이 감소했다. ## 실용적인 결론 이미 배포된 온디바이스 모델을 유지해야 하는 경우, 별도 드래프터를 추가하는 것보다 동결된 백본에 MTP 헤드를 붙이고 KV 캐시를 공유하는 방식이 효율적이다. 특히 메모리와 전력이 제한된 모바일 환경에서 모델 출력의 동일성을 유지하면서 속도와 배터리 효율을 함께 개선할 수 있는 현실적인 최적화 전략이다.

원문 읽기(새 탭에서 열림)
line5분 읽기큐레이션 요약

시멘틱 컨텍스트 OS 설계: 에이전트 시스템의 토큰 스터핑을 넘어

LLM의 컨텍스트 창이 커져도 입력을 무작정 늘리는 ‘토큰 스터핑’만으로는 소프트웨어 에이전트의 추론 성능을 보장할 수 없다는 것이 글의 핵심 주장입니다. 긴 컨텍스트에서는 어텐션 희석과 컨텍스트 부패가 발생해 검색 정확도와 논리 일관성이 떨어질 수 있으므로, 컨텍스트를 텍스트가 아닌 관리 가능한 시스템 자원으로 다뤄야 합니다. 이를 위해 글은 로컬 루프백 프록시 형태의 ‘시맨틱 컨텍스트 OS’와 VFS, AST 기반 가지치기, 동적 토큰 관리 구조를 제안합니다. ## 컨텍스트 창은 전통적인 RAM과 다르다 - Karpathy의 은유에 따르면: - LLM은 사전 학습된 가중치를 바탕으로 추론을 수행하는 CPU와 유사합니다. - 컨텍스트 창은 현재 상태와 실행 데이터를 담는 휘발성 RAM과 유사합니다. - 그러나 전통적인 RAM과 달리 LLM의 컨텍스트 검색은 결정론적인 주소 조회가 아닙니다. - 특정 메모리 주소에서 데이터를 정확히 읽는 방식이 아니라, Q·K·V 행렬과 어텐션 점수에 기반한 확률적 검색입니다. - 컨텍스트가 32K에서 1M 또는 2M 토큰으로 커져도 정보 접근 정밀도가 선형적으로 증가하지 않습니다. - 입력이 커질수록 계산 표면적과 구조적 잡음이 증가해 오히려 추론 성능이 저하될 수 있습니다. ## 어텐션 희석과 ‘중간 정보 유실’ - 긴 코드베이스나 시스템 로그에는 다음과 같은 불필요한 정보가 포함됩니다. - 보일러플레이트 정의 - 참조되지 않는 import - 중복된 구문과 유틸리티 - 관련 없는 로그와 실행 데이터 - 이런 정보가 키 행렬에 많이 포함되면 쿼리와 키 사이의 의미 차이가 작아지고, 어텐션 로짓이 균일해집니다. - 그 결과 중요한 정보에 집중하던 날카로운 어텐션 피크가 넓게 분산되어, 정확한 사실 검색이 어려워집니다. - 글은 이를 Stanford 연구에서 제시한 ‘Lost in the Middle’ 현상과 연결합니다. - 컨텍스트의 시작과 끝에 있는 정보는 비교적 잘 검색됩니다. - 중간 영역, 특히 중간 70% 부근의 정보는 검색 정확도가 크게 낮아집니다. - 수만 줄의 코드나 복잡한 서비스 의존성을 다루는 에이전트에게 이러한 검색 편향은 심각한 논리적 오류로 이어질 수 있습니다. ## 장기 작업에서 발생하는 컨텍스트 부패 글은 자동 리팩토링, 레거시 마이그레이션, API 계약 검증처럼 여러 단계가 필요한 작업에서 컨텍스트가 시간이 지나며 악화되는 현상을 ‘컨텍스트 부패’라고 설명합니다. - **컨텍스트 오염** - 과거 실행 로그, 터미널 오류, 원시 데이터를 계속 누적합니다. - 모델이 일시적인 과거 오류를 현재 작업의 영구적인 제약으로 잘못 해석할 수 있습니다. - **컨텍스트 산만** - 모노레포의 동일한 이름, 오버로드된 메서드, 중복 유틸리티가 검색 결과에 함께 들어옵니다. - 구조적으로 비슷하지만 논리적으로 무관한 코드가 핵심 실행 경로를 가립니다. - **컨텍스트 충돌** - 이전 단계의 지시사항을 제거하거나 갱신하지 않으면 서로 모순되는 명령이 남습니다. - 에이전트가 논리적으로 마비되거나 무한 추론, 타임아웃, 환각을 일으킬 수 있습니다. - 글은 능동적인 관리 계층이 없을 경우 컨텍스트 깊이가 커질수록 실패율이 비선형적으로 증가하고, 깊은 코드 구조에서는 실패율이 약 40%에 이를 수 있다고 주장합니다. ## 수동적 프롬프트에서 능동적 거버넌스로 - 일반적인 구현은 문자열을 계속 이어 붙여 다음 LLM 호출에 전달하는 방식입니다. - 이 방식은 메모리 관리, 토큰 최적화, 노이즈 제거를 LLM의 내부 어텐션에 맡깁니다. - 시맨틱 컨텍스트 OS는 애플리케이션 로직과 파운데이션 모델 API 사이에 위치하는 AI 전용 커널로 제시됩니다. - 로컬 `localhost:8080` 루프백 프록시로 동작하며 다음 작업을 담당합니다. - 컨텍스트 상태와 접근 경로 관리 - 토큰 생명 주기 모니터링 - 전송 전 데이터 격리와 정책 적용 - 모델별 하드웨어 토큰 한계와 의미론적 컨텍스트 거버넌스의 분리 ## MVC(Minimum Viable Context) 파이프라인 MVC의 목표는 거대한 텍스트 덤프가 아니라 현재 추론 단계에 필요한 최소한의 고밀도 정보만 모델에 제공하는 것입니다. - **수집 및 토큰 매핑** - 소스 파일, 의존성 트리, 런타임 로그를 수집합니다. - `cl100k_base`, `o200k_base` 등 실제 모델 토크나이저를 사용해 정확한 토큰 수를 계산합니다. - **구조 가지치기** - 정적 코드 분석과 구조 규칙으로 불필요한 정보를 제거합니다. - 컴파일러 주석, 미사용 import, 관계없는 유틸리티 코드 등이 대상입니다. - 글에서 제시한 전체 아키텍처는 이후 단계에서 의미적 정제와 실행 중 토큰 최적화를 수행하도록 설계됩니다. ## 시맨틱 컨텍스트 OS의 구성 요소 - **POSIX 유사 VFS** - 컨텍스트와 에이전트 상태를 가상 파일 시스템처럼 구조화합니다. - 상태 토폴로지와 접근 경계를 명시적으로 관리합니다. - **PathAlign** - AST를 활용해 코드의 구조적 경로를 분석합니다. - 현재 작업과 관련된 가지를 남기고 무관한 코드 트리를 제거합니다. - **비동기 톱니(sawtooth) 메모리 모델** - 실행 중 컨텍스트를 계속 축소·갱신하는 방식으로 토큰 사용량을 최적화합니다. - 장기 실행 루프에서 오래된 상태와 불필요한 데이터를 누적하지 않도록 합니다. - **보안 및 격리** - 모델에 전달되는 데이터의 범위를 제한합니다. - 기업 코드와 로그 등 지적 재산이 불필요하게 외부 추론 엔진으로 유출되는 위험을 줄이는 것을 목표로 합니다. 시맨틱 컨텍스트 OS의 실질적인 메시지는 “큰 컨텍스트 창”보다 “잘 선별되고 지속적으로 관리되는 컨텍스트”가 중요하다는 것입니다. 엔터프라이즈 에이전트를 구축할 때는 토큰 예산을 명시적으로 계산하고, AST·의존성·의미 기반 필터링을 적용하며, 오래된 지시와 로그를 정리하는 런타임 거버넌스 계층을 두는 것이 권장됩니다. 단, 글의 실패율과 성능 개선 수치는 제안된 아키텍처의 주장으로 보아 실제 환경에서 별도의 벤치마크 검증이 필요합니다.

원문 읽기(새 탭에서 열림)
netflix5분 읽기큐레이션 요약

더욱 정교하게 제어할 수 있는 AI 영상 편집을 향해: 넷플릭스의 초기 연구 탐색

넷플릭스는 AI가 영상 전체를 무분별하게 재생성하지 않고, 창작자가 지정한 부분만 정밀하게 수정해야 전문적인 영상 편집에 활용될 수 있다고 주장합니다. 이를 위해 편집 영역만 별도 레이어로 생성하는 Vera와, 객체를 제거한 뒤 물리적으로 자연스러운 장면을 복원하는 VOID를 제안했습니다. 두 연구의 목표는 원본 영상의 정체성·연기·배경을 보존하면서도 복잡한 편집 작업을 자동화해 창작자의 통제력을 높이는 것입니다. ## 전문 영상 편집에서 AI가 겪는 문제 - 기존 생성형 비디오 편집 모델은 수정 대상뿐 아니라 영상 전체의 픽셀을 다시 생성하는 경우가 많습니다. - 그 결과 다음과 같은 의도하지 않은 변화가 발생할 수 있습니다. - 인물의 얼굴이나 정체성 변화 - 배우의 연기와 동작 변형 - 배경, 소품, 장면의 세부 정보 훼손 - 객체 제거 모델은 대상 객체를 지우는 데 집중한 나머지, 객체가 장면의 물리적 상호작용에 미친 영향을 복원하지 못할 수 있습니다. - 그림자, 반사, 가려진 배경, 움직임의 연속성이 깨지면 객체를 제거한 결과가 부자연스럽게 보입니다. ## Vera: 편집 영역만 생성하는 레이어드 비디오 확산 모델 - Vera는 원본 영상 전체를 재생성하지 않고 다음 두 가지를 별도로 생성합니다. - **편집 레이어**: 새로 추가하거나 변경할 시각적 요소 - **알파 매트**: 편집 레이어가 적용될 영역을 나타내는 grayscale 마스크 - 생성된 레이어를 원본 영상과 합성하므로, 편집 영역 바깥의 원본 픽셀은 그대로 유지됩니다. - 텍스트 지시를 기반으로 다음과 같은 작업을 지원합니다. - 객체 추가 - 배경 변경 - 복잡한 장면의 시각적 요소 수정 - 이 방식은 원본 인물의 정체성, 연기, 카메라에 포착된 세부 사항을 보존하는 데 유리합니다. ## Vera의 학습 데이터 구축 - 기존 공개 데이터셋에는 깨끗한 입력 영상, 알파 매트, 편집 레이어, 합성 결과를 함께 제공하는 고품질 레이어드 데이터가 부족했습니다. - 넷플릭스는 오픈소스 영상, 자동 처리, 사람의 품질 검수를 결합해 총 **48만 6천 프레임**, 해상도 **832×480** 규모의 데이터셋을 구축했습니다. - 데이터는 세 단계로 구성됩니다. - **합성 영상** - 고품질 전경 알파 매트를 다양한 자동 생성 배경에 합성 - 객체 추가와 배경 변경을 위한 알파 매트 학습에 활용 - **현실적인 단일 객체 영상** - 분할, 매팅, 배경 인페인팅 또는 생성 과정을 적용 - 사람의 품질 검수를 거쳐 다양한 장면과 카메라 움직임을 확보 - **효과가 포함된 다중 객체 영상** - 개별 객체와 함께 그림자·반사 같은 시각 효과도 분리 - 복잡하고 동적인 장면에서의 합성 성능을 개선 ## Vera의 MoT 모델 구조 - Vera가 생성해야 하는 출력은 서로 다른 특성을 가집니다. - 편집 레이어 - 알파 매트 레이어 - 자연스러운 합성 영상 레이어 - 하나의 공유 아키텍처만 사용하면 데이터 효율이 떨어질 수 있어, Vera는 **Mixture-of-Transformers(MoT)** 구조를 사용합니다. - 하나의 DiT 대신 출력별로 세 개의 DiT를 둡니다. - 각 분기는 독립적인 QKV projection과 FFN 가중치를 유지합니다. - 세 분기의 토큰을 결합한 뒤 joint self-attention을 적용해 서로 간의 상호작용을 가능하게 합니다. - 각 분기는 전문성을 유지하면서 다른 레이어의 정보도 활용합니다. - 세 DiT는 동일한 사전 학습 T2V 모델에서 초기화됩니다. - 추가 입력 처리 방식은 다음과 같습니다. - 원본 영상 토큰은 합성 레이어 토큰에 더해집니다. - 선택적 마스크 영상 토큰은 노이즈가 포함된 알파 토큰에 더해집니다. - 모든 레이어는 동일한 RoPE를 공유하며, 알파·합성 토큰에는 레이어를 구분하도록 0으로 초기화된 학습 임베딩을 추가합니다. ## Vera의 평가와 결과 - 평가용 벤치마크는 다음으로 구성되었습니다. - 객체 추가 72개 - 배경 변경 69개 - 느리고 빠른 움직임, 다양한 카메라 움직임, 단일·다중 객체, 단순·복잡한 장면을 포함합니다. - 성능은 세 기준으로 평가했습니다. - **콘텐츠 보존**: 편집 대상 바깥 영역이 변하지 않았는지 픽셀 및 지각적 유사도로 측정 - **지시문 준수**: 텍스트 프롬프트를 얼마나 정확히 실행했는지 평가 - **영상 품질**: 시간적 일관성과 프레임별 공간 품질 측정 - Vera-1.3B와 Vera-14B는 기존 기준 모델보다 콘텐츠 보존 성능에서 크게 우수했습니다. - 동시에 가장 강력한 기존 모델들과 비슷한 수준의 영상 품질과 지시문 준수 성능을 유지했습니다. ## VOID: 물리적으로 자연스러운 객체 제거 - VOID는 영상에서 객체와 객체가 장면에 미친 상호작용을 함께 제거하는 비디오 인페인팅 모델입니다. - 단순히 객체 영역을 지우는 것이 아니라 다음 요소까지 장면에 맞게 복원하는 것을 목표로 합니다. - 객체 뒤에 가려져 있던 배경 - 객체가 만든 그림자와 반사 - 주변 물체와의 물리적 상호작용 - 시간에 따른 움직임과 장면 연속성 - 따라서 결과 영상은 객체가 처음부터 존재하지 않았던 것처럼 보이도록 설계됩니다. ## 창작자 통제력을 중심에 둔 연구 방향 - 넷플릭스는 AI가 창작자의 의도를 대체하기보다 창작 선택을 확장해야 한다는 원칙을 강조합니다. - 영상 편집 도구는 무엇을 바꿀지뿐 아니라 무엇을 절대 바꾸지 않을지도 통제할 수 있어야 합니다. - Vera는 변경 범위를 레이어 단위로 제한하고, VOID는 제거 후 장면의 물리적 일관성까지 고려함으로써 전문 편집 환경에 필요한 예측 가능성과 보존성을 높이려는 접근입니다. - 연구진은 두 모델의 알고리즘과 실험 결과를 논문으로 공개해 후속 연구와 발전을 촉진하려 합니다. 실무적으로는 영상 전체를 재생성하는 방식보다, 편집 영역·보존 영역·합성 결과를 분리하는 구조가 원본 훼손을 줄이고 편집 결과를 더 쉽게 검수할 수 있습니다. 특히 객체 제거 작업에서는 시각적 삭제뿐 아니라 그림자, 반사, 가려진 배경, 시간적 움직임까지 함께 처리해야 자연스러운 결과를 얻을 수 있습니다.

원문 읽기(새 탭에서 열림)
daangn원문

‘로컬’ 슈퍼 앱에서 장기 유저 모델링은 어떻게 달라질까? (새 탭에서 열림)

당근(Karrot)은 유저의 장기적인 행동 패턴과 여러 버티컬을 넘나드는 관심을 포착하기 위해 Transformer 기반의 장기 유저 모델링 시스템을 구축했습니다. 대규모 행동 로그를 대조 학습(Contrastive Learning)으로 학습하여 공통 유저 임베딩을 생성하고, 이를 홈피드와 광고 등 다양한 추천 지면에 적용함으로써 서비스 전반의 온라인 지표를 개선했습니다. 특히 지역 기반 서비스의 특성을 반영한 배치 샘플링 전략과 대규모 콘텐츠 임베딩 학습 기법을 통해 기술적 한계를 극복하며 개인화 추천의 품질을 한 단계 높였습니다. ### 장기 유저 모델링의 필요성과 구조적 접근 * 단기 히스토리만으로는 파악하기 어려운 계절적 취향, 이사 등 특정 시기에 발생하는 반복적 관심사, 그리고 중고거래와 알바 등 여러 서비스를 넘나드는 유저의 통합적 의도를 파악하기 위해 장기 모델링을 도입했습니다. * 실시간 랭킹 모델의 지연 시간(Latency) 문제를 해결하기 위해, 별도의 유저 인코더가 오프라인에서 임베딩을 생성하고 다운스트림 모델들이 이를 '공통 피처'로 사용하는 디커플링 구조를 채택했습니다. * 수백억 건의 다중 버티컬 로그를 활용해 유저의 다음 액션을 예측(Next Action Prediction)하는 방식으로 학습하며, 이는 기존 모델 대비 약 150배 많은 데이터를 활용한 결과입니다. ### 콘텐츠 임베딩 전환과 인프라 최적화 * 아이템 ID 기반 임베딩의 한계인 신규 아이템 대응 불가(Cold Start) 문제와 GPU 메모리 점유 문제를 해결하기 위해, LLM 기반의 콘텐츠 임베딩으로 전환했습니다. * 임베딩 테이블이 차지하던 메모리를 Transformer 모델 스케일업에 집중하여 파라미터 수를 ID 기반 모델 대비 1,000배 확장하는 데 성공했습니다. * 수백 GB 규모의 대규모 임베딩 데이터를 처리하기 위해 `memmap`을 사용하여 필요한 시점에만 데이터를 디스크에서 읽고, `bbhash(Minimal Perfect Hash)`를 통해 ID 매핑에 필요한 메모리를 97% 절감하는 기술적 최적화를 수행했습니다. ### 지역성을 고려한 지역 제한 배치 샘플링 (RCBS) * 당근은 거래의 86%가 반경 5km 이내에서 발생하는 지역 기반 서비스로, 유저가 물리적으로 볼 수 없는 지역의 아이템은 학습 시 의미 없는 부정 샘플(Impossible Negatives)이 되어 학습 신호를 희석시켰습니다. * 이를 해결하기 위해 같은 지역 유저끼리 미니배치를 구성하는 '지역 제한 배치 샘플링(RCBS)'을 도입하여, 유효한 부정 샘플(Feasible Negatives)의 비중을 2%에서 70%로 대폭 끌어올렸습니다. * 단순히 부적절한 샘플을 제거하는 마스킹 방식 대신 배치 구성을 변경함으로써, 효과적인 배치 사이즈를 유지하면서도 유저의 세밀한 취향을 구분해야 하는 '어려운 부정 샘플(Hard Negative)' 학습 효과를 얻었습니다. ### 실전 적용 및 운영 전략 * 생성된 유저 임베딩은 홈피드와 광고 랭킹 모델의 추가 피처로 입력되어 장기 취향을 보강하거나, 추천 후보(Retrieval) 모델의 독립적인 소스로 활용되어 결과의 다양성을 높였습니다. * 유저의 최신 취향을 반영하기 위해 GCP Dataflow와 Beam 파이프라인을 활용해 24시간 주기로 임베딩을 갱신하며, 최근 활동이 있는 유저만 선별적으로 추론하여 비용과 시간을 최적화했습니다. * 온라인 A/B 테스트 결과, 임베딩의 갱신 주기가 짧을수록 성능이 향상됨을 확인했으며 향후 실시간 추론에 가까운 시스템 구축을 과제로 삼고 있습니다.

netflix원문

MediaFM: 넷 (새 탭에서 열림)

넷플릭스는 방대한 콘텐츠 카탈로그를 정밀하게 이해하기 위해 비디오, 오디오, 텍스트를 결합한 자체 멀티모달 파운데이션 모델인 MediaFM을 개발했습니다. 이 모델은 쇼트(Shot) 단위의 정보를 긴 문맥 속에서 학습하여 내러티브 구조와 감정적 흐름을 파악하며, 광고 타겟팅, 클립 인기 예측, 장르 분류 등 다양한 서비스의 기반 기술로 활용됩니다. 결과적으로 MediaFM은 단순한 프레임 분석을 넘어 영상의 전체적인 맥락을 기계가 읽을 수 있게 변환함으로써 넷플릭스의 콘텐츠 운영 효율과 사용자 경험을 크게 향상시키고 있습니다. **트리모달 데이터의 결합과 전처리** * 모델의 기본 분석 단위는 쇼트 경계 감지 알고리즘으로 분할된 '쇼트(Shot)'이며, 각 쇼트에서 비디오, 오디오, 텍스트 세 가지 핵심 모달리티를 추출합니다. * 비디오는 내부 모델인 SeqCLIP, 오디오는 Meta의 wav2vec2, 자막 및 오디오 설명은 OpenAI의 text-embedding-3-large를 사용하여 개별 임베딩을 생성합니다. * 추출된 세 임베딩을 하나로 결합하여 2304차원의 통합 벡터를 만들고, 이를 최대 512개의 시퀀스로 구성하여 트랜스포머 인코더에 입력합니다. * 작품의 시놉시스와 태그 같은 타이틀 수준의 메타데이터를 [GLOBAL] 토큰으로 변환하여 삽입함으로써, 개별 쇼트가 전체 작품의 맥락을 반영할 수 있도록 설계했습니다. **트랜스포머 기반 아키텍처와 학습 방식** * MediaFM은 BERT와 유사한 구조의 트랜스포머 인코더를 사용하여 쇼트 간의 시간적 관계와 문맥적 정보를 학습합니다. * '마스크 쇼트 모델링(Masked Shot Modeling, MSM)' 기법을 학습 목표로 사용하며, 입력 시퀀스의 20%를 마스킹하고 주변 정보를 통해 원래의 결합 임베딩을 코사인 유사도 기반으로 예측하도록 훈련합니다. * 최적화 과정에서 하이퍼파라미터 튜닝을 위해 Muon 옵티마이저를 도입하여 기존 AdamW 방식보다 성능을 유의미하게 개선했습니다. * 이 과정을 통해 생성된 임베딩은 단순한 정보를 넘어 영상의 전후 흐름이 반영된 '문맥화된 표현(Contextualized representation)'이 됩니다. **주요 활용 사례 및 성능 평가** * 광고 적합성(Ad Relevancy): 추출된 임베딩을 통해 특정 광고 배치에 적합한 클립을 분류하고 후보군을 식별하여 광고 서빙 시스템의 효율을 높입니다. * 클립 인기 및 톤 분석: 클립의 클릭률(CTR)을 바탕으로 상대적 인기를 예측하거나, 영상의 분위기(공포, 유머 등 100여 개 카테고리)를 정밀하게 분석합니다. * 장르 분류 및 리트리벌: 11개의 주요 장르 분류와 더불어, 특정 작품을 홍보하기에 적합한 '가치 있는 클립'인지 여부를 판별하는 이진 분류 작업에 활용됩니다. * 성능 평가 결과, 특정 클립을 단독으로 분석하는 것보다 전체 에피소드라는 더 큰 문맥 안에서 임베딩을 추출할 때 모든 작업에서 월등한 성능을 보였습니다. MediaFM은 넷플릭스가 보유한 대규모 엔터테인먼트 특화 데이터를 학습하여 콘텐츠의 깊은 의미를 파악하는 강력한 도구입니다. 특히 신작 출시 시 데이터가 부족한 '콜드 스타트' 문제를 해결하고, 예고편이나 아트워크 같은 홍보 자산을 최적화하는 데 기여함으로써 미디어 산업에서 멀티모달 AI가 나아가야 할 실질적인 방향을 제시하고 있습니다.

pinterest원문

행동 시퀀스 모델링 (새 탭에서 열림)

핀터레스트는 사용자의 오프사이트(offsite) 행동 이력을 분석하여 미래의 전환 가능성을 예측하는 행동 시퀀스 모델링(Behavioral Sequence Modeling)을 통해 광고 후보군 생성 시스템을 혁신했습니다. 이 시스템은 트랜스포머(Transformer) 기반의 투타워(Two-tower) 구조를 활용해 사용자별로 개인화된 광고주 및 상품을 추천하며, 이를 통해 광고의 관련성을 높이고 광고주 측면에서는 전환 비용(CPA)을 낮추는 성과를 거두었습니다. 결과적으로 수억 개의 상품 카탈로그 속에서 사용자의 진화하는 쇼핑 의도를 실시간으로 포착하여 정교한 광고 서빙이 가능해졌습니다. **광고주 상호작용 예측 모델 (Phase 1)** - 사용자가 과거에 조회, 구매, 장바구니에 담은 상품 시퀀스를 분석하여 다음에 상호작용할 가능성이 높은 광고주를 예측합니다. - 사용자 타워는 양방향 트랜스포머(Bidirectional Transformer)를 사용하여 이벤트 시퀀스를 인코딩하고, 광고주 타워는 MLP 레이어를 통해 광고주를 표현하는 투타워 구조를 채택했습니다. - 학습 시에는 체크아웃, 장바구니 담기, 가입 등을 양성(Positive) 샘플로 정의하고, 샘플링된 소프트맥스 손실(Sampled Softmax Loss)과 인기 항목에 대한 과도한 페널티를 방지하기 위한 Log-Q 편향 수정을 적용했습니다. - 오프라인 평가에서 200만 개의 광고주 임베딩을 대상으로 Recall@K를 측정하여 성능을 검증했으며, 온라인 실험 결과 전환수 증가와 CPA 감소라는 유의미한 비즈니스 지표 개선을 확인했습니다. **상품 단위(Item-level) 예측으로의 확장 (Phase 2)** - 광고주 단위를 넘어 특정 상품(Pin)을 직접 예측함으로써 더욱 깊이 있는 개인화와 효율적인 광고 전달 시스템을 구축했습니다. - 10억 개 이상의 방대한 상품 데이터를 처리하기 위해 핀터레스트 내부의 핀(Pin) 임베딩과 카탈로그 메타데이터를 통합하여 더욱 풍부한 상품 표현력을 확보했습니다. - 대규모 아이템 코퍼스를 다루기 위해 인배치 부정 샘플(In-batch negatives)과 2,000만 개의 무작위 샘플링된 핀을 혼합하여 대조 학습(Contrastive Learning)의 효과를 극대화했습니다. - 일 단위 추론 작업을 통해 최근 활동이 있는 사용자의 임베딩을 업데이트하고, 이를 온라인 피처 스토어에 게시하여 실시간 서빙 시스템에서 활용합니다. **서빙 플로우 및 성능 평가** - 오프라인 배치 워크플로우에서 예측된 상위 100개의 광고주/상품 리스트를 온라인 피처 스토어에 저장하고, 광고 요청 시 L1 랭커와 L2 랭커로 전달하여 최종 광고를 선정합니다. - 모델 성능은 단순 MLP 기반의 풀링(Max/Mean Pooling) 모델을 베이스라인으로 설정하고, 이보다 우수한 Recall@K 성능을 보이는 트랜스포머 모델을 최종 선택했습니다. - 아이템 단위 예측은 하위 단계의 랭킹 모델이 처리해야 할 후보군 수를 최적화함으로써 시스템의 확장성을 높이고 사용자 만족도를 증진시키는 역할을 합니다. 단순한 인구통계학적 타겟팅에서 벗어나 사용자의 실시간 행동 시퀀스를 반영하는 임베딩 기반 검색(Embedding-based Retrieval) 시스템을 구축하는 것이 대규모 커머스 플랫폼에서 광고 효율을 극대화하는 핵심 전략임을 보여줍니다. 특히 아이템 수가 기하급수적으로 늘어날수록 광고주 단위가 아닌 개별 상품 단위의 시퀀스 모델링이 필수적입니다.

woowahan원문

“함께 구매하면 좋은 상품” 추천 모델 고도화 | 우아한형제들 기술블로그 (새 탭에서 열림)

배달의민족은 장보기·쇼핑 서비스에서 고객의 구매 의도를 더욱 정확하게 파악하기 위해 기존의 단순 임베딩 유사도 기반 추천에서 벗어나 구매 맥락을 반영한 2단계 추천 모델로 고도화했습니다. 기존 모델의 한계였던 대체재 편향 문제와 시퀀스 정보의 부재를 해결하기 위해 그래프 기반 임베딩과 트랜스포머(Transformer) 아키텍처를 결합한 것이 핵심입니다. 이를 통해 고객이 장바구니에 담은 상품들의 순서와 관계를 학습하여, 단순 유사 상품이 아닌 실제 함께 구매할 가능성이 높은 보완재 중심의 추천 성과를 거두었습니다. ### 기존 Item2Vec 모델의 한계와 문제점 * **대체재 편향 발생**: 기존 모델은 주문 내 동시 출현 빈도를 기반으로 임베딩을 생성하여, 비슷한 구매 패턴을 가진 상품들이 가깝게 배치되었습니다. 이로 인해 우유를 담았을 때 시리얼 같은 보완재 대신 다른 브랜드의 우유가 추천되는 등 추천의 다양성이 떨어졌습니다. * **시퀀스 맥락 소실**: 상품을 장바구니에 담는 순서에는 고객의 의도가 담겨 있지만, 기존 방식은 단순히 '함께 있었다'는 정보만 활용했습니다. 예를 들어 '라면을 담고 고기를 추가한 경우'와 '고기를 담고 라면을 추가한 경우'의 차이를 구분하지 못해 정교한 추천이 어려웠습니다. * **크로스 셀링의 어려움**: 임베딩 유사도에만 의존하다 보니 동일 카테고리 내의 상품 추천에 치중하게 되었고, 장바구니 추천의 핵심 목표인 '다른 카테고리 상품 제안(Cross-selling)'을 달성하기에 한계가 있었습니다. ### Stage 1: 그래프 기반 상품 및 카테고리 임베딩 * **Node2Vec 도입**: 주문 빈도가 낮은 롱테일 상품의 데이터 희소성 문제를 해결하기 위해 Node2Vec을 활용했습니다. 이는 그래프 구조에서 Random Walk를 통해 상품 간의 구조적 관계를 효과적으로 학습하게 해줍니다. * **그래프 구조 설계**: 상품 노드와 카테고리 노드를 함께 구성했습니다. 특히 상품 간 연결(Edge)에는 단순 빈도가 아닌 '연관 규칙(Association Rule)' 기반의 가중치를 부여하여, 인기 상품에만 편중되지 않고 실제 연관성이 높은 상품들이 강하게 연결되도록 했습니다. * **콜드 스타트 방안**: 신규 상품이나 주문 이력이 적은 상품은 카테고리 노드와의 연결을 통해 초기 임베딩을 확보할 수 있도록 설계하여 시스템의 견고함을 높였습니다. ### Stage 2: Transformer 기반 시퀀스 추천 * **맥락 이해**: Stage 1에서 생성된 고품질의 임베딩을 입력값으로 사용하여, 트랜스포머 모델이 장바구니에 담긴 상품들의 순서(Sequence)를 분석합니다. * **다음 상품 예측(Next Item Prediction)**: 고객이 현재 장바구니에 담은 일련의 상품 리스트를 바탕으로, 다음에 담을 가능성이 가장 높은 상품을 예측하는 방식으로 학습을 진행했습니다. * **동적 추천 성능**: 이 과정을 통해 고객이 요리를 위해 재료를 담는 과정인지, 혹은 간식거리를 쇼핑하는 중인지 등의 실시간 맥락을 반영한 개인화된 추천이 가능해졌습니다. 단순히 "어떤 상품과 어떤 상품이 자주 팔리는가"를 넘어 "어떤 순서로 구매 결정이 이루어지는가"를 모델링하는 것이 추천 시스템 고도화의 핵심입니다. 그래프 임베딩을 통해 상품 간의 관계를 정의하고, 트랜스포머를 통해 고객의 시퀀스 맥락을 읽어내는 2단계 구조는 데이터 희소성 극복과 추천의 정확도라는 두 마리 토끼를 잡을 수 있는 실용적인 접근법이 될 수 있습니다.

google원문

Titans + MIRAS: AI (새 탭에서 열림)

Google Research가 발표한 Titans 아키텍처와 MIRAS 프레임워크는 기존 트랜스포머 모델의 연산 비용 문제를 해결하고 AI에게 강력한 장기 기억 능력을 부여하기 위한 혁신적인 접근법입니다. 이 기술들은 모델이 실행되는 도중에 실시간으로 핵심 메모리를 업데이트하는 '테스트 시간 암기(test-time memorization)' 기능을 통해, 오프라인 재학습 없이도 방대한 문맥을 신속하고 정확하게 처리할 수 있게 해줍니다. 결과적으로 RNN의 처리 속도와 트랜스포머의 정확도를 결합하여 문서 전체 이해나 유전체 분석과 같은 대규모 데이터 처리에 최적화된 성능을 제공합니다. **Titans: 신경망 기반의 장기 기억 모듈** * 인간의 뇌처럼 단기 기억(어텐션 메커니즘)과 장기 기억 모듈을 분리하여 구성합니다. * 기존 RNN이 고정된 크기의 벡터나 행렬을 사용하는 것과 달리, Titans는 다층 퍼셉트론(MLP)을 장기 기억 모듈로 사용하여 훨씬 높은 표현력을 가집니다. * 단순히 데이터를 기록하는 수준을 넘어, 입력된 전체 정보의 흐름을 이해하고 합성하여 장기적으로 유지할 수 있는 능력을 갖췄습니다. **놀라움 지표(Surprise Metric)를 활용한 실시간 학습** * 모델은 새로운 입력값과 현재 기억 사이의 차이를 계산하는 '놀라움 지표'를 통해 어떤 정보를 저장할지 능동적으로 결정합니다. * 예상 가능한 정보(낮은 놀라움)는 생략하고, 기존 패턴을 깨는 이례적이거나 중요한 정보(높은 놀라움)를 감지했을 때 내부 오차 신호(그래디언트)를 발생시켜 이를 장기 기억에 우선적으로 반영합니다. * '모멘텀(Momentum)' 기술을 통해 개별 토큰뿐만 아니라 문맥의 흐름을 파악하며, '적응형 가중치 감쇠(Adaptive weight decay)'를 통해 불필요해진 오래된 정보를 삭제하여 메모리 용량을 효율적으로 관리합니다. **MIRAS: 시퀀스 모델링의 통합 이론적 프레임워크** * MIRAS는 트랜스포머부터 최신 선형 RNN까지 모든 시퀀스 모델을 '연상 기억(associative memory)' 모듈로 간주하는 통합된 관점을 제시합니다. * 새로운 정보와 기존 기억을 결합할 때 핵심 개념을 잊지 않도록 설계하는 이론적 청사진 역할을 수행합니다. * 메모리 아키텍처, 어텐션 편향 등 네 가지 핵심 설계 선택지를 통해 다양한 모델 아키텍처를 일반화하고 성능을 최적화할 수 있는 기반을 제공합니다. 이러한 기술적 진보는 AI가 정적인 지식에 머물지 않고 데이터가 유입되는 즉시 학습하고 적응하는 역동적인 시스템으로 진화하고 있음을 보여줍니다. 대규모 컨텍스트 처리가 필요한 연구자나 개발자들에게 Titans와 MIRAS는 연산 효율성과 긴 문맥 유지라는 두 마리 토끼를 잡을 수 있는 실질적인 아키텍처 표준이 될 것으로 기대됩니다.

google원문

실시간 음성 대 음성 통 (새 탭에서 열림)

Google DeepMind는 원본 화자의 목소리를 유지하면서 단 2초의 지연 시간으로 실시간 통역이 가능한 혁신적인 엔드투엔드 음성 대 음성 번역(S2ST) 모델을 공개했습니다. 기존의 계층적 방식이 가졌던 높은 지연 시간과 개성 없는 음성 출력 문제를 해결하기 위해, 연구진은 스트리밍 아키텍처와 시계열 동기화 데이터 파이프라인을 결합했습니다. 이 기술은 언어 장벽을 넘어 원어민의 음색으로 즉각적인 소통을 가능하게 함으로써 더 자연스러운 원격 대화 환경을 제공합니다. ### 기존 계층적(Cascaded) S2ST의 한계 * 일반적인 실시간 번역 시스템은 음성 인식(ASR), 기계 번역(AST), 음성 합성(TTS)의 세 가지 개별 단계를 거치는 계층적 구조를 사용합니다. * 이러한 방식은 각 단계에서 발생하는 지연이 누적되어 결과적으로 4~5초 이상의 지연 시간이 발생하며, 이는 대화의 흐름을 끊고 턴제 대화를 강요하게 됩니다. * 또한 각 단계별로 오류가 누적될 위험이 크고, 일반적인 TTS를 사용하기 때문에 원본 화자의 목소리 특성을 살리지 못한다는 단점이 있습니다. ### 확장 가능한 시계열 동기화 데이터 파이프라인 * 원본 음성과 번역된 음성 간의 정확한 시점 일치를 위해 대규모 시계열 동기화 데이터 세트를 생성하는 새로운 파이프라인을 구축했습니다. * 강제 정렬(Forced Alignment) 알고리즘을 사용하여 오디오와 텍스트를 매핑하고, 기계 번역된 텍스트가 원본 오디오의 타이밍에 맞게 배치되도록 정밀하게 설계되었습니다. * 커스텀 TTS 엔진을 통해 원본 화자의 목소리 특성을 유지하면서 자연스러운 대상 언어 음성을 생성하며, 지연 시간 요건을 충족하지 못하는 데이터는 엄격한 필터링 과정을 통해 제외됩니다. ### 엔드투엔드 스트리밍 아키텍처 * 이 모델은 근본적인 트랜스포머 블록을 기반으로 하며, 실시간 처리에 최적화된 스트리밍 인코더와 디코더로 구성됩니다. * 스트리밍 인코더는 이전 10초간의 입력을 바탕으로 소스 오디오 데이터를 요약하며, 스트리밍 디코더는 압축된 상태 정보를 활용해 자기회귀(Autoregressive) 방식으로 번역된 음성을 예측합니다. * 오디오는 SpectroStream 코덱 기술을 통해 RVQ(Residual Vector Quantization) 토큰이라는 2차원 계층 구조로 표현되며, 이는 모델이 실시간 스트림 환경에서 음성 품질과 출력 시점을 효과적으로 결정할 수 있게 합니다. 이번 연구는 실시간 번역의 고질적인 문제였던 '지연 시간'과 '화자의 정체성 손실'을 동시에 해결했다는 점에서 큰 의미가 있습니다. 2초라는 짧은 지연 시간과 화자 고유의 음색 보존은 단순한 정보 전달을 넘어 정서적 연결이 필요한 비즈니스 미팅이나 개인적인 통화 환경에서 소통의 질을 획기적으로 높여줄 것으로 기대됩니다.

google원문

중첩 학습(Nested Learning) 소개 (새 탭에서 열림)

구글 리서치에서 발표한 중첩 학습(Nested Learning)은 머신러닝 모델을 단일한 최적화 과정이 아닌 서로 연결된 여러 층위의 최적화 문제로 재정의하여, 새로운 지식을 학습할 때 기존 지식을 잊어버리는 '치명적 망각(Catastrophic Forgetting)' 문제를 해결하고자 합니다. 이 패러다임은 모델의 아키텍처와 최적화 알고리즘을 별개의 요소가 아닌 정보 흐름과 업데이트 빈도가 다른 동일한 개념의 연장선으로 통합하여 관리합니다. 이를 통해 모델은 인간의 뇌처럼 신경 가소성을 발휘하며 실시간으로 지식을 습득하면서도 과거의 숙련도를 유지할 수 있는 강력한 연속 학습(Continual Learning) 능력을 갖추게 됩니다. ### 중첩 학습의 패러다임과 핵심 원리 * 중첩 학습은 복잡한 머신러닝 모델을 상호 연결된 다층적 최적화 문제의 집합으로 간주하며, 각 내부 문제마다 고유한 '문맥 흐름(Context Flow)'을 가집니다. * 연상 기억(Associative Memory) 관점에서 역전파(Backpropagation) 과정을 분석한 결과, 모델이 데이터 포인트를 로컬 오차 값에 매핑하는 학습 과정 자체가 일종의 기억 시스템임을 입증했습니다. * 트랜스포머의 어텐션 메커니즘 역시 토큰 간의 매핑을 학습하는 단순한 연상 기억 모듈로 공식화할 수 있으며, 이는 모델 구조와 최적화 규칙이 본질적으로 같다는 점을 시사합니다. * 각 구성 요소의 가중치가 조정되는 주기를 의미하는 '업데이트 빈도(Update Frequency Rate)'를 정의함으로써, 최적화 문제들을 여러 수준(Level)으로 서열화하고 제어할 수 있습니다. ### 딥 옵티마이저(Deep Optimizers)의 재구성 * 중첩 학습 관점에서는 모멘텀 기반 옵티마이저를 연상 기억 모듈로 취급할 수 있으며, 이를 통해 기존 최적화 알고리즘을 원칙적으로 개선할 수 있는 경로를 제공합니다. * 기존 옵티마이저들이 데이터 샘플 간의 관계를 충분히 고려하지 않는 단순 내적 유사도에 의존했다면, 중첩 학습은 이를 L2 회귀 손실(L2 regression loss) 기반의 목적 함수로 대체합니다. * 이러한 수식의 변화를 통해 데이터가 불완전하거나 노이즈가 섞인 상황에서도 모델이 더욱 견고하게 학습을 지속할 수 있는 새로운 모멘텀 공식을 도출했습니다. ### 연속적 메모리 시스템과 'Hope' 아키텍처 * 표준 트랜스포머가 단기 메모리로서 현재 문맥만 유지하는 한계를 극복하기 위해, 업데이트 빈도를 다르게 설정한 계층적 메모리 시스템을 적용했습니다. * 이 패러다임을 실제 검증하기 위해 설계된 자가 수정형 아키텍처 'Hope'는 기존 최첨단 모델들보다 언어 모델링 성능이 우수하며, 특히 긴 문맥(Long-context) 관리 능력에서 탁월한 성과를 보였습니다. * 인간의 뇌가 단기 기억을 장기 기억으로 전이시키는 것과 유사하게, 각 구성 요소의 업데이트 속도를 최적화함으로써 정보의 저장과 회상을 더욱 효율적으로 관리할 수 있습니다. 중첩 학습은 모델 아키텍처와 학습 알고리즘 사이의 가로막힌 벽을 허물고, 인공지능이 데이터를 학습하는 방식을 근본적으로 재설계할 수 있는 도구를 제공합니다. 특히 대규모 언어 모델(LLM)이 사전 학습된 정적 지식에 머물지 않고 실시간으로 지식을 확장해야 하는 상황에서, 중첩 학습 기반의 설계를 도입하면 치명적 망각 없이 지속 가능한 인공지능 시스템을 구축하는 데 큰 도움이 될 것입니다.