f-divergence

1 개의 포스트

google4분 읽기큐레이션 요약

머신 언러닝 감사를 위한 새로운 프레임워크

기계 언러닝이 실제로 특정 학습 데이터를 잊었는지 검증하려면, 모델의 내부 구조 대신 출력 샘플을 비교해야 한다. 기존 두 표본 검정은 대규모 모델의 미세한 정보 흔적을 놓치거나, 재학습 과정의 차이를 문제로 오인해 오탐을 낼 수 있다. Google Research는 이를 해결하기 위해 여러 f-발산과 커널 정규화를 결합한 상대적 거리 검정을 제안했으며, 표본 수가 늘어날수록 거짓 음성 위험이 0에 수렴하도록 설계했다. ## 기계 언러닝 검증의 필요성 - 기계 언러닝은 모델을 처음부터 재학습하지 않고 특정 학습 데이터를 제거하는 기술이다. - GDPR의 ‘잊힐 권리’, AI 안전성, 모델 품질 관리 때문에 언러닝이 제대로 수행됐다는 수학적 검증이 중요해지고 있다. - 감사자는 모델 내부나 원본 학습 데이터에 접근하지 못하는 경우가 많으므로, 모델에 질의하고 생성된 출력 샘플을 분석해야 한다. - 일반적인 방법은 다음 두 모델의 출력을 비교하는 두 표본 검정이다. - 해당 데이터를 처음부터 학습하지 않은 모델 - 해당 데이터를 잊었다고 주장하는 언러닝 모델 - 두 출력 분포가 통계적으로 다르면 언러닝이 실패했다고 판단한다. ## 기존 두 표본 검정의 한계 - 대규모 모델에서는 무작위 변동과 실제 데이터 의존성을 구분하기 위해 매우 많은 출력 샘플이 필요하다. - 샘플 수가 부족하면 실제 개인정보 유출이나 데이터 흔적을 발견하지 못하는 거짓 음성이 발생한다. - MMD(Maximum Mean Discrepancy)는 평균이나 전반적인 분포 변화 같은 전역적 차이를 잘 찾지만, 다음과 같은 국소적 변화에는 약할 수 있다. - 특정 프롬프트에서만 나타나는 개인 데이터 관련 이상 출력 - 드문 이상치 - 비매끄럽거나 복잡한 분포 차이 - 연구자가 검정 통계량, 커널 대역폭, 정규화 매개변수 등을 직접 선택해야 하므로 설정이 어렵고 오류가 발생하기 쉽다. - 재학습 모델 자체도 학습 배치 크기나 학습 순서가 다르면 원래 모델과 다른 출력 분포를 만들 수 있다. - 이 경우 언러닝 모델이 안전하게 동작하더라도 단순 비교 검정은 차이를 데이터 잔존 흔적으로 잘못 판단할 수 있다. - 표준적인 국소 언러닝 알고리즘은 학습 과정을 모두 되짚지 않기 때문에 데이터의 영향을 완벽히 제거하기 어렵다. - 따라서 ‘처음부터 재학습한 모델과 완전히 동일한 분포’를 요구하면 정상적인 언러닝도 실패로 판정될 수 있다. ## 상대적 거리 기반 검정 프레임워크 - 제안된 방법은 언러닝 모델이 어느 쪽에 더 가까운지를 비교한다. - 안전하게 재학습한 모델 - 원래의 손상된 모델 - 즉, 언러닝 모델이 재학습 모델에 더 가까운지를 평가해 단순한 분포 차이보다 언러닝의 방향성을 검증한다. - 이 방식은 단일 기준 모델과의 동일성만 요구하지 않으므로 재학습 과정에서 생기는 자연스러운 변동에 더 강하다. - 프레임워크의 핵심은 **Regularized f-Divergence Kernel Tests**다. - f-발산을 활용해 다양한 유형의 분포 차이를 표현한다. - 커널 정규화로 고차원 데이터에서 발산을 효율적으로 추정한다. - 통계적 검정 과정에서 거짓 양성을 통제하도록 설계됐다. - 표본 수가 증가하면 거짓 음성 위험이 0에 안정적으로 수렴한다. ## 다양한 f-발산의 활용 - **카이제곱 발산과 KL 발산** - 매끄러운 분포 변화나 국소적인 이상을 탐지하는 데 적합하다. - 특정 데이터가 모델 출력에 드문 이상치를 유발하는 상황을 포착할 수 있다. - **Hockey-stick 발산** - 프라이버시와 언러닝의 정의에 직접적으로 활용할 수 있다. - 통계적 비식별성의 허용 수준을 매개변수로 설정한다. - 안전 예산 이하의 사소한 차이는 무시하고, 의미 있는 개인정보 노출만 경고하도록 만들 수 있다. - 기존 방식과 달리 검정에 적합한 발산과 하이퍼파라미터를 자동으로 선택한다. - 이 적응형 선택은 연구자가 검정 방식을 일일이 고르는 부담을 줄이며, 표본 분할 없이 수행된다. ## 실험과 적용 분야 - 제안 방법은 다양한 문제에서 평가됐다. - 합성 데이터인 perturbed uniform 두 표본 벤치마크 - 물리학 데이터의 Expo1D 이상치 탐지 - 고에너지 물리학 데이터는 표준 모형에서 벗어난 매우 희귀한 입자처럼 미세한 차이를 찾아야 하므로, 개인정보 유출 탐지 성능을 시험하기에 적합한 사례로 사용됐다. - **차등 프라이버시 감사** - 한 레코드만 다른 두 데이터셋에 비공개 메커니즘을 적용한다. - 진정한 차등 프라이버시라면 두 출력 표본이 통계적으로 구별되지 않아야 한다. - 차이가 검출되면 단일 레코드의 영향이 과도하게 남아 있는 것으로 판단할 수 있다. - **기계 언러닝 평가** - 안전한 재학습 모델과 언러닝 모델만 단순 비교하는 대신, 세 표본 상대 검정을 사용한다. - Selective Synaptic Dampening, 가지치기(pruning), 무작위 라벨링 등 여러 언러닝 알고리즘에 적용했다. - 제공된 글은 실험 결과 설명이 “unlearned model d...”에서 중단되어 있어, 각 알고리즘의 구체적인 성능 수치나 최종 결론은 확인할 수 없다. ## 실용적인 결론 기계 언러닝을 감사할 때는 “언러닝 모델이 재학습 모델과 완전히 같은가”보다 “원본 모델보다 안전한 재학습 모델에 통계적으로 더 가까운가”를 평가하는 것이 현실적이다. 특히 개인정보 보호 감사나 희귀한 국소 이상 탐지처럼 작은 분포 변화가 중요한 경우, f-발산과 커널 정규화를 결합한 적응형 상대 검정이 기존 MMD 중심 접근보다 적합할 수 있다.

원문 읽기(새 탭에서 열림)