google4분 읽기

큐레이션 요약

머신 언러닝 감사를 위한 새로운 프레임워크

원문 읽기(새 탭에서 열림)

기계 언러닝이 실제로 특정 학습 데이터를 잊었는지 검증하려면, 모델의 내부 구조 대신 출력 샘플을 비교해야 한다. 기존 두 표본 검정은 대규모 모델의 미세한 정보 흔적을 놓치거나, 재학습 과정의 차이를 문제로 오인해 오탐을 낼 수 있다. Google Research는 이를 해결하기 위해 여러 f-발산과 커널 정규화를 결합한 상대적 거리 검정을 제안했으며, 표본 수가 늘어날수록 거짓 음성 위험이 0에 수렴하도록 설계했다.

기계 언러닝 검증의 필요성

  • 기계 언러닝은 모델을 처음부터 재학습하지 않고 특정 학습 데이터를 제거하는 기술이다.
  • GDPR의 ‘잊힐 권리’, AI 안전성, 모델 품질 관리 때문에 언러닝이 제대로 수행됐다는 수학적 검증이 중요해지고 있다.
  • 감사자는 모델 내부나 원본 학습 데이터에 접근하지 못하는 경우가 많으므로, 모델에 질의하고 생성된 출력 샘플을 분석해야 한다.
  • 일반적인 방법은 다음 두 모델의 출력을 비교하는 두 표본 검정이다.
    • 해당 데이터를 처음부터 학습하지 않은 모델
    • 해당 데이터를 잊었다고 주장하는 언러닝 모델
  • 두 출력 분포가 통계적으로 다르면 언러닝이 실패했다고 판단한다.

기존 두 표본 검정의 한계

  • 대규모 모델에서는 무작위 변동과 실제 데이터 의존성을 구분하기 위해 매우 많은 출력 샘플이 필요하다.
  • 샘플 수가 부족하면 실제 개인정보 유출이나 데이터 흔적을 발견하지 못하는 거짓 음성이 발생한다.
  • MMD(Maximum Mean Discrepancy)는 평균이나 전반적인 분포 변화 같은 전역적 차이를 잘 찾지만, 다음과 같은 국소적 변화에는 약할 수 있다.
    • 특정 프롬프트에서만 나타나는 개인 데이터 관련 이상 출력
    • 드문 이상치
    • 비매끄럽거나 복잡한 분포 차이
  • 연구자가 검정 통계량, 커널 대역폭, 정규화 매개변수 등을 직접 선택해야 하므로 설정이 어렵고 오류가 발생하기 쉽다.
  • 재학습 모델 자체도 학습 배치 크기나 학습 순서가 다르면 원래 모델과 다른 출력 분포를 만들 수 있다.
    • 이 경우 언러닝 모델이 안전하게 동작하더라도 단순 비교 검정은 차이를 데이터 잔존 흔적으로 잘못 판단할 수 있다.
  • 표준적인 국소 언러닝 알고리즘은 학습 과정을 모두 되짚지 않기 때문에 데이터의 영향을 완벽히 제거하기 어렵다.
    • 따라서 ‘처음부터 재학습한 모델과 완전히 동일한 분포’를 요구하면 정상적인 언러닝도 실패로 판정될 수 있다.

상대적 거리 기반 검정 프레임워크

  • 제안된 방법은 언러닝 모델이 어느 쪽에 더 가까운지를 비교한다.
    • 안전하게 재학습한 모델
    • 원래의 손상된 모델
  • 즉, 언러닝 모델이 재학습 모델에 더 가까운지를 평가해 단순한 분포 차이보다 언러닝의 방향성을 검증한다.
  • 이 방식은 단일 기준 모델과의 동일성만 요구하지 않으므로 재학습 과정에서 생기는 자연스러운 변동에 더 강하다.
  • 프레임워크의 핵심은 Regularized f-Divergence Kernel Tests다.
    • f-발산을 활용해 다양한 유형의 분포 차이를 표현한다.
    • 커널 정규화로 고차원 데이터에서 발산을 효율적으로 추정한다.
    • 통계적 검정 과정에서 거짓 양성을 통제하도록 설계됐다.
    • 표본 수가 증가하면 거짓 음성 위험이 0에 안정적으로 수렴한다.

다양한 f-발산의 활용

  • 카이제곱 발산과 KL 발산
    • 매끄러운 분포 변화나 국소적인 이상을 탐지하는 데 적합하다.
    • 특정 데이터가 모델 출력에 드문 이상치를 유발하는 상황을 포착할 수 있다.
  • Hockey-stick 발산
    • 프라이버시와 언러닝의 정의에 직접적으로 활용할 수 있다.
    • 통계적 비식별성의 허용 수준을 매개변수로 설정한다.
    • 안전 예산 이하의 사소한 차이는 무시하고, 의미 있는 개인정보 노출만 경고하도록 만들 수 있다.
  • 기존 방식과 달리 검정에 적합한 발산과 하이퍼파라미터를 자동으로 선택한다.
  • 이 적응형 선택은 연구자가 검정 방식을 일일이 고르는 부담을 줄이며, 표본 분할 없이 수행된다.

실험과 적용 분야

  • 제안 방법은 다양한 문제에서 평가됐다.
    • 합성 데이터인 perturbed uniform 두 표본 벤치마크
    • 물리학 데이터의 Expo1D 이상치 탐지
  • 고에너지 물리학 데이터는 표준 모형에서 벗어난 매우 희귀한 입자처럼 미세한 차이를 찾아야 하므로, 개인정보 유출 탐지 성능을 시험하기에 적합한 사례로 사용됐다.
  • 차등 프라이버시 감사
    • 한 레코드만 다른 두 데이터셋에 비공개 메커니즘을 적용한다.
    • 진정한 차등 프라이버시라면 두 출력 표본이 통계적으로 구별되지 않아야 한다.
    • 차이가 검출되면 단일 레코드의 영향이 과도하게 남아 있는 것으로 판단할 수 있다.
  • 기계 언러닝 평가
    • 안전한 재학습 모델과 언러닝 모델만 단순 비교하는 대신, 세 표본 상대 검정을 사용한다.
    • Selective Synaptic Dampening, 가지치기(pruning), 무작위 라벨링 등 여러 언러닝 알고리즘에 적용했다.
  • 제공된 글은 실험 결과 설명이 “unlearned model d...”에서 중단되어 있어, 각 알고리즘의 구체적인 성능 수치나 최종 결론은 확인할 수 없다.

실용적인 결론

기계 언러닝을 감사할 때는 “언러닝 모델이 재학습 모델과 완전히 같은가”보다 “원본 모델보다 안전한 재학습 모델에 통계적으로 더 가까운가”를 평가하는 것이 현실적이다. 특히 개인정보 보호 감사나 희귀한 국소 이상 탐지처럼 작은 분포 변화가 중요한 경우, f-발산과 커널 정규화를 결합한 적응형 상대 검정이 기존 MMD 중심 접근보다 적합할 수 있다.

큐레이션 요약을 이어서 읽어보세요.