DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
KOEN
Read Original

Contents

Continue Reading

  • More from Airbnb
#Backend

프로젝트 라이트하우스 3부 — project-lighthouse-anonymize를 소개합니다

프로젝트 라이트하우스 3부 — project-lighthouse-anonymize를 소개합니다
01

Summary

에어비앤비의 대규모 데이터 익명화 엔진 전격 오픈소스 공개!

몬드리안 알고리즘의 확장판과 정량화된 품질 평가지표로 프라이버시와 데이터 유용성을 한 번에 잡는 비결을 공개합니다.

이 아티클은 에어비앤비가 차별 방지 통계 분석을 위해 설계한 라이브러리인 `project-lighthouse-anonymize`와 그 이면의 핵심 프라이버시 엔지니어링 기술을 조명합니다. 클래식 몬드리안 알고리즘을 현대 대규모 파이프라인에 맞게 최적화한 Core Mondrian 기술의 아키텍처와 함께 익명화된 데이터가 과연 쓸모 있는지 수학적으로 입증하는 품질 검증 프레임워크를 다룹니다.

  • 01전략 패턴과 하이브리드 재귀 큐를 결합해 대규모 분산 처리가 가능한 Core Mondrian 알고리즘 도입
  • 02간단한 파이썬 API 호출만으로 k-익명성 및 p-민감 k-익명성 비식별 처리 파이프라인 구축 가능
  • 03익명화 과정에서의 정보 유실률과 엔트로피를 측정하는 RILM 및 NMIv1 품질 지표 제시
  • 04실제 머신러닝 분류 모델링을 통해 익명 데이터의 분석 유효성을 역검증하는 방법론 공유

+RECOMMENDATION

민감 데이터나 개인정보를 안전하게 마스킹하면서도 통계적 분석 성과를 극대화하고 싶은 데이터 아키텍트 및 프라이버시 보호 전담 엔지니어들에게 적극 추천합니다.

The Problem

에어비앤비는 플랫폼 내 차별을 측정하기 위해 사용자 인지 인종 데이터를 안전하게 다루어야 했으나, 민감한 개인 정보를 계정에 연동하지 않으면서도 대규모 통계 분석에 필요한 데이터의 유용성을 유지해야 하는 까다로운 한계에 부딪혔습니다.

The Solution

기존의 몬드리안 알고리즘을 확장해 하이브리드 재귀 큐 기반의 대규모 병렬 처리를 가능하게 한 '코어 몬드리안' 알고리즘과 익명화 후 데이터 품질을 다각도로 검증할 수 있는 평가 지표 체계를 구축하여 파이썬 라이브러리로 오픈소스화했습니다.

The Result

이 조치를 통해 k-익명성 및 p-민감 k-익명성 데이터 보호 모델을 편리하게 연쇄 적용할 수 있게 되었으며, 피어슨 상관관계, RILM, NMIv1 지표 및 ML 분류 모델 검증 기법을 결합하여 분석 데이터의 통계적 신뢰성을 크게 보장했습니다.

Trade-off

대규모 분산 환경에서 완벽한 k-익명성을 확보하기 위해 특정 변수나 데이터 레코드가 억제(Suppression)되거나 원본 대비 일정 부분의 기하학적 정보 유실이 일어나는 페널티를 감수해야 합니다.

03

Key Concepts

Concept · 01

k-익명성 (k-Anonymity)

공개된 데이터셋에서 동일한 속성을 가진 개인이 최소 k명 이상 존재하도록 조치하여 특정 개인의 식별 가능성을 방지하는 대표적인 프라이버시 보호 프레임워크입니다.

  • 에어비앤비 플랫폼 이용자 분석 시 인지 인종 데이터와 같은 민감 속성의 원천 노출을 제한하기 위해 활용되었습니다.
Concept · 02

코어 몬드리안 알고리즘 (Core Mondrian Algorithm)

기존의 top-down 다차원 공간 분할 방식인 몬드리안 알고리즘을 확장해 병렬 처리 및 동적 값 억제를 적용할 수 있도록 에어비앤비가 개선한 핵심 익명화 엔진입니다.

  • 재귀 및 큐 기반 병렬화 처리를 결합해 실 대용량 상용 데이터 환경에서도 막힘없는 성능 확장을 실현했습니다.
Concept · 03

개선 정보 손실 지표 (RILM, Revised Information Loss Metric)

익명화를 진행한 후의 가공 데이터가 원본 데이터의 기하학적 형태나 크기를 얼마나 훼손했는지 측정하는 수학적 평가지표입니다.

  • 익명화 완료 상태가 비즈니스 데이터 과학 연구나 차별성 측정에 필요한 정확도를 충족하는지 자가 판단할 수 있도록 돕는 최소 임계값의 지표로 채택되었습니다.
Continue reading · same source

AirbnbMore from Airbnb

View all posts from Airbnb
  • 코로나19의 종식을 알게 된 방법 (그리고 우리 모델이 잊어야 했던 것들)

    ForecastingBayesian MethodsMachine Learning
    1주 전
  • 유연한 인증(Flexible Authentication): 에어비앤비의 수백만 사용자를 위한 인증 시스템 재설계

    Server-Driven UIAuthenticationMobile Architecture
    2주 전
  • 평가 주도 개발: 대규모 GenAI 평가를 통해 얻은 교훈

    LLM EvaluationGenerative AIEval-Driven Development
    1개월 전
  • 게스트 여정 학습을 통한 에어비앤비 검색 개인화

    TransformerRecommendationSearch Personalization
    1개월 전
  • 몇 주에서 단 하루로: LLM 평가를 빠르게 반복 가능하도록 개선한 방법

    LLM EvaluationLoRACaching
    1개월 전

Source

Airbnb
Airbnb
Engineering Blog

Published · August 25, 2026

Topics

Data PrivacyAnonymizationPythonk-AnonymityMondrian Algorithm