DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
Read Original

Contents

Continue Reading

  • More from NAVER D2
  • Related reads#VictoriaMetrics
#Backend

네이버 검색의 대규모 메트릭 저장소, VictoriaMetrics 운영기

네이버 검색의 대규모 메트릭 저장소, VictoriaMetrics 운영기
01

Summary

555조 개의 데이터포인트를 무중단으로 옮기는 법: 네이버 검색의 VictoriaMetrics 운영기

1.25억 시계열의 파도를 견디는 대규모 TSDB 아키텍처와 시니어 엔지니어의 무중단 장비 교체 전략

네이버 검색의 폭발적인 인프라 성장을 뒷받침하는 대규모 시계열 데이터베이스(TSDB) 운영 경험을 공유합니다. 180대 규모의 VictoriaMetrics 클러스터를 운영하며 직면한 메모리 한계를 해결하기 위해, 분산 알고리즘의 내부 동작을 역이용한 지혜로운 무중단 마이그레이션 기법과 효율적인 Hot/Warm 계층화 구조를 다룹니다.

  • 0112.5억 활성 시계열과 555조 데이터포인트를 관리하는 국내 최대 규모의 VictoriaMetrics 운영 사례
  • 02데이터포인트당 0.92바이트라는 경이로운 압축 효율을 실운영 환경에서 입증
  • 03랑데부 해싱(Rendezvous Hashing)의 특성을 활용해 기존 노드 부하를 최소화한 '역순 장비 추가' 전략
  • 04SSD(Hot)와 HDD(Warm)를 조합한 2계층 아키텍처로 쿼리 성능과 스토리지 비용의 최적 균형 달성
  • 05API 호출 한계를 극복하기 위해 vmbackup/vmrestore 증분 복제를 활용한 테라바이트급 데이터 무중단 이관

+RECOMMENDATION

대규모 분산 저장소의 인프라 확장이나 무중단 마이그레이션을 준비하는 백엔드 및 SRE 엔지니어에게 강력히 추천합니다. 특히 VictoriaMetrics의 내부 샤딩 원리를 실무에 어떻게 적용할 수 있는지에 대한 깊이 있는 통찰을 제공합니다.

The Problem

네이버 검색 인프라의 쿠버네티스 전환으로 컨테이너 수가 수백만 개로 폭증하며 메트릭 카디널리티가 급증했고, 이로 인해 기존 128GB 메모리 사양의 저장소 노드들이 OOM 위험과 쿼리 지연 문제에 직면했습니다.

The Solution

180대 규모의 vmstorage 장비를 512GB로 업그레이드하기 위해 Hot Tier에는 랑데부 해싱과 복제 메커니즘을 고려한 '역순 장비 추가' 전략을, Warm Tier에는 vmbackup/vmrestore를 이용한 파일 시스템 수준의 증분 복제 및 세트 단위 점진 전환 방식을 적용했습니다.

The Result

서비스 중단과 메트릭 누락 없이 장비 교체를 완수했으며, 12.5억 개의 활성 시계열과 555조 개의 데이터포인트를 관리하는 환경에서 초당 500건 이상의 쿼리를 p99 300ms 이내의 속도로 안정적으로 처리하고 있습니다.

Trade-off

Hot/Warm 2계층 분리 구조를 통해 비용 효율성을 높였으나 이중 쓰기 및 조회 분기 로직의 관리 복잡성이 증가했으며, 무중단 전환 과정에서 일정 기간 기존 장비와 신규 장비를 동시에 운영하는 리소스 비용이 발생했습니다.

03

Key Concepts

Concept · 01

VictoriaMetrics

Prometheus와 호환되는 고성능 오픈소스 시계열 데이터베이스로, 높은 압축 효율과 독립적인 수평 확장이 가능한 컴포넌트 구조를 가집니다.

  • 네이버 검색의 수만 대 물리 서버와 수백만 개 컨테이너 메트릭을 초당 2,000만 포인트 속도로 수집
  • vminsert, vmstorage, vmselect 구조로 설계되어 각 영역별 독립적인 리소스 확장이 용이함
Concept · 02

랑데부 해싱 (Rendezvous Hashing)

노드가 추가되거나 제거될 때 데이터 재배치를 최소화하는 분산 알고리즘으로, 각 키에 대해 모든 노드의 가중치를 계산하여 대상 노드를 결정합니다.

  • vminsert가 시계열 데이터를 특정 vmstorage 노드에 샤딩하여 할당하는 원리로 사용됨
  • 노드 추가 시 전체 키를 재배치하지 않고 일부만 새 노드로 이동시켜 Churn Rate 부하를 분산함
Concept · 03

Hot/Warm 2-Tier Architecture

데이터의 신선도와 접근 빈도에 따라 저장 매체와 보관 주기를 분리하여 운영하는 계층형 저장 구조입니다.

  • 최근 12개월 데이터는 SSD 기반 Hot 클러스터에 저장하여 전체 조회의 99.9%를 고성능으로 처리
  • 장기 보관용 36개월 데이터는 HDD 기반 Warm 클러스터에 저장하여 스토리지 비용을 획기적으로 절감
Continue reading · same source

NAVER D2More from NAVER D2

View all posts from NAVER D2
  • 우리 팀만의 vLLM 플러그인 만들기 2편 - 모델 변환부터 배포까지 AI-native로 자동화하기

    vLLMGitOpsClaude Code
    2주 전
  • 우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기

    vLLMModel ServingMLOps
    2주 전
  • FE News 26년 8월 소식을 전해드립니다.

    CSSWeb PerformanceVite
    3주 전
  • [AI 해커톤 후기] AI 해커톤 1위 팀이 AI에게 맡기지 않은 것

    LLMMCPSoftware Architecture
    1개월 전
  • VictoriaMetrics 운영기 2편 — 장비 증설 없이 리소스 위기를 해결한 3단계 최적화 전략

    VictoriaMetricsTSDBQuery Performance
    1개월 전

Related reads#VictoriaMetrics

Explore #VictoriaMetrics
NAVER D2

VictoriaMetrics 운영기 2편 — 장비 증설 없이 리소스 위기를 해결한 3단계 최적화 전략

#VictoriaMetrics1개월 전
NAVER D2

Inside VictoriaMetrics

#VictoriaMetrics2개월 전
Airbnb·OpenTelemetry

OpenTelemetry와 vmagent를 이용한 고대역폭 메트릭 파이프라인 구축

#VictoriaMetrics4개월 전

Source

NAVER D2
NAVER D2
Engineering Blog

Published · April 22, 2026

Topics

VictoriaMetricsTSDBRendezvous HashingData MigrationHigh Availability