DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
Read Original

Contents

Continue Reading

  • More from SSG
  • Related reads#DeepLearning
#AI

낯선 오타와 싸워서 이기고 싶은 마음

낯선 오타와 싸워서 이기고 싶은 마음
01

Summary

"렌스"를 "렌즈"로 바꾸는 기술, SSG.COM의 딥러닝 오타 보정 도전기

단순 오타 교정을 넘어 문맥을 읽는 번역 모델로 검색 경험을 혁신하다

이커머스 검색에서 오타는 고객 이탈을 유발하는 치명적인 요소입니다. SSG.COM은 기존 룰 기반 시스템의 한계를 극복하기 위해 딥러닝 번역 모델을 도입했으며, 학습 데이터 부족과 할루시네이션이라는 까다로운 기술적 난관을 멀티태스크 학습과 정교한 안전장치로 해결하며 검색 효율을 높였습니다.

  • 01데이터 증강을 통해 수동 레이블링 없이 대규모 오타-정타 학습셋 구축
  • 02맥락을 파악하지 못하는 모델의 한계를 멀티태스크 학습으로 보완
  • 03할루시네이션 방지를 위한 편집 거리 기반의 기각 로직 적용
  • 04검색 실패율 개선 및 보조 검색 시스템의 부하 감소 달성
  • 05실무적인 관점에서의 모델 서빙 및 운영 전략 제시

+RECOMMENDATION

검색 결과의 정확도와 커버리지를 동시에 잡고 싶은 검색 엔진 엔지니어나, 실무 환경에서 딥러닝 모델의 할루시네이션을 제어하는 방법론이 궁금한 NLP 개발자에게 강력히 추천합니다.

The Problem

기존의 로그 기반 오타 보정 시스템은 실제 검색 실패 후 재검색된 기록을 매칭하는 사후 대응 방식이었기 때문에, 데이터가 충분하지 않은 새로운 오타 패턴에 대해서는 커버리지가 매우 낮고 검색 실패가 지속되는 한계가 있었습니다.

The Solution

딥러닝 기반 번역 모델을 도입하여 정타 검색어로부터 오타를 생성하는 데이터 증강 기법을 적용했으며, 모델의 할루시네이션 문제를 해결하기 위해 멀티태스크 학습(검색어-상품명 추론 등)과 편집 거리 기반 필터링 로직을 안전장치로 구축했습니다.

The Result

검색 실패율이 0.3%p 감소하고 검색 실패를 정타로 치환함으로써 벡터 검색 의존도를 3.4%p 낮추었으며, 보정된 검색 결과의 클릭률(CTR) 또한 기존 정타 검색과 유사한 수준을 유지하는 성과를 거두었습니다.

Trade-off

딥러닝 모델의 특성상 의도치 않은 오보정(False Positive) 위험이 상존하여 이를 제어하기 위한 수동 필터링 로직과 운영 관리 포인트가 추가되었으며, 실시간 추론을 위한 GPU 리소스 비용이 수반되었습니다.

03

Key Concepts

Concept · 01

멀티태스크 학습 (Multitask Learning)

하나의 모델이 여러 관련 작업을 동시에 학습하여 공통된 특징을 공유하고 전체적인 일반화 성능을 향상시키는 기법입니다.

  • 검색어를 상품명이나 카테고리로 추론하는 부가적인 과업을 학습에 포함
  • 단순 문자 치환을 넘어 검색어 간의 의미적 맥락을 파악할 수 있도록 유도
Concept · 02

편집 거리 (Edit Distance)

한 문자열을 다른 문자열로 변환하기 위해 필요한 삽입, 삭제, 수정의 최소 횟수를 나타내는 척도입니다.

  • 기존 로그 기반 시스템에서 정타와 오타 쌍을 추출하는 필터로 사용
  • 딥러닝 모델의 출력값이 원본 검색어와 너무 다를 경우 결과에서 제외하는 안전장치로 활용
Concept · 03

할루시네이션 (Hallucination)

언어 모델이 주어진 입력에 대해 사실과 다르거나 문맥에 전혀 맞지 않는 결과물을 생성하는 현상입니다.

  • 입력된 검색어와 관련 없는 단어로 오보정하는 문제를 해결하기 위해 가드레일 로직 구축
  • 맥락 정보를 주입하는 학습 방식과 수치적 제약 조건을 결합하여 대응
Continue reading · same source

SSGMore from SSG

View all posts from SSG
  • 돌아오지 않는 메모리를 찾아서

    JVMKubernetesG1GC
    1개월 전
  • 이상적인 구조가 빠른 성능은 아닙니다

    MongoDBAPI PerformanceData Modeling
    2개월 전
  • 쓱닷컴이 접근성을 대하는 방식

    AccessibilityWAI-ARIADesign System
    2개월 전
  • “장보기 지원금이 곧 소멸돼요” 알림 뒤에서 일어난 일

    Spring BatchDatabase ConnectionResource Optimization
    3개월 전
  • “왜 노출이 안 될까?”를 한 번에 추적하는 방법

    MSADistributed TracingKafka
    5개월 전

Related reads#DeepLearning

Explore #DeepLearning
여기어때·LLM Agents

코드를 거의 타이핑하지 않고 3주 만에 DL모델 만들기

#DeepLearning2주 전
토스·Computer Vision

얼굴 인식의 역사와 페이스페이의 미래

#DeepLearning2개월 전
Samsung Tech·6G

6G를 위한 AI/ML 물리계층 – JSCM 기반 오디오 전송

#DeepLearning3개월 전

Source

SSG
SSG
Engineering Blog

Published · April 23, 2026

Topics

Deep LearningNLPTranslation ModelSearch EngineMulti-task Learning