DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
Read Original

Contents

Continue Reading

  • More from 채널 톡
  • Related reads#LLM
#AI

채널톡이 글로벌 상담 Agent를 GPT-5.6 Luna로 갈아탄 이유

채널톡이 글로벌 상담 Agent를 GPT-5.6 Luna로 갈아탄 이유
01

Summary

비용은 1/13로 줄이고 해결률은 10%p 올렸다! 채널톡의 AI 에이전트 모델 세대교체기

무조건 값비싼 모델이 정답일까? 자체 벤치마크로 가성비 LLM의 숨겨진 잠재력을 200% 끌어내는 엔지니어링 전략

매번 새롭게 쏟아지는 신규 모델 앞에서 어떤 기준으로 모델을 교체해야 할지 고민하는 개발자들을 위한 글입니다. 공개 벤치마크 점수에 의존하지 않고, 실제 프로덕션 워크로드 위에서 비용과 레이턴시, 품질의 최적화 지점을 찾아 GPT-5.6 Luna를 메인 에이전트 모델로 성공적으로 이식한 채널톡의 실전 노하우를 공유합니다.

  • 01공개 리더보드의 고득점 모델이 실제 멀티턴 고객 상담 환경에서는 오동작할 수 있음을 실험적으로 증명
  • 02정보 노출 차단, 지시 준수, 액션 충실성 등 AI 에이전트에 특화된 5대 핵심 능력 지표 정의
  • 03과거 발생했던 장애의 재발을 확실히 잡아내는 '회귀 방지 데이터셋(Regression Set)'의 중요성 강조
  • 04동일한 모델 내에서도 Reasoning Effort 옵션을 세분화하여 영역별로 최적의 비용 대비 성능 최적화 달성
  • 05단순 모델 성능 비교를 넘어 테스트베드 선배포부터 점진적 배포 및 A/B 테스트로 이어지는 체계적인 파이프라인 소개

+RECOMMENDATION

LLM 기반 AI 에이전트를 실무 프로덕션에 서비스하면서 잦은 모델 업데이트와 비용 트레이드오프 문제로 고민하고 있는 AI 엔지니어 및 테크 리더에게 강력하게 추천합니다.

The Problem

글로벌 상담 AI 에이전트인 ALF의 메인 모델을 선정함에 있어 공개 리더보드 점수만으로는 멀티턴 대화, 지시 준수, 레이턴시, 비용 등 실제 현장 요구 사양을 검증하기 어려웠습니다. 특히 저렴한 가성비 모델이 출시되어도 품질 저하나 과거 해결된 버그의 재발(회귀) 우려 때문에 프로덕션 적용 여부를 객관적으로 판단할 기준이 부족했습니다.

The Solution

채널톡은 단순 API 호출이 아닌 실제 에이전트 엔진(지식 검색, 툴 호출, 워크플로우 포함) 위에서 작동하는 자체 다차원 벤치마크를 구축했습니다. 이를 통해 정보 노출 방지, 단계별 동작 등 5가지 에이전트 능력 지표와 대표 시나리오 통과율, 회귀 방지 통과율, 비용 및 레이턴시를 종합적으로 측정하여 후보 모델들을 단계적으로 필터링했습니다.

The Result

검증 결과, GPT-5.6 Luna(high effort) 모델을 메인 답변 생성에 최종 선정하였습니다. 기존 메인 모델인 Claude Sonnet 4.6 대비 대표 케이스 통과율은 40.4%에서 51.8%로 상승했고 회귀 방지 통과율은 71.4%로 안정적으로 유지하면서도, 실행 비용은 약 13분의 1 수준으로 혁신적으로 절감했습니다.

Trade-off

GPT-5.6 Luna가 모든 테스트 케이스에서 기존 Sonnet 모델을 완벽히 능가하는 것은 아니며 일부 역전 케이스가 존재합니다. 또한 모델들의 지능이 발전함에 따라 자체 구축한 평가 데이터셋에서 만점 비중이 늘어나 벤치마크의 변별력이 포화되는 한계가 발생하여 지속적인 고난도 케이스 보강이 필요해졌습니다.

03

Key Concepts

Concept · 01

자체 벤치마크 (Custom Benchmark)

공개 리더보드의 성능 지표 대신 실제 비즈니스의 트래픽 분포, 프롬프트 규칙, 통합 툴 호출 환경을 그대로 반영하여 최적의 모델을 평가하는 테스트 프레임워크입니다.

  • 실제 ALF 엔진 위에서 지식 검색과 툴 콜, 태스크 실행 과정을 생략 없이 원본 그대로 수행하며 성능을 측정했습니다.
  • LLM의 확률적 특성을 고려하여 각 테스트 케이스를 k회 반복 실행하는 pass^k 판정 기법을 도입했습니다.
Concept · 02

회귀 방지 케이스 (Regression Set)

과거 서비스 운영 중 실제 발생했던 장애나 엣지 케이스들을 재현한 테스트 데이터셋으로, 신규 모델 도입 시 기존에 해결되었던 버그가 다시 발생하지 않는지 검증합니다.

  • 기존 메인 모델인 Claude Sonnet 4.6이 기록했던 회귀 방지 통과율 70.1%를 넘어서는 모델만을 최종 후보로 선별하는 필터로 활용했습니다.
  • 대표 케이스 통과율이 높더라도 회귀 방지 통과율이 기준치 미달인 후보들을 정확하게 걸러냈습니다.
Concept · 03

추론 에포트 (Reasoning Effort)

대규모 언어 모델이 최종 답변을 도출하기 전에 수행하는 생각의 깊이를 조절하는 매개변수로, 에포트가 올라갈수록 정확도는 높아지지만 시간과 비용도 함께 상승합니다.

  • GPT-5.6 Luna 모델에서 에포트 강도를 none, high, xhigh로 미세 조정하여 대표 케이스 통과율이 33.3%에서 53.5%까지 극적으로 개선되는 구간을 포착했습니다.
  • 실시간 상담 응답에는 비용 대비 고성능인 Luna high를 채택하고, RAG 등 레이턴시 민감 영역에는 더 낮은 effort를 차등 적용하는 최적화 구조를 설계했습니다.
Continue reading · same source

채널 톡More from 채널 톡

View all posts from 채널 톡
  • [신청 중] AI Product Frontiers: AI 시대, 최전선에서 방향을 만드는 사람들

    MeetupAI InfrastructureArtificial Intelligence
    1일 전
  • 채널콘 2026 디자인 비하인드

    FramerGenerative AILocalization
    2일 전
  • Swift 6 어때요? (1): 스레드, 블록, 태스크

    Swift ConcurrencyGCDRxSwift
    2일 전
  • 5년, 340개의 이야기로 이어온 개발 문화

    Developer RelationsKnowledge SharingEngineering Culture
    3일 전
  • 유저챗 개인정보 마스킹 개발기

    RegexRE2ReDoS
    4일 전

Related reads#LLM

Explore #LLM
올리브영·MCP

프롬프트를 쓰는 PM과 AI를 이해시키려는 개발자

#LLM1일 전
라인

LLM Wiki: 코드 기준으로 자동 최신화되는 도메인 지식 SSOT 만들기

#LLM2일 전
무신사

AI Native 조직은 도메인 지식을 어떻게 공유하는가

#LLM4일 전
여기어때·Grafana

SRE 업무에 AI 녹여내기 — 2편: Alert Adviser로 장애 원인 분석 자동화

#LLM6일 전
여기어때·SRE

SRE 업무에 AI 녹여내기 — 1편: Smart RI Calc로 인프라 비용 산정 자동화

#LLM6일 전

Source

채널 톡
채널 톡
Engineering Blog

Published · August 24, 2026

Topics

LLMAI AgentBenchmarkingGPT-5.6 LunaClaude Sonnet