
단순한 프롬프트를 넘어 정량적인 테스트 하네스로 AI 에이전트의 스킬 호출 성공률을 극대화하는 법
Pinterest 엔지니어링 팀이 AI 에이전트의 도메인 특화 스킬 호출 신뢰도를 높이기 위해 수행한 실험과 결과를 공유합니다. 객관적인 데이터 기반의 테스트 프로세스를 통해 Codex와 Claude의 성능 차이를 분석하고 실무적인 최적화 팁을 제공합니다.
AI 에이전트를 도입한 팀이라면 정성적인 평가에 의존하기보다 본문의 테스트 하네스를 참고하여 정량적 지표를 먼저 구축할 것을 권장합니다.
Pinterest의 iOS 아키텍처 지식을 가진 AI 에이전트가 특정 스킬을 호출하는 과정에서 불확실성이 발생하여 개발 워크플로우 자동화의 신뢰도가 떨어지는 문제가 있었습니다.
Bash 기반의 테스트 하네스를 구축하여 긍정/부정 케이스를 테스트하고, 프론트매터(Frontmatter) 설명 추가, AGENTS.md 파일 활용, 명확한 지시어 사용 등의 최적화 전략을 도입했습니다.
초기 Codex 73%, Claude 62%였던 정확도가 최적화를 통해 개선되었으며, 특히 프론트매터에 컨텍스트를 추가하는 방식이 에이전트 종류와 무관하게 유의미한 성능 향상을 이끌어냈습니다.
Trade-off
AGENTS.md에 스킬 정보를 추가할 경우 컨텍스트 윈도우의 토큰을 추가로 소비하게 되며, AI에게 스스로 설정을 개선하도록 맡겼을 때 오히려 성능이 저하되는 부작용이 발견되었습니다.
AI 에이전트가 특정 도메인의 지식이나 도구(스킬)를 필요로 할 때 이를 정확하게 인식하고 활성화하는 과정입니다.
소프트웨어의 특정 기능을 테스트하기 위해 필요한 테스트 데이터, 실행 환경, 결과 수집 도구를 모은 자동화 프레임워크입니다.
파일 최상단에 YAML 등의 형식으로 작성된 메타데이터 섹션으로, 에이전트에게 필요한 컨텍스트나 규칙을 전달합니다.








