기업용 RAG와 AI 에이전트 실무 도입 전략

기업용 RAG와 AI 에이전트 실무 도입 전략 관련 이미지
Photo by Tumisu via Pixabay

기업이 생성형 AI를 실제 업무에 적용할 때 가장 자주 검토하는 기술은 RAG와 AI 에이전트입니다. RAG는 사내 문서를 검색해 모델이 근거를 바탕으로 답하도록 돕고, 에이전트는 검색을 넘어 여러 도구를 사용해 작업을 실행합니다. 두 기술은 경쟁 관계가 아니라 역할이 다르며, 조직의 데이터 품질과 보안 수준에 맞춰 단계적으로 결합해야 합니다. 최신 모델을 선택하는 것보다 정확한 근거, 제한된 권한, 측정 가능한 업무 효과를 설계하는 것이 더 중요합니다.

RAG가 필요한 업무와 한계

모델은 학습 이후 변경된 회사 정책이나 내부 문서를 자동으로 알지 못합니다. RAG는 사용자의 질문과 관련된 문서 조각을 검색해 모델 입력에 포함함으로써 최신 내부 정보를 활용하게 합니다. 고객지원 매뉴얼, 기술 문서, 인사 규정과 제품 카탈로그처럼 근거가 명확한 질의응답에 적합합니다. 다만 검색 결과가 틀리거나 오래된 문서라면 답변도 잘못될 수 있으므로 문서 수집과 권한, 버전 관리가 핵심입니다.

검색 품질을 높이는 기본 설계

  • 문서를 제목과 섹션 단위로 의미 있게 나눕니다.
  • 작성일, 부서, 제품과 보안등급 메타데이터를 저장합니다.
  • 키워드 검색과 벡터 검색을 함께 사용하는 하이브리드 검색을 검토합니다.
  • 검색 결과를 재정렬하고 최소 관련도 기준을 둡니다.
  • 답변에 사용한 문서 제목과 링크를 사용자에게 제공합니다.

문서를 지나치게 작은 조각으로 나누면 문맥이 사라지고, 너무 크게 나누면 관련 없는 내용과 토큰 비용이 늘어납니다. 실제 질문 데이터로 조각 크기와 검색 개수를 평가해야 합니다.

AI 에이전트는 언제 추가할까

문서를 찾아 답하는 것만으로 업무가 끝나지 않고 티켓 생성, 일정 조회, 데이터 입력 같은 후속 행동이 필요할 때 에이전트를 고려할 수 있습니다. 예를 들어 고객의 환불 질문에 정책 근거를 제시하는 것은 RAG의 역할이고, 주문 상태를 조회해 조건이 맞으면 환불 요청을 등록하는 것은 에이전트의 역할입니다. 처음부터 자율성을 크게 주기보다 읽기 전용 도구부터 연결하고 실행 전 사람의 승인을 받게 하는 방식이 안전합니다.

데이터 권한과 보안 경계

검색 시스템은 사용자가 원래 볼 수 없는 문서를 답변에 노출해서는 안 됩니다. 문서를 인덱싱할 때 부서와 사용자 권한 정보를 함께 저장하고 검색 시점에도 접근 권한을 적용해야 합니다. 에이전트마다 별도 신원을 부여하고 필요한 API 기능에만 최소 권한을 줍니다. 하나의 관리자 키를 여러 업무에서 공유하면 사고 범위가 커지고 실행 주체를 추적하기 어렵습니다.

외부 문서에 숨겨진 명령이 에이전트 행동을 바꾸는 프롬프트 인젝션도 고려해야 합니다. 검색한 문서는 명령이 아니라 신뢰 수준이 제한된 데이터로 취급하고, 허용한 도구와 인수만 실행되도록 검증해야 합니다. 결제, 삭제, 권한 변경과 외부 메시지 발송에는 사람 승인과 실행 한도를 적용하는 것이 좋습니다.

클라우드 비용과 성능 관리

RAG 서비스 비용에는 모델 토큰뿐 아니라 문서 변환, 임베딩, 검색 인덱스, 재정렬, 로그와 평가 데이터 저장 비용이 포함됩니다. 모든 질문에 많은 문서를 전달하거나 고성능 모델만 사용하면 지연 시간과 비용이 빠르게 증가합니다. 반복 질문은 안전한 범위에서 캐시하고, 간단한 분류는 작은 모델로 처리하며, 복잡한 추론만 큰 모델로 보내는 라우팅을 적용할 수 있습니다.

  1. 요청당 모델·검색·도구 호출 비용을 기록합니다.
  2. 평균뿐 아니라 p95 응답 시간을 확인합니다.
  3. 검색 결과가 없을 때 무리하게 답하지 않도록 합니다.
  4. 사용량 급증 시 최대 동시 실행 수를 제한합니다.
  5. 오류가 나면 읽기 전용 또는 사람 처리로 안전하게 전환합니다.

품질 평가는 정답과 근거를 함께 보기

답변이 자연스럽다는 이유만으로 정확하다고 판단할 수 없습니다. 대표적인 실제 질문과 기대 답변, 정답 근거 문서를 묶은 평가 데이터셋을 준비해야 합니다. 검색 단계에서는 올바른 문서가 상위 결과에 포함되는지, 생성 단계에서는 근거와 일치하는지, 에이전트 단계에서는 올바른 도구와 인수를 선택했는지 각각 평가합니다. 모델이나 프롬프트, 문서 분할 방식을 바꿀 때 같은 평가를 반복해 기존 품질이 떨어지지 않는지 확인합니다.

개발 도구와 배포 자동화

코드, 프롬프트, 검색 설정과 평가 데이터를 모두 버전 관리하면 변경 원인을 추적하기 쉽습니다. CI에서는 단위 테스트와 보안 검사뿐 아니라 핵심 AI 평가를 실행하고 기준 이하이면 배포를 막을 수 있습니다. 운영 환경에서는 요청 ID, 검색 문서 ID, 모델 버전, 도구 실행 결과와 사람 승인 기록을 남겨야 합니다. 개인정보와 문서 원문이 로그에 과도하게 저장되지 않도록 마스킹과 보관 기간도 설정해야 합니다.

단계별 도입 순서

  1. 근거가 명확하고 반복적인 질의응답 업무를 선택합니다.
  2. 문서 품질과 접근 권한을 정리한 뒤 RAG부터 구축합니다.
  3. 정확도와 근거 품질을 실제 질문으로 평가합니다.
  4. 읽기 전용 도구를 연결해 제한된 에이전트 흐름을 만듭니다.
  5. 감사 로그, 사람 승인과 긴급 중단 기능을 추가합니다.
  6. 성과가 확인된 업무에만 실행 권한을 단계적으로 확대합니다.

RAG와 AI 에이전트의 성공은 모델 성능만으로 결정되지 않습니다. 최신 문서, 올바른 검색, 사용자별 권한, 실패 시 안전한 전환과 지속적인 평가가 하나의 운영 체계로 연결돼야 합니다. 작은 범위에서 품질과 비용을 측정한 뒤 확대하는 팀이 실제 업무 자동화의 효과를 안정적으로 얻을 수 있습니다.

한 줄 요약: 기업용 AI는 권한이 적용된 RAG로 정확한 근거를 먼저 확보하고, 읽기 전용 도구와 사람 승인을 거쳐 AI 에이전트의 실행 범위를 단계적으로 확대해야 합니다.

IT에 게시됨