본문으로 건너뛰기
제품 · 평가 · 관측

답이 틀렸을 때,
어디에서 문제가 생겼는지 확인할 수 있습니다

질문 하나에 모델이 몇 번 호출됐는지, 어떤 문서를 검색했는지, 어떤 SQL을 실행했는지, 어느 단계에서 시간이 오래 걸렸는지까지 전체 실행 과정이 기록됩니다. 답변 품질은 사람이 매번 직접 확인하지 않아도 자동 평가를 통해 점수로 축적됩니다.

모델 호출 · 문서 검색 · SQL 실행 전 과정 기록 TRACE
단계별 소요 시간 LATENCY
자동 평가로 품질 점수 축적 SCORE
TRACE
에이전트 트레이스와 구간별 소요 비율

문제의 원인을 파악하기 어려운 세 가지 지점

“AI가 이상한 답을 했다”는 제보만 남습니다

대화 ID로 실행 트레이스를 찾아 검색 · 도구 · 모델 등 어느 단계에서 문제가 발생했는지 확인합니다.

모델을 바꿔도 실제로 나아졌는지 알기 어렵습니다

자동 평가 점수와 모델별 품질 추이, Arena 결과를 함께 비교해 변화를 확인합니다.

LLM 비용을 월말이 되어서야 확인합니다

모델별 단가를 등록하면 사용량 데이터를 기준으로 예상 비용을 바로 확인할 수 있습니다.

한 번의 실행을 되짚어 보는 기능

트레이스

  • LLM 호출 · 도구 실행 · 검색 · 가드레일까지 답변 한 건의 전체 실행 경로를 기록합니다.
  • 트리 · 타임라인 · 토큰 세 가지 보기로 실행 과정을 확인하고, 가장 오래 걸린 구간을 자동으로 표시합니다.
  • 각 노드를 선택하면 프롬프트 · 검색 결과 · SQL · 도구 응답 등 해당 단계의 입력과 출력을 확인할 수 있습니다.
  • 추론 모델을 사용하는 경우 추론 요약과 추론 토큰 사용량도 트레이스에 함께 표시됩니다.

자동 품질 평가

  • 에이전트에 자동 평가를 설정하면 평가 모델이 답변을 검색 품질 · 충실도 · 응답 품질의 세 가지 기준으로 0~1점으로 평가합니다.
  • 사용자가 직접 첨부한 파일은 검색 품질 평가 대상에서 제외해 지식베이스 검색 결과와 구분합니다.
  • 모델별 · 에이전트별 품질 점수와 변화 추이를 확인할 수 있습니다.

피드백 · Arena

  • 사용자 피드백을 항목별로 구조화해 수집하고 분석할 수 있습니다.
  • 모델별 답변을 나란히 비교하고, 비교 결과를 기반으로 Elo 순위를 제공합니다.

사용량

  • 모델 · 사용자 · 그룹 · 조직 · 에이전트별 토큰 사용량을 집계합니다.
  • 시계열 · 트리맵 · 요일×시간 히트맵 · 순위표로 사용 현황을 확인할 수 있습니다.
  • 모델별 입력 · 출력 · 캐시 단가를 등록하면 사용량을 기반으로 비용을 추정합니다. 표시 통화를 설정할 수 있으며, 프롬프트 캐시로 절감된 토큰 사용량도 시계열에서 확인할 수 있습니다.
  • 대화 로그를 조건별로 검색하고 필요한 기록을 확인할 수 있습니다.

설정 상태 점검

  • 관리자 화면 한 곳에서 LLM 연결 · 임베딩 · 문서 추출 엔진 · 검색 · 웹 검색 · 코드 실행 · 코드 게이트웨이 · 알림 · 음성 · 이미지 · 암호화 · 라이선스의 설정 상태와 적용 범위를 확인할 수 있습니다.

트레이스 · 자동 품질 평가 화면

제품 화면 예시 · 트레이스 0:09

한 건의 실행 과정이 단계별로 기록되며, 가장 오래 걸린 구간의 입력과 출력까지 상세하게 확인할 수 있습니다.

에이전트가 실행한 SQL과 결과가 노드에 그대로 남습니다.
모델별 단가를 등록하면 사용량을 비용으로 환산해 확인할 수 있습니다.

라이선스

트레이스 · 평가는 Professional 티어부터 포함됩니다. 사용량 집계는 모든 티어에서 제공됩니다. → 요금 · 라이선스

관련 업데이트

1.3.0 2026-07

사용량 사용량 시각화와 비용 추정

전체 업데이트 내역 →

우리 조직의 실제 질문 하나를 트레이스로 따라가 보여드립니다

설치 방식 · 연동 범위 · 거버넌스 요구사항에 맞춰 데모 환경을 구성합니다.