본문으로 건너뛰기
Documentation

사용량

마지막 게시: 2026-07-21 19:00

사용량

사용량에서는 Orchestrator가 처리한 턴과 모델 호출의 토큰, 성공 여부와 발생 시각을 집계합니다. 모델별 비용과 용량 계획을 세우고 비정상적으로 큰 요청을 찾는 데 사용합니다.

개요

턴 사용량과 모델 호출 사용량은 별도로 저장됩니다. 한 턴에서 모델을 여러 번 호출하면 턴 합계 외에 각 호출의 Provider, Model ID, 호출 단계와 토큰이 기록됩니다. 일별·월별 집계는 신규 사용량이 적재될 때 함께 갱신됩니다.

주요 값

항목 설명
Prompt Tokens 모델에 전달한 사용자 입력과 문맥의 토큰 수입니다.
Completion Tokens 모델이 생성한 출력 토큰 수입니다.
Reasoning Tokens 지원 Provider가 반환한 추론 토큰 수입니다.
Total Tokens 확인 가능한 세 토큰 항목의 합계입니다.
Gateway Type OpenAI 호환, 로컬 등 호출 경로를 구분합니다.
Model ID 실제 호출된 모델 구성 식별자입니다.
Succeeded 턴 또는 모델 호출의 성공 여부입니다.
Error Code 실패가 발생한 경우 기록되는 분류 코드입니다.

사용량 확인

  1. 조회 기간과 테넌트를 선택합니다.
  2. 전체 턴 수와 성공률을 확인합니다.
  3. Prompt와 Completion 토큰 추세를 비교합니다.
  4. Model ID별 호출 수와 평균 토큰을 확인합니다.
  5. Total Tokens가 큰 턴을 턴 검사기에서 엽니다.
  6. 오류가 늘어난 시간대는 실행 모니터와 함께 확인합니다.

값 해석

Prompt Tokens가 계속 커지면 긴 대화 문맥, 검색 결과 또는 도구 출력이 누적되는지 확인합니다. Completion Tokens가 모델 구성의 상한에 자주 도달하면 답변이 잘리는지 검토합니다. 사용량이 비어 있는 항목은 0과 같다고 단정하지 말고 Provider가 해당 값을 반환하지 않은 경우인지 확인하십시오.

비용과 용량 계획

모델별 단가가 다르므로 Total Tokens만 합산하지 말고 Provider와 Model ID로 나눠 계산합니다. MaxConcurrentRequests를 늘리기 전에는 평균 지연과 동시 호출 실패율을 확인합니다. 월별 증가 추세가 크면 프롬프트 문맥, 검색 결과 크기와 불필요한 재호출을 점검합니다.

비정상 사용량 확인

  • 동일 Turn ID가 중복 적재되는지 확인합니다. 사용량 ID는 멱등 저장됩니다.
  • 한 턴에 모델 호출이 과도하게 많으면 플래너 재시도와 도구 실패를 확인합니다.
  • Reasoning Tokens가 급증하면 적용된 Reasoning Effort를 확인합니다.
  • 실패 턴에도 토큰이 기록될 수 있으므로 성공 건만 비용으로 계산하지 않습니다.

관련 작업

  • 턴 검사기에서 고사용량 턴의 입력과 호출 단계를 확인합니다.
  • 모델 구성에서 컨텍스트와 출력 토큰 상한을 조정합니다.
  • 실행 모니터에서 토큰 증가가 지연시간에 미친 영향을 확인합니다.

수정 이력

이 문서의 변경 내역을 시간순으로 볼 수 있습니다.

표시할 수정 이력이 없습니다.

An unhandled error has occurred. Reload 🗙

Rejoining the server...

Rejoin failed... trying again in seconds.

Failed to rejoin.
Please retry or reload the page.

The session has been paused by the server.

Failed to resume the session.
Please retry or reload the page.