사용량
사용량에서는 Orchestrator가 처리한 턴과 모델 호출의 토큰, 성공 여부와 발생 시각을 집계합니다. 모델별 비용과 용량 계획을 세우고 비정상적으로 큰 요청을 찾는 데 사용합니다.
개요
턴 사용량과 모델 호출 사용량은 별도로 저장됩니다. 한 턴에서 모델을 여러 번 호출하면 턴 합계 외에 각 호출의 Provider, Model ID, 호출 단계와 토큰이 기록됩니다. 일별·월별 집계는 신규 사용량이 적재될 때 함께 갱신됩니다.
주요 값
| 항목 | 설명 |
|---|---|
| Prompt Tokens | 모델에 전달한 사용자 입력과 문맥의 토큰 수입니다. |
| Completion Tokens | 모델이 생성한 출력 토큰 수입니다. |
| Reasoning Tokens | 지원 Provider가 반환한 추론 토큰 수입니다. |
| Total Tokens | 확인 가능한 세 토큰 항목의 합계입니다. |
| Gateway Type | OpenAI 호환, 로컬 등 호출 경로를 구분합니다. |
| Model ID | 실제 호출된 모델 구성 식별자입니다. |
| Succeeded | 턴 또는 모델 호출의 성공 여부입니다. |
| Error Code | 실패가 발생한 경우 기록되는 분류 코드입니다. |
사용량 확인
- 조회 기간과 테넌트를 선택합니다.
- 전체 턴 수와 성공률을 확인합니다.
- Prompt와 Completion 토큰 추세를 비교합니다.
- Model ID별 호출 수와 평균 토큰을 확인합니다.
- Total Tokens가 큰 턴을 턴 검사기에서 엽니다.
- 오류가 늘어난 시간대는 실행 모니터와 함께 확인합니다.
값 해석
Prompt Tokens가 계속 커지면 긴 대화 문맥, 검색 결과 또는 도구 출력이 누적되는지 확인합니다. Completion Tokens가 모델 구성의 상한에 자주 도달하면 답변이 잘리는지 검토합니다. 사용량이 비어 있는 항목은 0과 같다고 단정하지 말고 Provider가 해당 값을 반환하지 않은 경우인지 확인하십시오.
비용과 용량 계획
모델별 단가가 다르므로 Total Tokens만 합산하지 말고 Provider와 Model ID로 나눠 계산합니다. MaxConcurrentRequests를 늘리기 전에는 평균 지연과 동시 호출 실패율을 확인합니다. 월별 증가 추세가 크면 프롬프트 문맥, 검색 결과 크기와 불필요한 재호출을 점검합니다.
비정상 사용량 확인
- 동일 Turn ID가 중복 적재되는지 확인합니다. 사용량 ID는 멱등 저장됩니다.
- 한 턴에 모델 호출이 과도하게 많으면 플래너 재시도와 도구 실패를 확인합니다.
- Reasoning Tokens가 급증하면 적용된 Reasoning Effort를 확인합니다.
- 실패 턴에도 토큰이 기록될 수 있으므로 성공 건만 비용으로 계산하지 않습니다.
관련 작업
- 턴 검사기에서 고사용량 턴의 입력과 호출 단계를 확인합니다.
- 모델 구성에서 컨텍스트와 출력 토큰 상한을 조정합니다.
- 실행 모니터에서 토큰 증가가 지연시간에 미친 영향을 확인합니다.
