Skip to main content

모델 선택

적절한 모델을 선택하면 비용과 품질에 큰 영향을 줄 수 있습니다.

작업 기반 권장사항

비용 등급

비용 최적화

1. 먼저 더 작은 모델 사용

2. max_tokens 설정

항상 합리적인 max_tokens 제한을 설정하세요:

3. 프롬프트 최적화

4. 유사한 요청 배치 처리

성능 최적화

5. UX를 위해 Streaming 사용

Streaming은 체감 성능을 향상시킵니다:

6. 대화형 사용에는 빠른 모델 선택

7. 타임아웃 설정

안정성

8. 재시도 구현

9. 오류를 우아하게 처리

10. 대체 모델 사용

보안

11. API 키 보호

12. 사용자 입력 검증

13. API 키 제한 설정

다음 용도별로 지출 한도가 있는 별도의 API 키를 생성하세요:
  • 개발/테스트
  • 프로덕션
  • 서로 다른 애플리케이션

모니터링

14. 사용량 추적

정기적으로 대시보드에서 다음 항목을 확인하세요:
  • 모델별 token 사용량
  • 비용 세부 내역
  • 캐시 적중률
  • 오류율

15. 중요한 메트릭 로깅

16. 알림 설정

서비스 중단을 방지하기 위해 대시보드에서 잔액 부족 알림을 구성하세요.

체크리스트

  • 각 작업에 적절한 모델 사용
  • max_tokens 제한 설정
  • 프롬프트가 간결함
  • 적절한 위치에 캐싱 활성화
  • 유사한 요청 배치 처리
  • 대화형 UX를 위한 Streaming
  • 실시간 사용을 위한 빠른 모델
  • 타임아웃 구성 완료
  • 재시도 로직 구현 완료
  • 오류 처리 적용 완료
  • 대체 모델 구성 완료
  • 환경 변수에 API 키 저장
  • 입력 검증
  • dev/prod용 별도 키 사용
  • 지출 한도 설정