Skip to main content

Lựa chọn model

Việc chọn đúng model có thể ảnh hưởng đáng kể đến chi phí và chất lượng.

Khuyến nghị theo tác vụ

Các mức chi phí

Tối ưu chi phí

1. Ưu tiên sử dụng model nhỏ hơn trước

2. Thiết lập max_tokens

Luôn đặt giới hạn max_tokens hợp lý:

3. Tối ưu prompt

4. Gộp các request tương tự theo lô

Tối ưu hiệu năng

5. Sử dụng streaming cho UX

Streaming cải thiện hiệu năng được cảm nhận:

6. Chọn model nhanh cho các trường hợp sử dụng tương tác

7. Thiết lập timeout

Độ tin cậy

8. Triển khai retry

9. Xử lý lỗi một cách phù hợp

10. Sử dụng model dự phòng

Bảo mật

11. Bảo vệ API key

12. Xác thực dữ liệu đầu vào của người dùng

13. Thiết lập giới hạn cho API key

Tạo các API key riêng biệt với giới hạn chi tiêu cho:
  • Phát triển/kiểm thử
  • Môi trường production
  • Các ứng dụng khác nhau

Giám sát

14. Theo dõi mức sử dụng

Kiểm tra dashboard của bạn thường xuyên để theo dõi:
  • Mức sử dụng token theo model
  • Phân tích chi phí
  • Tỷ lệ cache hit
  • Tỷ lệ lỗi

15. Ghi log các chỉ số quan trọng

16. Thiết lập cảnh báo

Cấu hình cảnh báo số dư thấp trong dashboard của bạn để tránh gián đoạn dịch vụ.

Danh sách kiểm tra

  • Sử dụng model phù hợp cho từng tác vụ
  • Thiết lập giới hạn max_tokens
  • Prompt ngắn gọn
  • Bật caching ở những nơi phù hợp
  • Gộp các request tương tự
  • Streaming cho UX tương tác
  • Model nhanh cho sử dụng thời gian thực
  • Đã cấu hình timeout
  • Đã triển khai logic retry
  • Đã có xử lý lỗi
  • Đã cấu hình model dự phòng
  • API key trong biến môi trường
  • Xác thực dữ liệu đầu vào
  • Key riêng cho dev/prod
  • Đã đặt giới hạn chi tiêu