Skip to main content

Pemilihan Model

Memilih model yang tepat dapat berdampak signifikan pada biaya dan kualitas.

Rekomendasi Berdasarkan Tugas

Tingkatan Biaya

Optimasi Biaya

1. Gunakan Model yang Lebih Kecil Terlebih Dahulu

2. Tetapkan max_tokens

Selalu tetapkan batas max_tokens yang wajar:

3. Optimalkan Prompt

4. Batch Permintaan yang Serupa

Optimasi Performa

5. Gunakan Streaming untuk UX

Streaming meningkatkan performa yang dirasakan:

6. Pilih Model Cepat untuk Penggunaan Interaktif

7. Tetapkan Timeout

Keandalan

8. Implementasikan Retry

9. Tangani Error dengan Baik

10. Gunakan Model Cadangan

Keamanan

11. Lindungi API Key

12. Validasi Input Pengguna

13. Tetapkan Batas API Key

Buat API key terpisah dengan batas pengeluaran untuk:
  • Pengembangan/pengujian
  • Produksi
  • Aplikasi yang berbeda

Pemantauan

14. Lacak Penggunaan

Periksa dashboard Anda secara berkala untuk:
  • Penggunaan token per model
  • Rincian biaya
  • Rasio cache hit
  • Rasio error

15. Catat Metrik Penting

16. Siapkan Alert

Konfigurasikan alert saldo rendah di dashboard Anda untuk menghindari gangguan layanan.

Daftar periksa

  • Menggunakan model yang sesuai untuk setiap tugas
  • Menetapkan batas max_tokens
  • Prompt ringkas
  • Caching diaktifkan jika sesuai
  • Melakukan batch permintaan serupa
  • Streaming untuk UX interaktif
  • Model cepat untuk penggunaan real-time
  • Timeout dikonfigurasi
  • Logika retry diimplementasikan
  • Penanganan error tersedia
  • Model fallback dikonfigurasi
  • API key di environment variables
  • Validasi input
  • Key terpisah untuk dev/prod
  • Batas pengeluaran ditetapkan