AI GatewayOpenAI-compatible

Satu endpoint untuk semua model AI.

Routing multi-provider dengan fallback otomatis, quota atomik yang fail-closed, dan Token Saver yang memangkas hingga 65% token.

Jendela quota
Rolling
5 jampulih berjalan, bukan reset mendadak
Mingguan
Senin 00:00WIB, awal minggu ISO-8601
Bekerja denganClaude CodeCursorpiOpenAI SDKcurl
Model di katalog
0Model di katalog
Provider upstream
0Provider upstream
Hemat output token (s/d)
0%Hemat output token (s/d)
Request lewat cek quota
0%Request lewat cek quota

Katalog model siap pakai. Satu API key untuk semuanya.

ZAI/glm-5.2ZAI/glm-5.1ZAI/glm-5ZAI/glm-5-turboZAI/glm-4.7ZAI/glm-4.6ZAI/glm-4.5MINIMAX/MiniMax-M3MINIMAX/MiniMax-M2.7MINIMAX/MiniMax-M2.5MINIMAX/MiniMax-M2.5-highspeedMINIMAX/MiniMax-M2.1MINIMAX/MiniMax-M2ZAI/glm-5.2ZAI/glm-5.1ZAI/glm-5ZAI/glm-5-turboZAI/glm-4.7ZAI/glm-4.6ZAI/glm-4.5MINIMAX/MiniMax-M3MINIMAX/MiniMax-M2.7MINIMAX/MiniMax-M2.5MINIMAX/MiniMax-M2.5-highspeedMINIMAX/MiniMax-M2.1MINIMAX/MiniMax-M2

Satu request, enam jaminan

Urutannya bukan dekorasi, ini kontrak. Quota selalu di-reserve sebelum byte pertama dikirim, dan selisihnya selalu dikembalikan.

  1. Autentikasi

    API key diverifikasi lewat hash. Key aslinya tidak pernah disimpan sebagai plaintext.

  2. Reserve quota

    Estimasi worst-case di-reserve dalam satu operasi atomik. Kalau Redis bermasalah, request ditolak (fail-closed), bukan diloloskan diam-diam.

  3. Routing

    Request dikirim ke provider prioritas tertinggi yang sedang sehat.

  4. Fallback

    Provider gagal atau kena limit? Otomatis pindah ke route berikutnya, tanpa intervensi.

  5. Streaming

    Respons mengalir sebagai SSE, jadi token pertama sampai secepat mungkin.

  6. Commit dan catat

    Usage aktual di-commit, selisih reserve di-refund, dan event tercatat ke dashboard real-time.

Satu endpoint di depan lima provider

Request dirutekan ke provider terbaik berdasarkan priority dan health. Kalau satu gagal, gateway langsung pindah ke route berikutnya.

POST /v1/chat/completions
SDK OpenAI
ZaganRouter
gateway
authenticatekey hash
reserve quotaatomic
routeby priority
commit + refundusage
429
ZAI
priority 01
200 OK
MiniMax
priority 02
Anthropic
standby
OpenAI
standby
OpenRouter
standby

Diagram alur: request dari SDK OpenAI masuk ke gateway ZaganRouter, yang mengautentikasi key, me-reserve quota secara atomik, lalu merutekan ke provider prioritas tertinggi. ZAI menolak dengan 429, gateway otomatis fallback ke MiniMax yang menjawab 200, respons streaming balik ke client, dan usage aktual di-commit. Provider upstream: ZAI, MiniMax, Anthropic, OpenAI, dan OpenRouter.

Fitur

Dibangun untuk produksi

Bukan wrapper tipis. Setiap lapisan dirancang untuk reliability, efisiensi biaya, dan pengalaman developer yang bersih.

Multi-provider routing

Priority-based routing dengan health check dan fallback otomatis antar provider, semuanya di dalam satu request.

Urutan fallback

  1. 01ZAI
  2. 02MiniMax
  3. 03Anthropic
  4. 04OpenAI
  5. 05OpenRouter

OpenAI-compatible

Ganti base URL, pakai SDK yang sama. Nol migrasi kode.

Quota atomik fail-closed

Reserve, commit, dan refund lewat satu operasi atomik. Aman dari race condition.

Streaming SSE

Relay verbatim dari upstream. Token pertama cepat, usage tetap terukur presisi.

Token Saver

RTK mengompres input tool_result, Caveman mengoptimasi gaya output. Hemat hingga 65% token output.

Dashboard dan audit

Pantau quota, usage, dan biaya secara real-time. Setiap perubahan pricing, quota, dan role tercatat di audit log.

Hemat token tanpa mengorbankan jawaban

Dua mesin bekerja bersama di dalam gateway. Token instruksi yang di-inject gateway tidak pernah ditagih ke kamu.

Tanpa Token Saver48 token

"Tentu! Saya akan membantu Anda dengan itu. Masalahnya kemungkinan disebabkan oleh middleware otentikasi yang tidak memvalidasi masa berlaku token dengan benar. Mari saya lihat dan sarankan perbaikan."

Dengan Caveman14 token

"Bug di auth middleware. Cek expiry pakai < bukan <=. Fix:"

71% lebih sedikit token output

RTK, input optimizer

Hasil tool call yang panjang (log, JSON, stack trace) dikompres sebelum dikirim ke model. Konteks tetap utuh, token input turun drastis.

Caveman, output compressor

Tiga level (Lite, Full, Ultra) yang mengarahkan model menjawab padat dan langsung. Kamu yang pegang kendali per workspace, per key, atau per request.

Harga

Langganan bulanan, quota jelas

Tanpa biaya tersembunyi. Quota dihitung dalam AI Credit dan bisa dipantau real-time. Habis berarti berhenti, bukan tagihan membengkak.

Starter

Untuk eksplorasi & tugas kuliah

Rp15 rb/bulan
Credit / minggu60.000
Credit / 5 jam12.000
Rate limit40 RPM
Tier modelBudget + Balanced
Token SaverLITE + FULL
Input Saver (RTK)Aktif
Pilih Starter

Scale

Untuk beban kerja skripsi & riset intensif

Rp30 rb/bulan
Credit / minggu150 rb
Credit / 5 jam30.000
Rate limit150 RPM
Tier modelBudget + Balanced + Premium
Token SaverLITE + FULL + ULTRA
Input Saver (RTK)Aktif
Pilih Scale

Pembayaran via transfer bank (IDR) dengan verifikasi admin. Masa tenggang 3 hari tiap periode.

Keamanan

Aman secara default, bukan sebagai fitur

Prinsip yang sama di setiap lapisan: kalau ragu, tolak; kalau sensitif, enkripsi; kalau berubah, catat.

Kredensial

Provider key terenkripsi

Semua key upstream disimpan dengan AES-256-GCM, tidak pernah plaintext.

API key hash-only

Key kamu tampil sekali saat dibuat. Server hanya menyimpan hash dan prefix.

Password Argon2id

Kredensial akun di-hash dengan Argon2id, standar modern yang tahan GPU-cracking.

2FA TOTP untuk admin

Semua akses admin console diwajibkan verifikasi dua langkah berbasis TOTP.

Isolasi dan privasi

Isolasi tenant ketat

Setiap query resource difilter per organisasi, jadi data tidak bocor antar akun.

Privacy metadata-only

Prompt dan respons tidak disimpan secara default. Hanya metadata usage yang dicatat.

Jejak dan kegagalan

Fail-closed by design

Sistem quota bermasalah berarti request ditolak dengan jelas, bukan lolos diam-diam.

Audit log menyeluruh

Perubahan pricing, quota, dan role selalu meninggalkan jejak yang bisa diperiksa.

Pertanyaan yang sering muncul

Apakah kompatibel dengan SDK OpenAI?+

Ya. Ganti base_url ke endpoint ZaganRouter dan pakai API key kamu. Chat completions, streaming SSE, dan katalog model (/v1/models) berjalan tanpa mengubah kode lain.

Apa itu AI Credit?+

Satuan pemakaian. Setiap model punya rate credit per 1 juta token input dan output. Pemakaianmu dihitung dari jumlah token dikali rate model tersebut, dan semua angkanya terlihat transparan di dashboard.

Kapan quota di-reset?+

Ada dua jendela: quota 5 jam (rolling, pulih berjalan) dan quota mingguan yang reset setiap Senin 00:00 WIB. Keduanya tampil real-time di dashboard.

Bagaimana cara pembayaran?+

Transfer bank (IDR) lalu konfirmasi. Admin memverifikasi pembayaran dan langganan aktif. Ada masa tenggang 3 hari setiap periode agar layanan tidak putus mendadak.

Apakah prompt saya disimpan?+

Tidak. Secara default hanya metadata usage (jumlah token, model, status) yang dicatat. Logging isi prompt hanya aktif jika kamu menyalakannya sendiri per project.

Bagaimana jika provider upstream down?+

Gateway otomatis fallback ke route berikutnya dalam request yang sama. Jika semua route gagal, kamu menerima error berformat OpenAI dan credit yang di-reserve dikembalikan penuh.

Jalan dalam hitungan menit

Daftar, pilih paket, buat API key, lalu arahkan SDK OpenAI kamu ke endpoint ZaganRouter. Selesai.

quickstart.py
from openai import OpenAI

client = OpenAI(
  base_url="https://zaganrouter.vibedev.web.id/v1",
  api_key="sk-zg-...",
)

stream = client.chat.completions.create(
  model="ZAI/glm-5.2",
  messages=[{ "role": "user", "content": "Halo!" }],
  stream=True,
)