Di AI Gateway Appverse yang kamu bayar adalah token yang benar-benar terpakai: harga input dan output per 1 juta token tampil jujur di tabel harga, tanpa markup dan tanpa peak hour. Model biaya langsung ini punya dua sisi: tidak ada pemborosan tersembunyi, tapi juga tidak ada buffer yang menyelamatkanmu kalau pemakaian boros.
Kabar baiknya, pemakaian token sangat bisa dimanajemen. Mayoritas pembengkakan bukan karena task-nya besar, tetapi karena cara bekerja: histori percakapan dibiarkan membengkak, prompt dikirim bolak-balik tanpa informasi yang cukup, dan loop agent diizinkan gagal-berulang tanpa batas. Panduan ini merangkum kebiasaan yang menekan konsumsi token tanpa menurunkan kualitas hasil.
Compact dulu sebelum ganti tugas atau fitur
Histori percakapan adalah komponen input terbesar. Setiap kali kamu mengirim prompt baru, seluruh histori dikirim ulang ke model sebagai konteks. Bekerja di satu thread dari riset, implementasi, debugging, sampai refactor artinya kamu terus membayar ulang percakapan yang sudah selesai setiap kali mengetik pesan berikutnya.
Karena itu, jadikan compact (perintah untuk memadatkan histori menjadi ringkasan) sebagai gerbang wajib setiap ganti konteks: berpindah ke fitur lain, membuka menu atau modul yang berbeda, setelah satu task besar selesai, atau saat thread terasa panjang dan jawaban mulai lambat.
Compact memangkas biaya input pada setiap request berikutnya, karena model hanya membawa ringkasan penting, bukan seluruh riwayat. Kualitas tidak ikut anjlok bila ringkasannya bagus, dan konteks yang benar-benar dibutuhkan (file aktif, error terkini, keputusan desain) selalu bisa kamu tempel ulang secara eksplisit.
Kebalikannya juga benar: jangan compact di tengah task yang masih butuh detail percakapan. Padatkan di titik transisi, bukan saat kamu sedang membutuhkan sepuluh pesan terakhir sebagai referensi.
Prompting yang padat mengalahkan banyak round-trip
Satu prompt lengkap lebih murah daripada lima pendek-kurang-informasi. Setiap balasan agent yang salah (dan iterasi memperbaikinya) tetap dibayar penuh, input dan output-nya. Rencanakan prompt sebelum dikirim: tugas apa, file mana, batasan apa, dan bentuk jawaban seperti apa yang diharapkan.
Tempel error asli, bukan deskripsi samar. Tempelkan log atau pesan error persis seperti muncul di terminal, disertai nama file dan baris yang terlibat. "Error di bagian auth gitu loh" hampir selalu berujung dua-tiga round-trip tanya-jawab sebelum agent menemukan yang kamu maksud.
Sebut file dan simbol yang spesifik, bukan seluruh repo. Agent yang diberi target jelas bekerja lebih pendek: dia tidak membuka file yang tidak relevan dan tidak menuliskan penjelasan berlebih untuk menutupi ketidakjelasan prompt.
Batasi ukuran output yang dibutuhkan. Minta patch atau diff pada fungsi yang diubah saja untuk perbaikan kecil, bukan rewrite seluruh file. Kalau hanya butuh jawaban, minta jawabannya saja, bukan esai. Output panjang adalah tagihan output token.
Kendalikan loop agent sebelum dia berputar sendiri
Perilaku paling mahal dari coding agent adalah gagal-coba-gagal dalam gelap: error, dugaan solusi, gagal lagi, dugaan berikutnya. Tiap iterasi lengkap dengan pembacaan file, reasoning, dan edit yang semuanya makan token. Tanpa batasan, satu debugging tersesat bisa menghabiskan lebih banyak token daripada seluruh task yang sukses.
Cara paling efektif menekannya: beri agent cara verifikasi yang eksplisit. Cantumkan command test atau build yang benar di prompt awal (contoh: "jalankan npm test, hanya suite auth yang relevan") supaya agent memverifikasi dengan murah dan cepat, bukan menebak lewat trial-and-error berulang.
Gunakan mode plan atau diskusi kasar terlebih dahulu untuk task besar, baru eksekusi. Memprodusisi satu rencana yang kamu review adalah transaksi token yang jauh lebih kecil daripada membiarkan agent mengimplementasikan interpretasi keliru sejak awal lalu menggulung semuanya balik.
Tenangkan agent saat dia salah jalan. Interupsi cepat ("berhenti, gunakan X") menghemat banyak round berikutnya. Agent yang diberi batasan pekerjaan (kasus yang dilayani, file yang boleh disentuh) juga jauh lebih jarang melebar sendiri.
Pilih model sesuai beban pekerjaan
Tabel harga model di halaman AI Gateway menampilkan variasi harga input dan output yang lebar antar model. Menjalankan model premium untuk tugas ringan (menulis satu function test kecil, memperbaiki typo, memformat ulang file) adalah pemborosan paling mudah dihilangkan: pilih model yang hemat untuk eksplorasi dan pekerjaan mekanis, naik ke model teratas hanya untuk reasoning berat atau refactor lintas file.
Sebelum task besar, gunakan harga per 1 juta token di tabel untuk memberikan estimasi kasar: perkiraan ukuran konteks yang akan dikirim dikali tarif input, plus perkiraan respons dikali tarif output. Task yang tersurat mahal bisa dipecah atau dialihkan ke model lebih murah.
Untuk pemakaian harian yang tinggi dan reguler, bandingkan dua skema di halaman paket: Token Plan memberi kuota token dengan tarif per token lebih murah dan API key langsung di-assign, sedangkan Pay As You Go (Saldo USD) fleksibel untuk pemakaian yang naik-turun. Pemakai berat yang masih di skema saldo biasanya berarti belum memanfaatkan diskon Token Plan.
Eksplorasi dan merangkum isi file -> model hemat
Mengubah satu fungsi kecil -> model hemat
Debugging dengan traceback penuh -> model menengah
Refactor lintas file, arsitektur -> model premium
Tugas judgment cepat -> selalu model hemat, bukan premiumManfaatkan tooling dan library, bukan konteks raksasa
Biarkan agent menggunakan alat pencari (grep, search, symbol lookup) untuk menemukan kodenya sendiri. Menempel lima file utuh ke prompt mengirim puluhan ribu token sebagai input pada setiap request; agent yang dapat mencari sendiri hanya menarik bagian kecil yang benar-benar relevan ke konteks.
Tempel screenshot atau file besar hanya bila isinya memang tidak bisa diwakili teks. Tangkapan layar error yang isinya cuma teks sama lebih murah dikirim sebagai salinan teks.
Kalau agent harness yang kamu pakai mendukung prompt caching, aktifkan. Prompt cache menyimpan prefix yang berulang (instruksi sistem, konteks project) sehingga bagian itu tidak dibayar ulang penuh pada setiap request; dukungannya tergantung provider di balik model yang kamu pilih.
Komponen berulang sebaiknya dijadikan dokumentasi internal atau file referensi, bukan dijelaskan ulang dalam tiap prompt. Sekali didokumentasikan, agent cukup membaca file itu saat dibutuhkan.
Pantau di mana kebocoran token terjadi
Dashboard gateway di /dashboard/gateway menampilkan grafik pemakaian harian dan log per request. Periksa dua hal secara periodik: token input dominan biasanya tanda histori yang belum di-compact atau konteks yang ditempel berlebihan, sedangkan token output melonjak biasanya berarti output yang terlalu panjang atau loop yang mengulang pekerjaan sama.
Dari log per request, pastikan model yang dibayar sesuai model yang kamu maksud. Pemakaian tak terduga yang ternyata memakai model premium adalah lubang kebocoran yang paling sering ditemukan di log.
Pemilik Token Plan dapat memantau sisa kuota per key di /dashboard/token-plan, lengkap dengan analytics per key, sehingga ketahuan dini saat satu key dipakai jauh lebih boros dari yang lain.
Tetapkan ritme pengecekan yang ringan: sekali sehari memantau tren grafik dan sekali sepekan menelusuri beberapa baris log teratas. Targetnya bukan menghitung tiap token, tetapi menangkap kebiasaan boros sebelum tagihannya terasa.
Ringkasan praktik harian
- Compact saat ganti tugas, fitur, atau menu; histori ringkas berhemat sendiri di setiap request berikutnya.
- Satu prompt lengkap dengan error asli dan file target lebih murah daripada lima prompt pendek yang menebak.
- Beri command test eksplisit supaya agent berhenti menebak lewat trial-and-error.
- Model hemat untuk pekerjaan ringan, model premium hanya untuk reasoning berat dan refactor besar.
- Patch kecil menjaga output token rendah, hindari rewrite file penuh untuk perubahan lokal.
- Cek grafik harian dan log di dashboard untuk menemukan kebiasaan boros yang tidak terasa.
Pertanyaan yang sering muncul
Apakah compact menurunkan kualitas jawaban agent?
Tidak, selama compact dijalankan di titik transisi antar tugas dan ringkasan konteks penting disimpan. Justru histori raksasa yang tidak dipilih dapat membuat agent makin lambat dan kurang fokus terhadap instruksi terbaru. Detail yang benar-benar dibutuhkan selalu bisa ditempel ulang secara eksplisit.
Seberapa sering sebaiknya compact dijalankan?
Sesuai titik transisi, bukan hitungan kata yang tetap: setiap ganti fitur atau modul, setelah satu task besar selesai, atau saat thread terasa panjang dan respons mulai lambat. Yang perlu dihindari adalah memadat di tengah task yang masih bergantung pada detail percakapan.
Model yang lebih murah kapan cukup dipakai?
Untuk pekerjaan mekanis dan eksplorasi: menjalankan refactor kecil yang pola terdefinisi, menulis test sederhana, merangkum file, atau memformat ulang kode. Model teratas simpan untuk reasoning berat, debugging yang butuh konteks luas, dan desain arsitektur. Estimasi selisih harganya bisa dihitung langsung dari tabel harga per 1 juta token.
Bagaimana cara menemukan pemakaian yang paling boros?
Buka /dashboard/gateway, bandingkan grafik harian dengan hari-hari produktifmu, lalu telusuri log per request. Dua pola yang paling sering: histori panjang yang jarang di-compact (token input besar di setiap request) dan loop gagal-berulang (banyak request pendek dengan output perkiraan yang mirip).