CodeKitHub
Kenapa token output API LLM berharga 4-8x lebih mahal daripada token input

Kenapa token output API LLM berharga 4-8x lebih mahal daripada token input

Diterbitkan pada 25 Jul 2026

Lihat halaman harga mana-mana API LLM utama — OpenAI, Anthropic, Google, tidak kira — dan anda akan perasan bentuk yang sama setiap kali: token output berharga beberapa kali lebih mahal daripada token input. Bukan premium kecil pun. Merentasi model semasa, nisbah itu secara konsisten berada antara 4x dan 8x. Itu bukan keanehan harga khusus satu vendor; ia adalah akibat langsung daripada cara model ini sebenarnya berjalan.

Sebab sebenar: input adalah selari, output adalah berjujukan

Memproses token input — prompt anda, mesej sistem, sejarah perbualan — berlaku dalam satu laluan hadapan (forward pass) tunggal. Model membaca keseluruhan input sekaligus dan mengira attention merentasi kesemuanya secara selari. GPU moden amat mahir dalam pengiraan berkumpulan (batched) dan selari sebegini, jadi prompt 3,000 token dan prompt 300 token tidak berkos secara berkadar sebanyak masa pengiraan seperti yang mungkin disarankan oleh bilangan token mereka — overhed menjalankan model itu sekali adalah kos dominan, bukan panjang apa yang dibacanya.

Menjana token output pula sama sekali berbeza. Setiap token baharu bergantung pada setiap token sebelumnya, termasuk yang baru sahaja dijana oleh model — jadi token ke-500 sesuatu respons tidak boleh dikira sehingga token ke-499 wujud. Itu memaksa gelung berjujukan: satu laluan hadapan bagi setiap token output, dijalankan satu selepas satu, tanpa cara untuk diselarikan merentasi jujukan itu. Menghasilkan 500 token output bermakna menjalankan model 500 kali berturut-turut, bukan sekali.

Ketidaksepadanan dalam pengiraan itu — satu laluan selari untuk input, N laluan berjujukan untuk N token output — adalah sebab harga setiap penyedia utama kelihatan sama tanpa mengira syarikat, seni bina model, atau wilayah. Ia bukan keputusan perniagaan sebanyak ia adalah penyampaian langsung kos pengiraan yang mendasarinya.

Apa maksudnya untuk prompt anda

Kesimpulan praktikal itu jelas: respons model yang panjang lebar berkos secara tidak berkadar lebih mahal daripada prompt panjang dengan jawapan pendek, walaupun jumlah token keseluruhannya kelihatan serupa. Jika anda cuba mengurangkan perbelanjaan API, memangkas panjang output biasanya menjimatkan lebih banyak setiap token berbanding memangkas panjang input.

Beberapa tuas konkrit:

  • Hadkan panjang respons secara eksplisit. Arahan prompt sistem seperti “jawab dalam satu perenggan” atau had max_tokens berbuat lebih banyak untuk kos berbanding memendekkan prompt anda sendiri.
  • Minta output berstruktur dan bukan prosa. Objek JSON dengan tiga medan selalunya jauh lebih pendek berbanding yang setara diterangkan dalam ayat, dan sama bergunanya untuk digunakan seterusnya.
  • Jangan terlalu menerangkan dalam prompt sistem untuk menjimatkan output. Prompt sistem yang lebih panjang dan lebih tepat (input, murah) yang secara boleh dipercayai menghasilkan jawapan pendek yang betul (output, mahal) biasanya pertukaran yang lebih baik berbanding prompt pendek yang samar yang membuatkan model berhati-hati dengan respons panjang.
  • Guna model lebih murah untuk output volum tinggi, kerumitan rendah. Jika tugas itu tidak memerlukan penaakulan model frontier — klasifikasi, pengekstrakan, jawapan pendek — harga output model peringkat belanjawan selalunya lebih rendah beberapa kali ganda.

Mengira jumlah dolar sebenar

Nisbah itu menerangkan kenapa output berkos lebih mahal, tetapi angka dolar sebenar bergantung pada model mana yang anda gunakan dan berapa banyak token setiap belah permintaan sebenarnya digunakan. Oleh kerana pecahan input/output — dan pendarab antara kedua-duanya — sememangnya berbeza mengikut model (model belanjawan dan model unggulan tidak menggunakan nisbah yang sama), satu-satunya cara boleh dipercayai untuk mengetahui kos sebenar anda ialah memasukkan angka sebenar anda per model.

Kalkulator Harga API LLM CodeKitHub melakukan tepat itu: pilih model anda, masukkan bilangan token input dan output anda, dan ia menunjukkan kos input, kos output, dan jumlah — ditambah anggaran bulanan jika anda tahu kira-kira berapa banyak permintaan yang akan anda buat. Jika anda tidak pasti berapa banyak token yang digunakan prompt sebenar anda, alat Token Counter memberikan kiraan tepat menggunakan tokenizer sebenar, bukan tekaan kasar berasaskan aksara.

Kedua-duanya berjalan sepenuhnya dalam pelayar anda — tiada kunci API, tiada akaun, tiada apa-apa dihantar ke mana-mana.

← Kembali ke blog