CodeKitHub
Instrumente AI

Calculator Preț API LLM

Ultima actualizare:

Alege un model, introdu numărul de tokenuri de intrare și de ieșire și vezi costul exact per cerere — plus un cost lunar estimat dacă știi aproximativ câte cereri vei face. Un tabel de comparație de mai jos clasifică toate cele 19 modele după cost, pentru aceleași numere de tokenuri, astfel încât să vezi dintr-o privire dacă GPT, Claude, Gemini, DeepSeek, Qwen, Kimi, GLM sau Grok este cel mai ieftin pentru cazul tău. Acoperă modelele actuale de la OpenAI, Anthropic, Google, DeepSeek, Qwen (Alibaba), Moonshot (Kimi), Zhipu (GLM) și xAI (Grok), cu prețuri verificate direct pe pagina oficială de prețuri a fiecărui furnizor. Totul rulează local, în browserul tău.

Prices last verified: August 17, 2026

AI vendor API pricing changes frequently — these figures are for reference only. Check the vendor's official pricing page before making budget or purchasing decisions.

Ce este acest instrument?

API-urile LLM sunt facturate per token, nu per cerere — iar tokenurile de intrare (promptul tău, mesajul de sistem, istoricul conversației) sunt taxate diferit față de tokenurile de ieșire (ce generează modelul), de obicei cu un adaos de 4-8x pentru ieșire. Această separare face ca „cât va costa asta” să fie greu de estimat din ochi, mai ales când compari modele de la furnizori diferiți, cu grile de tarifare diferite.

Acest calculator preia numărul tokenurilor tale de intrare și ieșire, înmulțește fiecare cu tariful pe milion de tokenuri al modelului selectat, apoi le adună — exact aritmetica pe care o face sistemul de facturare al furnizorului. Adaugă un volum lunar de cereri și obții o proiecție a totalului lunar, utilă pentru bugetare înainte de a te angaja cu un model în producție.

De ce să-l folosești?

  • 19 modele de la OpenAI, Anthropic, Google, DeepSeek, Qwen, Moonshot, Zhipu și xAI — opțiuni buget, mediu și de top, inclusiv principalele API-uri de modele chinezești și Grok.
  • Un tabel de comparație clasifică fiecare model după cost pentru numărul tău exact de tokenuri, ca să nu fii nevoit să calculezi manual fiecare model.
  • Detaliere separată a costului de intrare/ieșire, deoarece tokenurile de ieșire sunt taxate de câteva ori mai mult decât cele de intrare, la orice furnizor.
  • Volum lunar de cereri opțional, pentru o proiecție rapidă de buget, nu doar o estimare pentru o singură cerere.
  • Prețuri verificate direct din documentația furnizorilor, cu data verificării afișată — nu extrase automat sau estimate.
  • 100% local — fără cheie API, fără cont, nicio dată nu părăsește browserul tău.

Cum se folosește

  1. Selectează un model din listă, grupat pe furnizor (OpenAI / Anthropic / Google / DeepSeek / Qwen / Moonshot / Zhipu / xAI).
  2. Introdu numărul de tokenuri de intrare (prompt + mesaj de sistem + orice context) și numărul estimat de tokenuri de ieșire.
  3. Citește costul per cerere, împărțit în cost de intrare și cost de ieșire.
  4. Opțional, introdu numărul de cereri pe lună pentru a vedea un cost lunar estimat.
  5. Derulează în jos la tabelul de comparație pentru a vedea toate modelele clasificate după cost, pentru aceleași numere de tokenuri.

Exemplu

Intrare

GPT-5.6 Terra, 1.000 tokenuri de intrare, 500 tokenuri de ieșire

Rezultat

Cost intrare $0,0025 + cost ieșire $0,0075 = $0,01 per cerere

La 10.000 de cereri/lună asta înseamnă aproximativ $100/lună — costurile mici per cerere se adună rapid la scară, motiv pentru care contează să verifici calculul înainte de a alege un model.

Înțelegerea costului de intrare vs. ieșire

Fiecare model din această listă taxează separat tokenurile de intrare și de ieșire, iar diferența dintre ele este mare și consecventă la toți furnizorii — ieșirea costă de obicei 5-6x mai mult per token decât intrarea. Asta înseamnă că un răspuns de model vorbăreț, detaliat, costă disproporționat mai mult decât un prompt lung cu un răspuns scurt, chiar dacă numărul total de tokenuri pare similar.

Implicație practică: dacă optimizezi cheltuiala API, reducerea lungimii ieșirii (instrucțiuni mai scurte în promptul de sistem, precum „răspunde într-un singur paragraf”) economisește de obicei mai mult decât reducerea intrării, token cu token.

Cost lunar aproximativ după modelul de utilizare

Acestea sunt exemple ilustrative, nu oferte de preț — folosește calculatorul de mai sus cu propriile tale numere de tokenuri și alegerea de model pentru un rezultat exact.

Model de utilizareTokenuri tipice/cerereModel exempluCost lunar aproximativ (10k cereri)
Răspunsuri scurte de chatbot300 in / 150 outGPT-5.4 Nano≈ $2-3/lună
Etichetare date și clasificare500 in / 50 outDeepSeek V4 Flash≈ $1/lună
Rezumare documente3.000 in / 400 outClaude Sonnet 5≈ $100/lună
Asistent de generare cod1.500 in / 1.000 outGemini 3.5 Flash≈ $110-115/lună
Redactare conținut de lungă durată1.000 in / 2.500 outGPT-5.6 Sol≈ $800/lună

Întrebări frecvente

De ce ieșirea este taxată mult mai scump decât intrarea la toate modelele?

Generarea tokenurilor (ieșire) necesită o trecere completă prin model pentru fiecare token nou, rulată secvențial, în timp ce procesarea tokenurilor de intrare (promptul) se poate face în paralel, într-un singur lot. Acest cost de calcul asimetric explică de ce fiecare furnizor major taxează ieșirea la aproximativ 4-8x rata de intrare.

Cum aflu câte tokenuri va folosi promptul meu?

Folosește instrumentul Numărător de Tokenuri de la CodeKitHub — lipește promptul sau mesajul de sistem real și îți arată numărul exact de tokenuri, folosind tokenizatorul real, nu o estimare aproximativă bazată pe caractere. Numărul de tokenuri de ieșire este mai greu de prezis în avans; o abordare rezonabilă este să verifici utilizarea reală din câteva răspunsuri API efective și să folosești asta ca estimare.

Aceste prețuri sunt garantat actuale?

Nu — prețurile API ale furnizorilor de AI se schimbă destul de des, uneori cu preaviz redus. Prețurile din acest instrument au fost verificate direct pe pagina oficială de prețuri a fiecărui furnizor, la data afișată lângă calculator. Înainte de a lua o decizie de buget sau de achiziție, verifică singur pagina actuală: prețurile OpenAI (developers.openai.com/api/docs/pricing), prețurile Anthropic/Claude (platform.claude.com/docs/en/about-claude/pricing) și prețurile Google Gemini (ai.google.dev/gemini-api/docs/pricing).

De ce nu apare [modelul meu preferat] în listă?

Acest instrument acoperă o gamă reprezentativă buget/mediu/de top de la OpenAI, Anthropic, Google, DeepSeek, Qwen, Moonshot, Zhipu și xAI (19 modele în total), nu fiecare model oferit de fiecare furnizor, pentru a păstra lista ușor de parcurs și datele de preț ușor de menținut corecte. Dacă ai nevoie de un model care nu este listat, verifică prețul per 1M tokenuri pe pagina furnizorului și fă manual același calcul cost-intrare + cost-ieșire.

Prețul pentru Gemini 3.1 Pro Preview ține cont de prompturi lungi?

Nu — prețul afișat este nivelul Google pentru ≤200.000 de tokenuri. Prețul Gemini crește pentru prompturi mai lungi decât acest prag, iar acest calculator nu modelează acel nivel suplimentar, pentru a păstra instrumentul simplu. Dacă prompturile tale depășesc frecvent 200k tokenuri, verifică pagina de prețuri Google pentru rata exactă pentru context lung.

Prețurile DeepSeek, Qwen, Kimi și GLM sunt în USD?

Da — toate prețurile din acest instrument, inclusiv pentru modelele chinezești, sunt tarifele oficiale API internaționale în USD, astfel încât fiecare model poate fi comparat pe aceeași bază. Unii dintre acești furnizori oferă și console facturate în CNY pentru conturi din China continentală, la tarife diferite (adesea mai mici); verifică propria consolă a furnizorului dacă facturezi în CNY.

Ar trebui să optimizez costul de intrare sau costul de ieșire?

Uită-te la forma volumului tău de lucru. Dacă este dominat de intrare — documente lungi în intrare, răspunsuri scurte în ieșire (clasificare, extracție, RAG) — prețul de intrare și cache-ul de prompt domină factura. Dacă este dominat de ieșire — generări lungi din prompturi scurte — prețul de ieșire contează cel mai mult, iar tokenurile de ieșire costă de obicei de câteva ori mai mult per token decât cele de intrare, pe același model.

Instrumente similare