Ce este acest instrument?
API-urile LLM sunt facturate per token, nu per cerere — iar tokenurile de intrare (promptul tău, mesajul de sistem, istoricul conversației) sunt taxate diferit față de tokenurile de ieșire (ce generează modelul), de obicei cu un adaos de 4-8x pentru ieșire. Această separare face ca „cât va costa asta” să fie greu de estimat din ochi, mai ales când compari modele de la furnizori diferiți, cu grile de tarifare diferite.
Acest calculator preia numărul tokenurilor tale de intrare și ieșire, înmulțește fiecare cu tariful pe milion de tokenuri al modelului selectat, apoi le adună — exact aritmetica pe care o face sistemul de facturare al furnizorului. Adaugă un volum lunar de cereri și obții o proiecție a totalului lunar, utilă pentru bugetare înainte de a te angaja cu un model în producție.
De ce să-l folosești?
- 19 modele de la OpenAI, Anthropic, Google, DeepSeek, Qwen, Moonshot, Zhipu și xAI — opțiuni buget, mediu și de top, inclusiv principalele API-uri de modele chinezești și Grok.
- Un tabel de comparație clasifică fiecare model după cost pentru numărul tău exact de tokenuri, ca să nu fii nevoit să calculezi manual fiecare model.
- Detaliere separată a costului de intrare/ieșire, deoarece tokenurile de ieșire sunt taxate de câteva ori mai mult decât cele de intrare, la orice furnizor.
- Volum lunar de cereri opțional, pentru o proiecție rapidă de buget, nu doar o estimare pentru o singură cerere.
- Prețuri verificate direct din documentația furnizorilor, cu data verificării afișată — nu extrase automat sau estimate.
- 100% local — fără cheie API, fără cont, nicio dată nu părăsește browserul tău.
Cum se folosește
- Selectează un model din listă, grupat pe furnizor (OpenAI / Anthropic / Google / DeepSeek / Qwen / Moonshot / Zhipu / xAI).
- Introdu numărul de tokenuri de intrare (prompt + mesaj de sistem + orice context) și numărul estimat de tokenuri de ieșire.
- Citește costul per cerere, împărțit în cost de intrare și cost de ieșire.
- Opțional, introdu numărul de cereri pe lună pentru a vedea un cost lunar estimat.
- Derulează în jos la tabelul de comparație pentru a vedea toate modelele clasificate după cost, pentru aceleași numere de tokenuri.
Exemplu
Intrare
GPT-5.6 Terra, 1.000 tokenuri de intrare, 500 tokenuri de ieșireRezultat
Cost intrare $0,0025 + cost ieșire $0,0075 = $0,01 per cerereLa 10.000 de cereri/lună asta înseamnă aproximativ $100/lună — costurile mici per cerere se adună rapid la scară, motiv pentru care contează să verifici calculul înainte de a alege un model.
Înțelegerea costului de intrare vs. ieșire
Fiecare model din această listă taxează separat tokenurile de intrare și de ieșire, iar diferența dintre ele este mare și consecventă la toți furnizorii — ieșirea costă de obicei 5-6x mai mult per token decât intrarea. Asta înseamnă că un răspuns de model vorbăreț, detaliat, costă disproporționat mai mult decât un prompt lung cu un răspuns scurt, chiar dacă numărul total de tokenuri pare similar.
Implicație practică: dacă optimizezi cheltuiala API, reducerea lungimii ieșirii (instrucțiuni mai scurte în promptul de sistem, precum „răspunde într-un singur paragraf”) economisește de obicei mai mult decât reducerea intrării, token cu token.
Cost lunar aproximativ după modelul de utilizare
Acestea sunt exemple ilustrative, nu oferte de preț — folosește calculatorul de mai sus cu propriile tale numere de tokenuri și alegerea de model pentru un rezultat exact.
| Model de utilizare | Tokenuri tipice/cerere | Model exemplu | Cost lunar aproximativ (10k cereri) |
|---|---|---|---|
| Răspunsuri scurte de chatbot | 300 in / 150 out | GPT-5.4 Nano | ≈ $2-3/lună |
| Etichetare date și clasificare | 500 in / 50 out | DeepSeek V4 Flash | ≈ $1/lună |
| Rezumare documente | 3.000 in / 400 out | Claude Sonnet 5 | ≈ $100/lună |
| Asistent de generare cod | 1.500 in / 1.000 out | Gemini 3.5 Flash | ≈ $110-115/lună |
| Redactare conținut de lungă durată | 1.000 in / 2.500 out | GPT-5.6 Sol | ≈ $800/lună |
Întrebări frecvente
De ce ieșirea este taxată mult mai scump decât intrarea la toate modelele?
Generarea tokenurilor (ieșire) necesită o trecere completă prin model pentru fiecare token nou, rulată secvențial, în timp ce procesarea tokenurilor de intrare (promptul) se poate face în paralel, într-un singur lot. Acest cost de calcul asimetric explică de ce fiecare furnizor major taxează ieșirea la aproximativ 4-8x rata de intrare.
Cum aflu câte tokenuri va folosi promptul meu?
Folosește instrumentul Numărător de Tokenuri de la CodeKitHub — lipește promptul sau mesajul de sistem real și îți arată numărul exact de tokenuri, folosind tokenizatorul real, nu o estimare aproximativă bazată pe caractere. Numărul de tokenuri de ieșire este mai greu de prezis în avans; o abordare rezonabilă este să verifici utilizarea reală din câteva răspunsuri API efective și să folosești asta ca estimare.
Aceste prețuri sunt garantat actuale?
Nu — prețurile API ale furnizorilor de AI se schimbă destul de des, uneori cu preaviz redus. Prețurile din acest instrument au fost verificate direct pe pagina oficială de prețuri a fiecărui furnizor, la data afișată lângă calculator. Înainte de a lua o decizie de buget sau de achiziție, verifică singur pagina actuală: prețurile OpenAI (developers.openai.com/api/docs/pricing), prețurile Anthropic/Claude (platform.claude.com/docs/en/about-claude/pricing) și prețurile Google Gemini (ai.google.dev/gemini-api/docs/pricing).
De ce nu apare [modelul meu preferat] în listă?
Acest instrument acoperă o gamă reprezentativă buget/mediu/de top de la OpenAI, Anthropic, Google, DeepSeek, Qwen, Moonshot, Zhipu și xAI (19 modele în total), nu fiecare model oferit de fiecare furnizor, pentru a păstra lista ușor de parcurs și datele de preț ușor de menținut corecte. Dacă ai nevoie de un model care nu este listat, verifică prețul per 1M tokenuri pe pagina furnizorului și fă manual același calcul cost-intrare + cost-ieșire.
Prețul pentru Gemini 3.1 Pro Preview ține cont de prompturi lungi?
Nu — prețul afișat este nivelul Google pentru ≤200.000 de tokenuri. Prețul Gemini crește pentru prompturi mai lungi decât acest prag, iar acest calculator nu modelează acel nivel suplimentar, pentru a păstra instrumentul simplu. Dacă prompturile tale depășesc frecvent 200k tokenuri, verifică pagina de prețuri Google pentru rata exactă pentru context lung.
Prețurile DeepSeek, Qwen, Kimi și GLM sunt în USD?
Da — toate prețurile din acest instrument, inclusiv pentru modelele chinezești, sunt tarifele oficiale API internaționale în USD, astfel încât fiecare model poate fi comparat pe aceeași bază. Unii dintre acești furnizori oferă și console facturate în CNY pentru conturi din China continentală, la tarife diferite (adesea mai mici); verifică propria consolă a furnizorului dacă facturezi în CNY.
Ar trebui să optimizez costul de intrare sau costul de ieșire?
Uită-te la forma volumului tău de lucru. Dacă este dominat de intrare — documente lungi în intrare, răspunsuri scurte în ieșire (clasificare, extracție, RAG) — prețul de intrare și cache-ul de prompt domină factura. Dacă este dominat de ieșire — generări lungi din prompturi scurte — prețul de ieșire contează cel mai mult, iar tokenurile de ieșire costă de obicei de câteva ori mai mult per token decât cele de intrare, pe același model.