CodeKitHub
Português
Por que os tokens de saída das APIs de LLM custam de 4 a 8 vezes mais do que os de entrada

Por que os tokens de saída das APIs de LLM custam de 4 a 8 vezes mais do que os de entrada

Publicado em 25 de jul. de 2026

Olhe para a página de preços de qualquer API de LLM importante — OpenAI, Anthropic, Google, tanto faz — e vai reparar sempre no mesmo padrão: os tokens de saída custam várias vezes mais do que os de entrada. E não é um pequeno acréscimo. Nos modelos atuais, o rácio situa-se consistentemente entre 4x e 8x. Não é uma particularidade de preços de um único fornecedor; é uma consequência direta da forma como estes modelos realmente funcionam.

A razão real: a entrada é paralela, a saída é sequencial

O processamento dos tokens de entrada — o seu prompt, a mensagem de sistema, o histórico da conversa — acontece numa única passagem direta (forward pass). O modelo lê toda a entrada de uma vez e calcula a atenção sobre tudo isso em paralelo. As GPUs modernas são extremamente boas neste tipo de computação paralela em lote, pelo que um prompt de 3.000 tokens e um de 300 tokens não custam um tempo de computação proporcional à sua contagem de tokens como o comprimento poderia sugerir — o overhead de executar o modelo uma vez é o custo dominante, não o comprimento daquilo que está a ler.

Gerar tokens de saída é fundamentalmente diferente. Cada novo token depende de todos os tokens anteriores, incluindo os que o modelo acabou de gerar — pelo que o token 500 de uma resposta não pode ser calculado antes de o token 499 existir. Isso obriga a um ciclo sequencial: uma passagem direta por cada token de saída, executadas uma a seguir à outra, sem forma de paralelizar ao longo da sequência. Produzir 500 tokens de saída significa executar o modelo 500 vezes seguidas, não uma só.

Essa assimetria no cálculo — uma passagem paralela para a entrada, N passagens sequenciais para N tokens de saída — é o motivo pelo qual os preços de todos os grandes fornecedores se parecem, independentemente da empresa, da arquitetura do modelo ou da região. Não é tanto uma decisão de negócio, mas sim uma transferência direta do custo computacional subjacente.

O que isto significa para os seus prompts

A conclusão prática é direta: uma resposta do modelo verbosa custa desproporcionadamente mais do que um prompt longo com uma resposta curta, mesmo quando a contagem total de tokens parece semelhante. Se está a tentar reduzir os gastos com a API, encurtar o comprimento da saída geralmente poupa mais por token do que encurtar o comprimento da entrada.

Algumas alavancas concretas:

  • Limite explicitamente o comprimento da resposta. Uma instrução no prompt de sistema como “responda num parágrafo” ou um limite de max_tokens faz mais pelo custo do que encurtar o seu próprio prompt.
  • Peça saída estruturada em vez de prosa. Um objeto JSON com três campos é frequentemente muito mais curto do que o equivalente explicado em frases, e igualmente útil a jusante.
  • Não explique demasiado no prompt de sistema para poupar na saída. Um prompt de sistema mais longo e preciso (entrada, barata) que produz de forma fiável uma resposta curta e correta (saída, cara) costuma ser uma melhor troca do que um prompt curto e vago que leva o modelo a proteger-se com uma resposta longa.
  • Use um modelo mais barato para saída de grande volume e baixa complexidade. Se uma tarefa não precisar do raciocínio de um modelo de ponta — classificação, extração, respostas curtas — o preço de saída de um modelo de nível económico é muitas vezes uma ordem de grandeza mais baixo.

Calcular o valor exato em dólares

O rácio explica por que a saída custa mais, mas o valor exato em dólares depende de qual modelo está a usar e de quantos tokens cada lado de um pedido efetivamente consome. Como a divisão entrada/saída — e o multiplicador entre elas — varia genuinamente consoante o modelo (um modelo económico e um modelo topo de gama não aplicam o mesmo rácio), a única forma fiável de conhecer o seu custo real é introduzir os seus números reais por modelo.

A Calculadora de preços de API LLM da CodeKitHub faz exatamente isso: escolha o seu modelo, introduza as suas contagens de tokens de entrada e saída, e ela mostra o custo de entrada, o custo de saída e o total — além de uma estimativa mensal se souber aproximadamente quantos pedidos vai fazer. Se não tiver a certeza de quantos tokens o seu prompt real utiliza, a ferramenta Contador de tokens de IA dá-lhe a contagem exata usando o tokenizador real, em vez de uma estimativa aproximada baseada em caracteres.

Ambas funcionam inteiramente no seu navegador — sem chave de API, sem conta, nada é enviado para lado nenhum.

← Voltar ao blog