
Por que os tokens de saída das APIs de LLM custam de 4 a 8 vezes mais do que os de entrada
Publicado em 25 de jul. de 2026
Olhe para a página de preços de qualquer API de LLM importante — OpenAI, Anthropic, Google, tanto faz — e vai reparar sempre no mesmo padrão: os tokens de saída custam várias vezes mais do que os de entrada. E não é um pequeno acréscimo. Nos modelos atuais, o rácio situa-se consistentemente entre 4x e 8x. Não é uma particularidade de preços de um único fornecedor; é uma consequência direta da forma como estes modelos realmente funcionam.
A razão real: a entrada é paralela, a saída é sequencial
O processamento dos tokens de entrada — o seu prompt, a mensagem de sistema, o histórico da conversa — acontece numa única passagem direta (forward pass). O modelo lê toda a entrada de uma vez e calcula a atenção sobre tudo isso em paralelo. As GPUs modernas são extremamente boas neste tipo de computação paralela em lote, pelo que um prompt de 3.000 tokens e um de 300 tokens não custam um tempo de computação proporcional à sua contagem de tokens como o comprimento poderia sugerir — o overhead de executar o modelo uma vez é o custo dominante, não o comprimento daquilo que está a ler.
Gerar tokens de saída é fundamentalmente diferente. Cada novo token depende de todos os tokens anteriores, incluindo os que o modelo acabou de gerar — pelo que o token 500 de uma resposta não pode ser calculado antes de o token 499 existir. Isso obriga a um ciclo sequencial: uma passagem direta por cada token de saída, executadas uma a seguir à outra, sem forma de paralelizar ao longo da sequência. Produzir 500 tokens de saída significa executar o modelo 500 vezes seguidas, não uma só.
Essa assimetria no cálculo — uma passagem paralela para a entrada, N passagens sequenciais para N tokens de saída — é o motivo pelo qual os preços de todos os grandes fornecedores se parecem, independentemente da empresa, da arquitetura do modelo ou da região. Não é tanto uma decisão de negócio, mas sim uma transferência direta do custo computacional subjacente.
O que isto significa para os seus prompts
A conclusão prática é direta: uma resposta do modelo verbosa custa desproporcionadamente mais do que um prompt longo com uma resposta curta, mesmo quando a contagem total de tokens parece semelhante. Se está a tentar reduzir os gastos com a API, encurtar o comprimento da saída geralmente poupa mais por token do que encurtar o comprimento da entrada.
Algumas alavancas concretas:
- Limite explicitamente o comprimento da resposta. Uma instrução no prompt de sistema como “responda num parágrafo” ou um limite de
max_tokensfaz mais pelo custo do que encurtar o seu próprio prompt. - Peça saída estruturada em vez de prosa. Um objeto JSON com três campos é frequentemente muito mais curto do que o equivalente explicado em frases, e igualmente útil a jusante.
- Não explique demasiado no prompt de sistema para poupar na saída. Um prompt de sistema mais longo e preciso (entrada, barata) que produz de forma fiável uma resposta curta e correta (saída, cara) costuma ser uma melhor troca do que um prompt curto e vago que leva o modelo a proteger-se com uma resposta longa.
- Use um modelo mais barato para saída de grande volume e baixa complexidade. Se uma tarefa não precisar do raciocínio de um modelo de ponta — classificação, extração, respostas curtas — o preço de saída de um modelo de nível económico é muitas vezes uma ordem de grandeza mais baixo.
Calcular o valor exato em dólares
O rácio explica por que a saída custa mais, mas o valor exato em dólares depende de qual modelo está a usar e de quantos tokens cada lado de um pedido efetivamente consome. Como a divisão entrada/saída — e o multiplicador entre elas — varia genuinamente consoante o modelo (um modelo económico e um modelo topo de gama não aplicam o mesmo rácio), a única forma fiável de conhecer o seu custo real é introduzir os seus números reais por modelo.
A Calculadora de preços de API LLM da CodeKitHub faz exatamente isso: escolha o seu modelo, introduza as suas contagens de tokens de entrada e saída, e ela mostra o custo de entrada, o custo de saída e o total — além de uma estimativa mensal se souber aproximadamente quantos pedidos vai fazer. Se não tiver a certeza de quantos tokens o seu prompt real utiliza, a ferramenta Contador de tokens de IA dá-lhe a contagem exata usando o tokenizador real, em vez de uma estimativa aproximada baseada em caracteres.
Ambas funcionam inteiramente no seu navegador — sem chave de API, sem conta, nada é enviado para lado nenhum.