O que são tokens em IA?
Tokens são as peças de texto que um modelo de IA lê e produz — e a unidade em que todos os limites de contexto e faturas de API são escritos.
A definição, em uma frase
Um token é um pedaço de texto — muitas vezes uma palavra comum inteira, às vezes um fragmento de palavra ou um símbolo — que um modelo de linguagem processa como uma única unidade. Os modelos nunca veem letras diretamente: um tokenizador primeiro converte seu texto em IDs de token, e tudo o que segue (limites de contexto, preços, medidores de uso) é contado nesses tokens.
Para o inglês comum, um token equivale a cerca de 0,75 palavras, ou aproximadamente 4 caracteres incluindo espaços. Essa única proporção converte entre as unidades que você conhece (palavras, páginas) e as unidades em que os provedores cobram (tokens).
Como é um token na prática
Palavras curtas comuns se comprimem em um único token: the, and, is. Palavras mais longas ou raras se dividem em pedaços. Números, URLs, identificadores de código e emojis quebram em muitos tokens.
Cada família de modelos treinou seu próprio vocabulário de tokenizador, então a mesma frase custa um número ligeiramente diferente de tokens em GPT, Claude, Gemini, Grok e Kimi — e as gerações de tokenizadores mudam dentro de um mesmo provedor.
Onde os tokens aparecem em uma solicitação de IA
Tokens de entrada incluem tudo o que é enviado ao modelo: instruções de sistema, mensagens, histórico de conversa, documentos recuperados e definições de ferramentas. Tokens de saída são gerados pelo modelo a uma tarifa maior — tipicamente 3–6 vezes a de entrada. Tokens de entrada em cache são prefixos repetidos servidos com grande desconto.
- Entrada: instruções, perguntas, contexto e histórico.
- Saída: a resposta do modelo — a faixa mais cara.
- Entrada em cache: prefixos reutilizados, muitas vezes a 10% do preço de entrada.
Por que a contagem de tokens importa
Os tokens determinam se uma solicitação cabe na janela de contexto de um modelo e quanto ela custa. Uma mensagem curta pode se tornar uma solicitação grande se o aplicativo anexa um prompt de sistema longo, muitos documentos ou uma conversa inteira.
Em escala, pequenas decisões de tokens se acumulam: cortar 20% dos tokens do prompt em uma carga de trabalho de US$ 2.000/mês economiza US$ 400 — sem contar a saída que você deixa de gerar.
Quantas palavras tem um token?
As proporções de planejamento: 1 token ≈ 0,75 palavras ≈ 4 caracteres; 1 palavra ≈ 1,3 tokens; 1.000 tokens ≈ 750 palavras, ou 1,5–2 páginas. Uma janela de 128K tokens comporta aproximadamente um romance; 1M de tokens, cerca de dez.
Use faixas, não números únicos: o inglês casual fica perto de 0,85 palavras por token, a prosa técnica densa se aproxima de 0,65, e código ou alfabetos não latinos são bem mais densos.
Um fluxo de trabalho útil de planejamento
Conte primeiro o prompt estável — um tokenizador real no seu navegador dá contagens exatas para modelos da OpenAI e uma aproximação rotulada para os demais. Adicione o contexto típico de conversa e recuperação, reserve espaço para a resposta e multiplique por tráfego realista.
Por fim, calibre: os provedores retornam contagens exatas de uso com cada resposta. Registre-as por uma semana e compare com suas estimativas.
Perguntas frequentes
O que é exatamente um token em IA?
Uma peça de texto — normalmente uma palavra comum ou um fragmento — que um modelo lê ou gera como uma unidade. Os provedores cobram por token, separadamente para entrada e saída.
O que são tokens em termos simples?
Pense nos tokens como peças de LEGO de texto: palavras frequentes são uma peça única; palavras raras, números e código são várias peças pequenas unidas.
Quantas palavras tem um token?
Cerca de 0,75 palavras em inglês por token; uma palavra custa aproximadamente 1,3 tokens. 1.000 tokens são aproximadamente 750 palavras.
O que são tokens de entrada versus tokens de saída?
Tokens de entrada são tudo o que você envia na solicitação; tokens de saída são o que o modelo gera, cobrados a uma tarifa maior por token.
Todos os modelos de IA usam os mesmos tokens?
Não. Cada família de modelos tem seu próprio vocabulário de tokenizador, então o mesmo texto produz contagens diferentes em GPT, Claude, Gemini, Grok e Kimi.