Quanto custa
Quanto custa rodar IA por API: a tabela por milhão de tokens (2026)
A grade de preço por token dos principais fornecedores, com a data em que cada uma foi lida.
Preços conferidos em , na página de cada fornecedor.
Todo fornecedor de API de modelo de linguagem cobra da mesma maneira: um valor por milhão de tokens que entram e outro, bem maior, por milhão que saem. Token não é palavra nem caractere, é o pedaço em que o modelo corta o texto, e em português um milhão deles dá algumas centenas de páginas.
A diferença entre a coluna de entrada e a de saída é o que mais surpreende quem chega agora. A saída costuma custar de três a cinco vezes a entrada, então um uso que produz textos longos custa muito mais que um uso que lê textos longos e responde pouco.
A terceira coluna, quando existe, é a que muda a conta de quem repete o mesmo contexto. Vários fornecedores cobram uma fração do preço normal por trecho de entrada que já foi enviado antes e ficou guardado, e num agente que relê o mesmo projeto o dia inteiro essa linha domina o resultado.
Nada aqui está convertido. A grade sai na moeda em que o fornecedor publica, que quase sempre é o dólar, e quem paga de cartão brasileiro fecha na cotação do dia da fatura com imposto por cima.
Preços conferidos em , na página de cada fornecedor.
API: o preço por milhão de tokens
| fornecedor | modelo | entrada, por 1M de tokens | saída, por 1M de tokens | entrada em cache | lido em |
|---|---|---|---|---|---|
| DeepInfra | DeepSeek-V4-Flash | US$ 0,09 | US$ 0,18 | US$ 0,018 | |
| DeepInfra | Llama-3.3-70B-Instruct-Turbo | US$ 0,10 | US$ 0,32 | não publica | |
| Z.AI | GLM-5.3-Flash | US$ 0,15 | US$ 0,50 | não publica | |
| Anthropic | Claude Sonnet 5 | US$ 2,00 | US$ 10,00 | US$ 0,20 | |
| OpenAI | gpt-5.6-luna | US$ 0,20 | US$ 1,20 | US$ 0,02 | |
| DeepSeek | deepseek-flash | US$ 0,30 | US$ 1,20 | US$ 0,006 | |
| Gemini 3.1 Pro Preview | US$ 2,00 | US$ 12,00 | não publica | ||
| OpenAI | gpt-5.6-terra | US$ 2,00 | US$ 12,00 | US$ 0,20 | |
| Mistral | Mistral Large | US$ 0,50 | US$ 1,50 | não publica | |
| Moonshot | kimi-k3 | US$ 3,00 | US$ 15,00 | US$ 0,30 | |
| Gemini 3.5 Flash-Lite | US$ 0,30 | US$ 2,50 | não publica | ||
| xAI | grok-4.3 | US$ 1,25 | US$ 2,50 | US$ 0,20 | |
| Anthropic | Claude Opus 5 | US$ 5,00 | US$ 25,00 | US$ 0,50 | |
| DeepSeek | deepseek-v4-pro | US$ 1,32 | US$ 3,96 | US$ 0,044 | |
| Moonshot | kimi-k2.7-code | US$ 0,95 | US$ 4,00 | US$ 0,19 | |
| Z.AI | GLM-5.3 | US$ 1,40 | US$ 4,40 | não publica | |
| Anthropic | Claude Haiku 4.5 | US$ 1,00 | US$ 5,00 | US$ 0,10 | |
| OpenAI | gpt-6-astra | US$ 10,00 | US$ 50,00 | US$ 1,00 | |
| xAI | grok-4.6 | US$ 2,00 | US$ 6,00 | US$ 0,50 | |
| Gemini 3.5 Flash | US$ 1,50 | US$ 9,00 | US$ 0,15 |
Quase toda grade de token é publicada em dólar, e esta tabela repete a moeda do fornecedor sem converter nada. O que sai do seu cartão depende da cotação do dia da fatura e do imposto que o banco cobra por cima, que são dois números que esta página não tem como saber.
As ressalvas que o valor sozinho esconde
- Agregador: serve modelo de peso aberto hospedado por ele, e não o mesmo endereço do fabricante.
- Agregador: serve modelo de peso aberto hospedado por ele.
- O valor de cache é o de LEITURA.
- Preço de pico. Fora de pico a página publica metade: 0,15 de entrada e 0,60 de saída.
- Vale para pedido de até 200 mil tokens. Acima disso a própria página dobra a entrada e sobe a saída.
- É o único modelo com valor escrito na página de preço. Os outros mandam o leitor para a lista de modelos, que não publica a grade.
- A página avisa que o valor não inclui imposto, calculado no pagamento.
- Vale abaixo de 200 mil tokens de pedido.
- O valor de cache é o de LEITURA. Gravar no cache é cobrado à parte, mais caro que a entrada comum.
- Preço de pico. Fora de pico a página publica metade: 0,66 de entrada e 1,98 de saída.
- Vale abaixo de 200 mil tokens de pedido. Acima disso a página cobra o dobro.
Cada valor é o preço de tabela lido na página do fornecedor no dia indicado, e não o que você paga: promoção, plano antigo e preço herdado fazem a sua fatura ser outra. A grade completa, o histórico de reajuste e a fonte de cada leitura ficam na página de cada serviço.
O veredito
Comece pela coluna de saída para ordenar os candidatos, confira se o seu uso repete contexto antes de descartar os modelos com cache barato, e só então compare com o que uma mensalidade cobriria. A diferença entre o modelo mais caro e o mais barato desta tabela é de duas ordens de grandeza.
Perguntas
O que é um token?
É o pedaço em que o modelo corta o texto antes de processá-lo, geralmente menor que uma palavra. Todo fornecedor cobra por milhão deles, contando entrada e saída separadamente.
Por que a saída custa mais que a entrada?
Porque gerar texto exige uma passagem do modelo por token produzido, enquanto ler o que você mandou é feito de uma vez. A conta do fornecedor reflete esse trabalho.
Quanto disto já está na sua fatura?
O lensub junta o que você assina em todos os cartões numa lista só, mostra o que está sendo pago duas vezes e avisa por e-mail antes de cada cobrança.
Grátis até cinco assinaturas, sem cartão.