blackdark
FerramentasAPIs IApreços APIOpenAIClaudeGeminiOpenRouter

Melhores APIs de IA e os seus preços em 2026: comparativo para programadores

Comparativo de preços das plataformas de IA por API em 2026: OpenAI, Anthropic (Claude), Google Gemini, open source via Groq/Together/Fireworks e OpenRouter. Preço por milhão de tokens, quando usar cada uma e para quem.

Por BlackdarkAtualizado em 9 min de leitura

Quando deixas de usar a IA como um chat e começas a metê-la dentro do teu código, o modelo deixa de ser um separador do navegador e passa a ser uma fatura. E essa fatura pode ser três cêntimos por mês ou três mil euros, consoante a API que escolheres e como a usares. A diferença entre um fornecedor e outro, para a mesma tarefa, pode ser de 20 para 1.

O problema é que o mapa muda a cada poucos meses: saem modelos novos, os preços baixam, aparecem agregadores. Este guia é uma fotografia fixa de 2026 para que percebas como se cobra, que fornecedor ganha em quê e qual escolher consoante o teu caso, sem marketing e pensado para quem vai escrever o código.

Atenção

Os números exatos de cada API mexem-se de mês a mês, quase sempre em baixa. Aqui usamos faixas orientativas verificadas a meados de 2026. Antes de fechares um orçamento, confirma o número na página de preços oficial do fornecedor: é a única coisa que não caduca.

Porquê comparar APIs (e não ficares com a primeira)

A tentação é usar a API da marca que já conheces —provavelmente a OpenAI— e esquecer o assunto. Funciona, mas deixa dinheiro e velocidade em cima da mesa. Três razões para comparar antes de te casares:

  • O custo escala com o volume. Num protótipo tanto faz. Quando processas milhões de tokens por dia, uma diferença de 2 $ por milhão é a diferença entre o projeto ser rentável ou não.
  • Nem todas as tarefas precisam do melhor modelo. Classificar um email, resumir um texto ou etiquetar dados fá-lo de sobra um modelo barato. Reservar o modelo premium para essas tarefas é deitar o orçamento fora.
  • A velocidade é uma feature. Se a tua IA responde a um utilizador em tempo real, 200 tokens por segundo contra 800 muda a experiência por completo. Há fornecedores especializados só nisso.

A pergunta certa não é «qual é a melhor API?», mas sim «qual é a melhor para esta tarefa concreta?». E para lhe responder há que perceber primeiro a fatura.

Como se cobra: tokens de entrada e de saída

As APIs de IA não cobram por palavra nem por pedido. Cobram por token. Um token é um fragmento de texto —aproximadamente 4 caracteres ou três quartos de palavra em inglês (em português, um pouco menos)—. A frase «Olá, tudo bem?» são uns 6 tokens.

O importante, e o que quase ninguém olha ao início, é que se cobram duas coisas em separado:

  1. Input (entrada): tudo o que envias ao modelo. O teu prompt, as instruções de sistema e —isto é a chave— todo o contexto que arrastas: o histórico da conversa, os documentos que lhe passas, os resultados de ferramentas. Num agente, o input cresce a cada volta.
  2. Output (saída): o que o modelo gera como resposta.

E aqui está o truque que dispara as faturas: o output custa entre 4 e 6 vezes mais do que o input em quase todos os fornecedores. Um modelo a 3 $ de input pode estar a 15 $ de output. Por isso uma API que «parece barata» olhando só ao input pode sair-te cara se gerar respostas longas.

Dica

Regra prática para estimar o custo: conta quantos tokens de saída esperas por pedido e multiplica-os pelo preço de output, que é o que manda. Se as tuas respostas são longas (relatórios, código, redação), o output domina a fatura. Se só classificas ou extrais dados, o input pesa mais porque lhe metes muito contexto e sai pouco texto.

Mais dois detalhes que baratam a sério quando os usas:

  • Cache de prompt. Se reenvias o mesmo bloco de contexto em muitos pedidos (um manual, um system prompt longo), quase todos os fornecedores to cobram a um décimo do preço normal a partir da segunda vez. Em aplicações com contexto fixo, é a maior alavanca de poupança.
  • Modo batch. Se não precisas da resposta no instante, o processamento por lotes (até 24 h de espera) costuma custar metade na OpenAI, Anthropic e Google. Ideal para processar dados massivos de noite.

Ficha por fornecedor

OpenAI (família GPT-5)

O fornecedor por defeito do setor, e por algo. A sua gama vai de modelos minúsculos e baratíssimos (os «nano» e «mini», desde ~0,10–0,15 $ de input) até aos navios-almirante de raciocínio da família GPT-5, que se movem na faixa de ~1,25–5 $ de input e ~10–30 $ de output por milhão de tokens consoante a variante. A grande vantagem: ecossistema enorme, documentação impecável e SDKs para tudo. A desvantagem: raramente é o mais barato para uma tarefa dada, e para tirar partido dos modelos de topo pagas preço de topo.

Anthropic (Claude)

A casa forte em código, agentes de longa duração e tarefas onde arriscas a fiabilidade. A sua gama tem três degraus claros: Haiku (o rápido e barato, à volta de ~1 $ input / ~5 $ output), Sonnet (o equilibrado, ~3 $ / ~15 $) e Opus (o topo de gama, ~5 $ / ~25 $). Todos com janela de contexto enorme (até 1M de tokens nos modelos atuais) sem sobretaxa por contexto longo. Se o teu produto vive de gerar ou rever código, ou de agentes que executam tarefas durante minutos, o Claude costuma render acima do seu preço.

Nota

Os números do Claude que damos são as faixas por degrau (Haiku / Sonnet / Opus) a meados de 2026; a Anthropic publica os números exatos por modelo na sua página de preços. A cache de prompt e o modo batch aplicam-se tal como no resto e reduzem muito o custo real em produção.

Google Gemini

O que melhor combina preço e capacidade na faixa média. Os seus modelos Flash são baratíssimos para o que dão (desde ~0,10–0,30 $ de input nas versões leves, até ~1,50 $ no Flash mais recente), e os Pro competem de igual para igual com os grandes em qualidade (~2–4 $ de input / ~12 $ de output, com um salto de preço ao ultrapassar os 200K de contexto). O Gemini brilha em multimodalidade (imagem, áudio, vídeo) e tem um nível gratuito generoso via Google AI Studio para testar antes de pagar.

Open source via Groq, Together AI e Fireworks

Aqui está o dinheiro barato. Modelos abertos potentes —DeepSeek, Llama, Qwen, Kimi e companhia— servidos por fornecedores que só põem as GPU. Os preços vão de ~0,05 $ a ~0,90 $ por milhão de tokens na maioria dos modelos, uma fração do que custam os proprietários. Cada fornecedor tem a sua graça:

  • Groq: a velocidade. Os seus chips próprios (LPU) servem a 500+ tokens por segundo. Se precisas de respostas instantâneas, é a referência.
  • Together AI e Fireworks: infraestrutura própria (H100/H200/B200), sem intermediário, preço por token muito competitivo e catálogo amplo de modelos abertos.

O custo: a qualidade média dos open source ainda vai um passo atrás dos melhores GPT-5 e Opus no mais exigente, embora a distância se feche a cada trimestre.

Tabela comparativa

Faixas orientativas por milhão de tokens a meados de 2026. Confirma sempre o número exato no site oficial do fornecedor.
Fornecedor / gamaInput ($/MTok)Output ($/MTok)Ganha emQuando usar
OpenAI · mini/nano~0,10–0,15~0,40–0,60Equilíbrio + ecossistemaTarefas leves em volume com SDK maduro
OpenAI · GPT-5 (topo)~1,25–5~10–30Qualidade e raciocínioO mais exigente, se já estás na stack deles
Anthropic · Haiku~1~5Rápido e barato dos grandesVolume com boa qualidade e contexto longo
Anthropic · Sonnet~3~15Código e agentes equilibradosO cavalo de batalha para produto
Anthropic · Opus~5~25Código e agentes de topoTarefas críticas de longa duração
Google · Gemini Flash~0,10–1,50~0,40–9Preço/qualidade e multimodalFaixa média, imagem/áudio/vídeo
Google · Gemini Pro~2–4~12Qualidade perto do topo, barataAlta qualidade sem pagar preço premium
Open source (Groq/Together/Fireworks)~0,05–0,90~0,10–1Preço (e velocidade na Groq)Volume, custo mínimo, autonomia
Deslize para ver a tabela completa

Qual escolher consoante o teu caso

A tabela está bem, mas a decisão concretiza-se com cenários específicos.

Precisas da máxima qualidade e o dinheiro é secundário. GPT-5 topo de gama ou Claude Opus. Para código e agentes que executam tarefas longas, o Claude costuma ter vantagem; para conhecimento geral e raciocínio puro, GPT-5. O Gemini Pro é a terceira opção séria e muitas vezes mais barata.

Precisas de qualidade razoável ao menor custo possível. Modelos open source via Together ou Fireworks, ou os «mini/flash» dos grandes. Aqui está 80% das tarefas reais: classificar, resumir, extrair, responder a perguntas com contexto. Não pagues preço Opus para etiquetar emails.

Precisas de velocidade acima de tudo. Groq. Quando a tua IA responde a um utilizador em tempo real e cada milissegundo conta, os seus 500+ tokens/s não os iguala quase ninguém, e ainda por cima a preço open source.

Estás a prototipar e ainda não sabes que modelo queres. Não te cases com nenhum ainda: usa o OpenRouter (secção seguinte) e muda de modelo mudando uma string.

Dica

Padrão que poupa muito em produção: encaminhamento por dificuldade. Manda as tarefas fáceis para um modelo barato e só escala para o caro quando a tarefa o pede. Muitas equipas usam um modelo pequeno como filtro e reservam o grande para o que realmente precisa. Bem feito, corta a fatura sem que se note na qualidade.

OpenRouter: o atalho para não te casares com ninguém

Gerir cinco contas, cinco chaves e cinco faturas para comparar modelos é uma dor de cabeça. O OpenRouter resolve isso: um único endpoint —compatível com a API da OpenAI, pelo que migrar é quase mudar o URL base— e uma única chave para falar com centenas de modelos de todos os fornecedores. Uma só fatura.

O que te dá:

  • Testar sem fricção. Mudas de GPT-5 para Claude para um Llama aberto mudando o nome do modelo no pedido. Zero código novo.
  • Encaminhamento automático. Pode mandar o teu pedido para o fornecedor mais barato ou mais rápido que sirva esse modelo, e fazer failover se um cair.
  • Uma fatura para tudo. Em vez de acertar gastos em cinco painéis.

Cobra uma pequena margem sobre o preço do fornecedor, por isso para uma app em produção de alto volume talvez te interesse ir direto ao fornecedor mais barato. Mas para prototipar, comparar e não ficares preso a uma só casa, compensa de sobra.

Chamada básica ao OpenRouter (compatível com o SDK da OpenAI)
from openai import OpenAI

client = OpenAI(
  base_url="https://openrouter.ai/api/v1",
  api_key="A_TUA_CHAVE_DO_OPENROUTER",
)

resposta = client.chat.completions.create(
  # Muda esta string para mudar de modelo e de fornecedor:
  model="anthropic/claude-sonnet-4-6",
  messages=[{"role": "user", "content": "Resume isto em 3 pontos: ..."}],
)

print(resposta.choices[0].message.content)

Para quem é cada coisa

OpenAI se valorizas o ecossistema mais maduro, a melhor documentação e não queres pensar demasiado: é a opção segura, embora raramente a mais barata.

Anthropic (Claude) se o teu produto vive do código, de agentes que executam tarefas longas ou de fiabilidade em tarefas críticas, e a janela de contexto enorme te dá jeito.

Google Gemini se queres alta qualidade sem pagar preço premium, precisas de multimodalidade (imagem, áudio, vídeo) ou de um nível gratuito generoso para começar.

Open source (Groq/Together/Fireworks) se processas volume, o custo por token é a tua métrica principal, ou queres independência dos grandes —e, no caso da Groq, velocidade bruta.

OpenRouter se estás a começar, a comparar, ou simplesmente não queres prender-te a um fornecedor enquanto o mercado continua a mexer-se.

A verdade incómoda é que não existe a melhor API: existe a melhor combinação para o teu caso, e quase sempre é mais do que uma ao mesmo tempo —um modelo barato para o grosso, um caro para o difícil, e um agregador para não te acorrentares—. Começa por perceber a tua mistura de input e output, testa duas ou três opções com o OpenRouter, e deixa a fatura real, não o folheto, dizer-te qual fica.

FAQ

Por tokens, não por palavras nem por pedidos. Um token é um pedaço de texto (≈ 4 caracteres ou 0,75 palavras em inglês). Pagas em separado pelos tokens que entram (o teu prompt + o contexto) e pelos que saem (a resposta do modelo). O preço expressa-se por milhão de tokens (MTok), e o de saída é bastante mais caro do que o de entrada.

Os modelos open source servidos pela Groq, Together AI ou Fireworks são o mais barato: muitos abaixo de 1 $ por milhão de tokens, e os mais pequenos rondam os 0,10 $. Dos grandes proprietários, os modelos «mini» ou «flash» (as versões leves da OpenAI, Gemini ou Haiku da Anthropic) são os baratos. A opção premium de cada casa custa várias vezes mais.

Em tarefas exigentes —raciocínio, código, agentes de longa duração— os modelos de topo de gama da OpenAI (família GPT-5) e da Anthropic (Claude Opus) marcam o teto, com o Google Gemini Pro muito perto. Para a maioria das tarefas do dia a dia, os modelos intermédios (Sonnet, Gemini Flash, GPT mini) dão de sobra por uma fração do preço.

O OpenRouter é um agregador: um único endpoint e uma única chave para aceder a centenas de modelos de todos os fornecedores. Poupa-te a gerir várias contas e faturas, deixa-te mudar de modelo mudando uma string, e encaminha o teu pedido para o fornecedor mais barato ou mais rápido. Cobra uma pequena margem, mas para prototipar e comparar compensa de sobra.

Depende do uso. A subscrição (ChatGPT Plus, Claude Pro) é fixa e serve bem para uso humano interativo. A API paga-se por consumo e é o que precisas para integrar IA no teu produto, automatizar ou processar volume. Se estás a programar algo, é a API; se só conversas com o modelo, a subscrição costuma sair mais em conta.

Compartilhar
Newsletter

Receba os próximos guias no seu e-mail

Ideias e recursos de IA e marketing, sem enrolação. O que funciona e como aplicar.

Ideias e recursos sem spam. Cancela quando quiseres.

Este guia está ajudando?

Inscrever-se