Calcule os custos da API Google Gemini para Gemini 3.1 Pro, 3 Flash, 2.5 Pro, 2.5 Flash, 2.5 Flash-Lite e 2.0 Flash. Insira tokens para preços instantâneos. Estimador de custos Gemini gratuito.
Carregando calculadora...
Esta ferramenta te ajudou?
O que é Calculadora de Custos Gemini?
Uma Calculadora de Custos Gemini ajuda os desenvolvedores a estimar os custos da API para a família de modelos Gemini do Google. Com 6 modelos que variam do ultraeficiente Flash-Lite aos níveis Pro premium, o Gemini oferece alguns dos preços mais competitivos no mercado de IA. Estime custos com precisão para aplicativos de alto volume, cargas de trabalho empresariais e tudo entre eles.
Quando Usar Esta Calculadora
Orçar custos mensais de API antes de escalar um aplicativo alimentado por Gemini para produção
Comparar eficiência de custos entre Pro, Flash e Flash-Lite para diferentes tipos de carga de trabalho
Avaliar se o Gemini é mais barato que o OpenAI ou Anthropic para seu caso de uso específico
Estimar custos para um pipeline de classificação de alto volume usando Flash-Lite ou 2.0 Flash
Planejar custos de processamento de documentos de contexto longo ao trabalhar com a janela de 2M tokens do Gemini
Construir um painel de custos e precisar de pontos de preço por solicitação para cada modelo Gemini
Passos:
Selecione um modelo Gemini (3.1 Pro, 3 Flash, 2.5 Pro, 2.5 Flash, 2.5 Flash-Lite ou 2.0 Flash).
Insira a contagem de tokens de entrada.
Insira a contagem de tokens de saída.
Visualize a estimativa de custo instantânea.
Compare em toda a linha de modelos do Google para otimizar gastos.
Estimativa de custos para aplicativos de IA de alto volume
Planejar cargas de trabalho de contexto longo com a janela de 2M tokens do Gemini
Benefícios Principais
Estime os custos do Google AI instantaneamente em todos os 6 modelos
Compare os níveis de preço Pro, Flash e Flash-Lite
Nível gratuito disponível para testes e prototipagem
Não é necessário registro para a calculadora
Dicas Profissionais
Use Flash-Lite ou 2.0 Flash para todo processamento simples de alto volume
Use 3 Flash para cargas de trabalho de produção sensíveis à latência
Reserve 3.1 Pro para análise complexa e raciocínio
Aproveite os descontos de uso comprometido do Google Cloud para economias
Use o nível gratuito do Gemini para desenvolvimento e testes
Erros Comuns a Evitar
Usar modelos Pro para tarefas de classificação simples que o Flash pode lidar
Ignorar o Flash-Lite para cargas de trabalho de ultra alto volume
Não considerar o preço de contexto longo acima de 200K tokens
Esquecer os créditos do Google Cloud e descontos de uso comprometido
Termos Chave Explicados
Gemini 3.1 Pro: O mais recente modelo de raciocínio premium do Google
Gemini 3 Flash: O mais recente modelo otimizado para velocidade
Gemini 2.5 Flash-Lite: O modelo mais eficiente em termos de custo
Nível gratuito: Acesso à API sem custo com limites de taxa
Janela de contexto: Máximo de tokens suportados por solicitação (até 2M)
Conceitos relacionados
[object Object]
[object Object]
[object Object]
[object Object]
[object Object]
Exemplo
Usando Gemini 2.5 Flash com 5.000 tokens de entrada e 1.000 de saída: (5000/1000 × $0.0003) + (1000/1000 × $0.0025) = $0.0015 + $0.0025 = $0.004 por solicitação. Para 1M de solicitações diárias: $4.000/dia.
Interpretação dos seus resultados
A calculadora mostra dois componentes de custo: custo de entrada (baseado nos tokens do seu prompt) e custo de saída (baseado nos tokens gerados). Tokens de saída sempre custam mais do que tokens de entrada, portanto, manter prompts concisos e usar instruções do sistema para limitar o comprimento da resposta são maneiras práticas de reduzir custos.
Ao comparar modelos, concentre-se na complexidade da tarefa em vez de apenas no preço. Flash-Lite a $0.0001/$0.0004 é 20x mais barato que 3.1 Pro a $0.002/$0.012, mas o Pro lida com raciocínio nuances muito melhor. Para cargas de trabalho de produção, uma abordagem em camadas — Flash-Lite para tarefas simples, Flash para moderadas, Pro para complexas — geralmente produz a melhor relação custo-benefício.
O campo de custo total escala sua estimativa por solicitação para o volume esperado, ajudando você a prever gastos diários e mensais. Para cargas de trabalho comprometidas, considere os descontos de uso comprometido do Google Cloud que podem reduzir custos em 20-40%.
Perguntas Frequentes
Qual é a diferença entre os modelos Gemini Pro e Flash?
Gemini 3.1 Pro ($0.002/$0.012) e 2.5 Pro ($0.00125/$0.01) são para tarefas de raciocínio complexo. Os modelos Flash (3 Flash a $0.0005/$0.003, 2.5 Flash a $0.0003/$0.0025) são otimizados para velocidade. Flash-Lite ($0.0001/$0.0004) e 2.0 Flash ($0.0001/$0.0004) são os níveis mais baratos.
O Google oferece um nível gratuito?
Sim, o Google fornece um nível gratuito com limites de taxa para a API Gemini. Isso permite que os desenvolvedores testem e criem protótipos sem incorrer em custos. O nível gratuito está disponível para todos os modelos com cotas diárias.
Como o Gemini se compara ao GPT e Claude?
Gemini 2.5 Flash-Lite e 2.0 Flash são os modelos mais baratos entre todos os provedores a $0.0001/$0.0004. Gemini 3 Flash ($0.0005/$0.003) é competitivo com o GPT-5.4 Nano. Gemini 3.1 Pro ($0.002/$0.012) fica entre o GPT-5.4 e o Claude Sonnet 4.6.
Quais janelas de contexto os modelos Gemini suportam?
Gemini 2.5 Pro e Flash suportam janelas de contexto de até 1M de tokens. Gemini 3.1 Pro e 3 Flash suportam até 2M de tokens — as maiores janelas de contexto de qualquer provedor de IA importante.
Como calculo custo por solicitação vs custo por dia?
Insira suas contagens médias de tokens de solicitação para obter o custo por solicitação única. Multiplique pelo volume diário de solicitações para obter o custo diário. A calculadora mostra tanto custos por solicitação quanto custos escalados para que você possa planejar em qualquer volume.
Qual é a estrutura de preços de tokens para o Gemini?
O Gemini usa preços por 1K tokens, com taxas separadas para tokens de entrada e saída. Tokens de saída custam mais do que tokens de entrada em todos os modelos. Os preços são consistentes nas regiões onde a API está disponível.
Devo usar o Flash-Lite para todas as minhas tarefas?
Flash-Lite e 2.0 Flash são ideais para tarefas de alto volume e baixa complexidade, como classificação, resumo e extração de dados. Reserve os modelos Pro para tarefas que exigem raciocínio profundo, análise de múltiplas etapas ou acompanhamento de instruções complexas.
Existem descontos de volume para a API Gemini?
O Google Cloud oferece descontos de uso comprometido para cargas de trabalho previsíveis. Entre em contato com as vendas do Google Cloud para preços empresariais. Para a maioria dos desenvolvedores, escolher o nível de modelo certo (Flash-Lite para volume, Pro para complexo) é a otimização de custos mais eficaz.
Como funciona o preço de contexto longo?
Para entradas que excedem 200K tokens, alguns modelos Gemini cobram uma taxa por token mais alta. Use esta calculadora com suas contagens reais de tokens para obter estimativas precisas para cargas de trabalho de processamento de documentos longos.
Posso estimar custos multimodais (imagem/vídeo)?
Esta calculadora se concentra nos preços de tokens de texto. Entradas de imagens e vídeos são convertidas em equivalentes de tokens pela API. Para cargas de trabalho multimodais, estime os tokens de texto e adicione um buffer de 20-30% para sobrecarga de tokens de imagem.
Qual é o melhor modelo Gemini para chatbots?
Para chatbots conversacionais, o Gemini 3 Flash oferece o melhor equilíbrio entre velocidade e qualidade a $0.0005/$0.003. Para suporte ao cliente complexo que exige raciocínio profundo, o 3.1 Pro vale o prêmio. O Flash-Lite funciona para bots simples no estilo FAQ.