Geliştirici

Yapay zeka Çıkarım Maliyet Hesaplayıcı

OpenAI, Anthropic ve diğer LLM sağlayıcıları için AI modeli çıkarım maliyetlerini hesaplayın. Modeller arasında fiyatları karşılaştırın, token kullanımına göre aylık harcamayı tahmin edin ve AI altyapı bütçenizi optimize edin.

Bu araç size yardımcı oldu mu?

Yapay zeka Çıkarım Maliyet Hesaplayıcı nedir?

Bir AI çıkarım maliyeti hesaplayıcı, token kullanımı, token başına fiyatlandırma ve istek hacmi arasındaki ilişkiyi modelleyerek AI API çağrılarına ne kadar harcayacağınızı tahmin eder. Üç temel girdi alır — her isteğin kullandığı token sayısı (girdi ve çıktı olarak bölünmüş), sağlayıcınızın milyon token başına ne kadar ücretlendirdiği ve günde kaç istek beklediğiniz — ve aylık maliyetinizi projeksiyon eder. AI çıkarım fiyatlandırması basit bir formüle uyar ancak ayrıntılar önemlidir: girdi tokenleri (promptunuz ve bağlamınız) her zaman çıktı tokenlerinden (modelin yanıtından) daha ucuzdur, fiyatlar sağlayıcılar ve model seviyeleri arasında büyük farklılık gösterir ve maliyetler hacimle doğrusal olarak ölçeklenir. GPT-4o-mini ile günde 10.000 sorgu işleyen bir sohbet botu ayda $30 tutabilirken, aynı hacim Claude Opus'ta $300'ü aşabilir. Bu hesaplayıcı sağlayıcıları karşılaştırmanıza, kullanım durumunuz için doğru model seviyesini seçmenize, bir AI özelliği başlatmadan önce maliyetleri tahmin etmenize ve çıkarım bütçenizin gerçekten nereye gittiğini anlamanıza yardımcı olur. AI destekli uygulamalar oluşturan geliştiriciler, ürün yöneticileri ve girişimcılar için tasarlanmıştır.

Bu Hesap Makinesi Ne Zaman Kullanılmalı

  • Bir AI-powered özelliği başlatmadan önce bütçeleme — altyapı harcamalarını anlamak için beklenen istek hacimlerinde aylık maliyetleri tahmin etme.
  • Model sağlayıcılarını ve seviyelerini karşılaştırma — en uygun maliyetli seçeneği bulmak için GPT-4o, Claude Opus, GPT-4o-mini ve Claude Haiku üzerinde aynı iş yükünü modelleme.
  • Kendi sunucunuzu barındırma ile API'yi değerlendirme — open-weight modeli kendi sunucunuzda barındırmanın token başına ödemeli API fiyatlandırmasından daha ucuz hale geldiği hacim eşiğini belirleme.
  • Prompt tasarımını optimize etme — daha kısa promptlar, önbelleğe alınmış sistem promptları ve azaltılmış çıktı uzunluklarının maliyet etkisini anlama.
  • Ölçek için planlama — günlük istekler 1K'dan 100K'ya arttıkça maliyetlerin nasıl büyüdüğünü projeksiyon etme ve maliyet optimizasyonunun kritik hale geldiği noktayı belirleme.
  • AI altyapı harcamalarını haklı çıkarma — paydaşlara mevcut ve projeksiyon edilmiş hacimlerde AI çıkarımının tam olarak ne kadara mal olduğunu göstererek veriye dayalı bütçe istekleri oluşturma.

Adımlar:

  1. İstek başına girdi token sayısını girin (promptunuz + bağlamınız).
  2. İstek başına çıktı token sayısını girin (modelin yanıtını).
  3. Sağlayıcınızın milyon token başına girdi maliyetini girin.
  4. Sağlayıcınızın milyon token başına çıktı maliyetini girin.
  5. Beklenen günlük istek hacmini girin.
  6. Tahmini aylık maliyeti, token başına maliyeti ve dolar başına tokeni inceleyin.

Formül

Aylık Maliyet = İstek/Gün × 30 × [(Girdi Tokenleri × Girdi Maliyeti / 1M / 1.000.000) + (Çıktı Tokenleri × Çıktı Maliyeti / 1M / 1.000.000)] Token Başına Maliyet = (Girdi Tokenleri × Girdi Maliyeti / 1M + Çıktı Tokenleri × Çıktı Maliyeti / 1M) / (Girdi Tokenleri + Çıktı Tokenleri) Dolar Başına Token = 1 / Token Başına Maliyet Örnek: Girdi Tokenleri = 1.000, Çıktı Tokenleri = 500 Girdi Maliyeti = $2,50/1M, Çıktı Maliyeti = $10,00/1M İstek/Gün = 10.000 İstek başına maliyet = (1.000 × $2,50 / 1M) + (500 × $10,00 / 1M) = $0,0025 + $0,0050 = $0,0075 Aylık Maliyet = 10.000 × 30 × $0,0075 = $2.250/ay

Kullanım Alanları

  • Bir AI-powered özelliği başlatmadan önce bütçeleme — altyapı harcamalarını anlamak için beklenen istek hacimlerinde aylık maliyetleri tahmin etme.
  • Belirli bir kullanım durumu için sağlayıcılar (OpenAI, Anthropic, Google, open-weight) arasında fiyatları karşılaştırma.
  • Göreviniz için amiral gemisi modeli mi yoksa daha küçük, daha ucuz modeli mi kullanacağınıza karar verme.
  • Farklı hacimlerde kendi sunucunuzu barındırma ile API çağrıları arasındaki kırılma noktasını değerlendirme.
  • Token israfını azaltmak ve maliyetleri düşürmek için prompt tasarımını optimize etme.
  • Kullanıcı tabanınız günlük 1K'dan 100K'ya büyüdükçe maliyetlerin nasıl ölçeklendiğini tahmin etme.

Temel Faydalar

  • Herhangi bir sağlayıcı ve model kombinasyonu için aylık AI API maliyetlerini anında tahmin etme
  • OpenAI, Anthropic, Google ve open-weight model seçenekleri arasında fiyatları karşılaştırma
  • İstek hacmi prototip'ten production'a büyüdükçe maliyet ölçeklemesini modelleme
  • Kalite gereksinimlerinizi karşılayan en ucuz model seviyesini belirleme
  • Prompt optimizasyonu ve önbelleğe alma stratejilerinin maliyet etkisini anlama
  • Bir AI sağlayıcısına bağlanmadan önce altyapı bütçelerini güvenle planlama
  • Kayıt gerekmeden ücretsiz kullanım

Uzman İpuçları

  • Kalite standartlarınızı karşılayan en ucuz modelle başlayın ve yalnızca doğruluk yetersizse yükseltme yapın — maliyet farkı genellikle 10–30×'tır
  • Sistem promptunuzu kısa ama etkili olacak şekilde optimize edin — tekrarlayan bir sistem promptundaki her token her istek ile çarpılır
  • Tekrarlayan önek içeren iş yükleri için girdi token maliyetlerini %50–90 azaltmak amacıyla prompt önbelleğe alma kullanın
  • Yalnızca toplam harcamayı değil, özellik başına maliyeti takip edin — bu, hangi AI özelliklerinin en pahalı olduğunu ve optimizasyonun en büyük etkiye sahip olacağı yeri ortaya koyar
  • Trafik artışlarından beklenmedik faturalardan kaçınmak için aylık limitinizin %50'si ve %80'i için bütçe uyarıları ayarlayın

Kaçınılması Gereken Yaygın Hatalar

  • Yalnızca girdi token maliyetlerini hesaplayıp çıktı tokenlerinin genellikle token başına 2–8× daha pahalı olduğunu unutma
  • Her istekle gönderilen ancak büyük hacimde önemli maliyet biriken sistem prompt tokenlerini göz ardı etme
  • Çoklu sohbet uygulamalarında bağlamın her turda büyüdüğü sohbet geçmihesini hesaba katmama
  • Amiral gemisi modellerinin her zaman gerekli olduğunu varsayma — daha küçük modeller basit görevlerde maliyetin %5–10'una %90+ doğruluk elde eder
  • Yeniden denemeler, hız kısıtlaması hataları ve beklenenden daha uzun çıktılar oluşturan uç durumlar için bütçe ayırmama

Anahtar Terimler Açıklandı

Token: Bir AI modeli tarafından işlenen metnin temel birimi — yaklaşık 0,75 İngilizce kelime veya 1,5 Çince/Japonca karakter. Hem girdi hem de çıktı tokenleri ayrı ayrı faturalandırılır.
Girdi Tokenleri: Modelin yanıt oluşturmadan önce okuduğu promptunuzdaki ve bağlamınızdaki tokenler. Genellikle çıktı tokenlerinden daha düşük fiyatlandırılır.
Çıktı Tokenleri: Modelin yanıtında oluşturduğu tokenler. Üretim hesaplama sınırlı ve sıralı olduğu için girdi tokenlerinden daha pahalıdır.
Bağlam Penceresi: Bir modelin tek bir istekte işleyebileceği maksimum token sayısı (girdi + çıktı birlikte). Aşıldığında kırpma veya bölme gerekir.
Prompt Önbelleğe Alma: Sık kullanılan öneklerin (sistem promptları gibi) sağlayıcı tarafından önbelleğe alındığı ve daha düşük bir oranda faturalandırıldığı maliyet optimizasyonu tekniği.
Token Başına Fiyatlandırma: Milyon token başına alınan maliyet, genellikle modele göre değişen ayrı girdi ve çıktı oranlarına bölünür.

İlgili Kavramlar

  • GPU Hesaplama Maliyeti Hesaplayıcı: Kendi sunucunuzu barındırmayı haklı çıkaran iş yükleri için, GPU maliyetlerini anlamak yerel çıkarım ile API fiyatlandırmasını karşılaştırmaya yardımcı olur. GPU hesaplama maliyeti hesaplayıcımız bulut GPU saatlik oranlarını token verimliliğine göre modeler.
  • Bulut Hosting Maliyeti Hesaplayıcı: AI çıkarım altyapısı genellikle diğer bulut hizmetlerinin yanında çalışır — bulut hosting maliyeti hesaplayıcımız eksiksiz altyapı yığını için bütçe planlamanıza yardımcı olur.
  • API Monetizasyon Hesaplayıcı: AI çıkarımı kullanan ve kullanıcılardan ücret alan bir ürün oluşturuyorsanız, çıkarım maliyeti ile istek başına gelir arasındaki marjı anlamak kritiktir. API monetizasyon hesaplayıcımız bu birim ekonomisini modeler.
  • Birim Ekonomi Hesaplayıcı: İstek başına AI çıkarım maliyeti, ürününüzün birim ekonomisinde girdidir — CAC, LTV ve istek başına maliyetlerin birleştirilmesi gerçek kârlılığı ortaya koyar.
  • Girişim Yol Haritası Hesaplayıcı: Yüksek çıkarım maliyetleri yanma oranını önemli ölçüde etkileyebilir — girişim yol haritası hesaplayıcımız AI altyapı maliyetlerinin finansal yol haritanızı nasıl etkilediğini modellemenize yardımcı olur.

Örnek

Bir müşteri hizmetleri sohbet botu sorgu başına 800 girdi tokeni (sistem promptu + sohbet geçmişi) gönderir ve 400 çıktı tokeni alır. GPT-4o-mini'yi $0,15/1M girdi ve $0,60/1M çıktı ile kullanarak, günde 15.000 sorgu ile: İstek başına maliyet = (800 × $0,15 / 1M) + (400 × $0,60 / 1M) = $0,00012 + $0,00024 = $0,00036 Aylık Maliyet = 15.000 × 30 × $0,00036 = $162/ay GPT-4o'ya $2,50/1M girdi ve $10,00/1M çıktı ile yükseltme: İstek başına maliyet = (800 × $2,50 / 1M) + (400 × $10,00 / 1M) = $0,002 + $0,004 = $0,006 Aylık Maliyet = 15.000 × 30 × $0,006 = $2.700/ay — aynı hacim için 16,7× maliyet artışı.

Sonuçlarınızı Yorumlama

Aylık maliyet tahmini, birincili planlama sayınızdır — belirli hacim ve fiyatlandırma altında gerçekten ne ödeyeceğinizi temsil eder. Token başına maliyet, her metin biriminin ne kadar pahalı olduğunu gösterir; bu modelleri karşılaştırmak için kullanışlıdır. Dolar başına token, $1 için ne kadar metin üretebildiğinizi gösterir; bu kapasiteyi anlamak için faydalıdır. Aylık maliyetiniz yüksek görünüyorsa, azaltma için en büyük kaldıraçlar: (1) görev karmaşıklığı izin veriyorsa daha küçük bir model seviyesine geçiş, (2) token sayısını azaltmak için prompt optimizasyonu, (3) tekrarlayan önekler için prompt önbelleğe alma uygulaması ve (4) sağlayıcı toplu iş fiyatlandırması sunduğunda istekleri birleştirme. Bu hesaplayıcının doğrudan API maliyetlerini modellediğini unutmayın. Tam maliyet resmi için ayrıca şunları da hesaba katın: yeniden denemeler (%5–15 ekleyin), sistem promptu yükü (istek başına sistem promptu tokenleri × hacim), çoklu uygulamalarda sohbet geçmişi büyümesi ve trafik artışları ile uç durumlar için %20–30 tampon. Sağlayıcıları karşılaştırırken, en ucuz token oranı her zaman en ucuz toplam değildir — daha kısa, daha özlü çıktılar üreten bir model, daha yüksek token oranında bile daha az çıktı tokeni kullanabilir ve daha ucuz olabilir.

Sıkça Sorulan Sorular

AI API çağrıları ne kadar tutar?
AI API maliyetleri modele ve sağlayıcıya göre büyük farklılık gösterir. 2025 itibarıyla: girdi tokenleri daha küçük modeller (GPT-4o-mini, Claude Haiku) için yaklaşık $0,15/milyon ile amiral gemisi modeller (GPT-4o, Claude Opus) için $15/milyon arasında değişmektedir. Çıktı tokenleri aynı kategoride genellikle girdi tokenlerinden 2–8× daha pahalıdır. Tipik bir müşteri hizmetleri sohbet botu sorgusu, 1.000 girdi ve 500 çıktı tokeni ile modele bağlı olarak yaklaşık $0,003–$0,015 tutar.
Çıktı tokenleri neden genellikle girdi tokenlerinden daha pahalıdır?
Çıktı tokenleri daha pahalıdır çünkü bunların üretilmesi modelin çıkarımı sıralı olarak çalıştırmasını gerektirir — her çıktı tokeni bir önceki tüm tokenlere bağlıdır, bu da üretimi bellek sınırlı girdi işlemesinin aksine hesaplama sınırlı hale getirir. Girdi tokenleri paralel olarak işlenebilir (hepsi için tek bir matris çarpımı),.setOutput tokenleri ise özyinelemeli bir döngüde birer birer üretilmelidir. Sağlayıcılar bu daha yüksek hesaplama maliyetlerini çıktı token oranlarına yansıtır, genellikle girdi oranının 2–8× katı.
Hangi kullanım hacminde kendi sunucunuzu barındırmak API çağrılarından daha ucuz hale gelir?
Kesim noktası model boyutunuza ve altyapı maliyetlerinize bağlıdır. Tek bir A100 GPU (~$2/saat) üzerinde 7B parametreli bir model için, kendi sunucunuzu barındırmak yaklaşık 500K–1M token/günlükte API çağrılarından daha ucuz hale gelir. Birden fazla GPU gerektiren daha büyük 70B modeller için eşik 5–10M token/günlük civarındadır. Bu hacimlerin altında, API token başına ödeme modeli genellikle daha uygun maliyetlidir çünkü yalnızca kullandığınız kadar ödersiniz, boşta duran GPU maliyetlerinden kaçınırsınız.
Prompt önbelleğe alma veya toplu işleme maliyetlerimi ne kadar azaltabilir?
Prompt önbelleğe alma, tekrarlayan önek içeren iş yükleri (sistem promptları gibi) için maliyetleri %50–90 azaltabilir. OpenAI Prompt Caching ve Anthropic Prompt Caching, sık kullanılan bağlamı otomatik olarak önbelleğe alır ve önbelleğe alınan tokenleri normal oranın %10–50'sine fiyatlandırır. Birden fazla isteği tek bir API çağrısında birleştirme (desteklendiğinde) istek başı yükü azaltabilir ve bazen %50 daha ucuz toplu iş fiyatlandırma kategorilerine uygun olabilir. Birlikte, uygun iş yükleri için önbelleğe alma ve toplu işleme çıkarım maliyetlerini %60–80 azaltabilir.
Bir özellik oluşturmadan önce token kullanımını nasıl tahmin ederim?
Bir prototip ile başlayın ve gerçek token sayılarını ölçün veya benzer kullanım durumlarından tahmin edin. Kaba bir kural: 1 token ≈ 0,75 İngilizce kelime (veya ≈ 1,5 Çince/Japonca karakter). Tipik bir müşteri desteği sorgusu 500–2.000 girdi tokeni ve 200–1.000 çıktı tokeni kullanır. Bir belge özetleme görevi, kaynak metnin her 4 karakteri için yaklaşık 1 token kullanır. Sistem promptları, sohbet geçmişi ve daha uzun çıktılar oluşturan uç durumlar için %20–30 bir tampon ekleyin.
Amiral gemisi ve daha küçük modeller arasındaki maliyet farkı nedir?
Amiral gemisi modeller (GPT-4o, Claude Opus) genellikle daha küçük modellerden (GPT-4o-mini, Claude Haiku) token başına 10–30× daha pahalıdır. Sınıflandırma, çıkarma veya basit soru-cevap gibi basit görevler için daha küçük modeller genellikle maliyetin %5–10'una %90–95 doğruluk elde eder. Anahtar görev karmaşıklığıdır: yaratıcı yazma, nüanslı akıl yürütme ve çok adımlı analiz amiral gemisi modellerinden daha fazla faydalanır, yapılandırılmış veri çıkarma ve basit sohbet botları ise daha küçük, daha ucuz modellerle iyi çalışır.
Girdi ve çıktı token limitleri maliyetlerimi nasıl etkiler?
Çoğu modelin bağlam penceresi limitleri vardır (ör. GPT-4o için 128K, Claude için 200K). Girdiniz limiti aşarsa, kırmanız veya bölmeniz gerekir, bu da karmaşıklık ekler ve potansiyel olarak maliyetleri artırır. Daha uzun bağlamlar girdi maliyetini de doğrusal olarak artırır — 10.000 token'lık bir sistem promptu 1.000 token'lık olandan 10× daha pahalıdır. Promptlarınızı kaliteyi korurken kısa tutacak şekilde optimize etmek, en etkili maliyet azaltma stratejilerinden biridir.
Maliyet kontrolü için akışlı API mi yoksa standart istek mi kullanmalıyım?
Akış (streaming), token başına maliyeti değiştirmez — yanıt akışla gelsin veya tek bir paketle gelsin aynı oridersiniz. Ancak akış, uzun yanıtlar için kullanıcı deneyimini iyileştirir ve çıktı gerekmediğinde üretimi erken iptal etmenizi sağlar, bu da iptal senaryolarında maliyet tasarrufu sağlayabilir. Maliyet kontrolü için daha büyük kaldıraç, prompt uzunluğunuzu optimize etmek ve görev karmaşıklığınız için doğru model seviyesini seçmektir.
AI harcamalarımı zaman içinde nasıl takip eder ve izlerim?
Çoğu sağlayıcı kullanım panoları ve faturalandırma API'leri sunar. Her API çağrısını token sayılarıyla birlikte kaydedin, ardından günlük/haftalık/aylık olarak toplayın. Aylık bütçenizin %50'si, %80'i ve %100'ü için bütçe uyarıları ayarlayın. Production iş yükleri için, hangi AI özelliklerinin en pahalı olduğunu ve optimizasyonun en büyük etkiye sahip olacağı yeri belirlemek için özellik başına veya kullanıcı başına maliyeti takip edin. LangSmith, Helicone ve OpenRouter gibi araçlar maliyet takip ara katmanları sunar.
Ham API tokenlerinin yanı sıra hangi gizli maliyetleri bütçelemeliyim?
Token maliyetlerinin yanı sıra şunları bütçeye ekleyin: (1) başarısız veya hız kısıtlamalı isteklerdeki yeniden denemeler, token harcamanıza %5–15 ekleyebilir; (2) her istekle gönderilen ancak değişmeyen sistem prompt tokenleri; (3) çoklu etkileşimlerde biriken sohbet geçmişi; (4) oluşturma aşamasındaki test ve geliştirme maliyetleri; (5) sağlayıcılar fiyatlandırma ayarladıkça olası maliyet artışları. Production iş yükleri için hesaplanan token maliyetinin %20–30 üzerine tampon koymak akıllıcadır.
Model versiyonlama çıkarım maliyetlerimi nasıl etkiler?
Sağlayıcılar düzenli olarak farklı fiyatlandırmaya sahip yeni model versiyonları yayınlar. GPT-4o, daha yeni ve genellikle daha hızlı olmasına rağmen GPT-4 Turbo'dan daha ucuzdur. Eski, kullanımdan kaldırılmış modellerde kalmak daha pahalıya mal olabilir veya maliyet optimizasyonlarına erişimi kaybedebilir. Seçiminizi düzenli olarak güncel fiyatlarla karşılaştırın — eski bir modelden daha yeni, daha ucuz bir modele geçmek birçok görevde eşit veya daha iyi kalite ile maliyetleri %30–70 azaltabilir.

Daha Fazla Araç Keşfedin

Tüm araç kütüphanemizden taze seçkiler.