Contact Us

The enterprise-grade AI Gateway for security-conscious teams. Protect your data, govern spend, and account for usage.

Read Documentation→

Product

  • Features
  • Security
  • Pricing
  • Docs

Company

  • About Us
  • Blog
  • Playground
  • Contact Us

© 2026 Shim. All rights reserved.

Trust · Care · Precision
SecurityPrivacy PolicyTerms of Service
Contact Us

The enterprise-grade AI Gateway for security-conscious teams. Protect your data, govern spend, and account for usage.

Read Documentation→

Product

  • Features
  • Security
  • Pricing
  • Docs

Company

  • About Us
  • Blog
  • Playground
  • Contact Us

© 2026 Shim. All rights reserved.

Trust · Care · Precision
SecurityPrivacy PolicyTerms of Service
Contact Us
Back to Blog|Home
Cost Optimization

Fintech'ler İçin LLM Maliyet Optimizasyonu

Fintech ekipleri için LLM maliyet optimizasyonu: model yönlendirme, önbellekleme, toplu işleme ve bütçe limitleriyle yapay zeka harcamalarını kontrol altına alın.

July 9, 20268 min read

Bain & Company verilerine göre Aralık 2024'ten Aralık 2025'e kadar ortalama token maliyeti yarıya inerken token tüketimi 4,5 kat arttı. Token fiyatları düşerken ekipler yeni frontier modellere geçiş yaptı ve ajan mimarileri tüketimi katladı; Bain'in bulgusu, eski nesil modeller fiyat olarak düşse de tüketimin büyük çoğunluğunun yeni frontier modellerde yoğunlaştığı yönünde. Yazılım mühendisliğinde bile token harcaması hâlâ işgücü maliyetinin yüzde 1-2'si düzeyinde, hedef yüzde 20-30. Fintech ekiplerinde kredi skorlama, doküman analizi ve dolandırıcılık tespiti pipeline'ları her sprint'te genişliyor, yapay zeka maliyeti de onlarla birlikte.

Model Yönlendirme ile Trafik Dağılımını Fiyat Farkına Göre Ayarlayın

Frontier LLM modelleri arasında 5 ila 25 kat fiyat farkı bulunuyor. Anthropic'in güncel serisinde Haiku 4.5 milyon token başına 1/5 dolar, Sonnet 4.6 ise 3/15 dolar, Opus 4.7 ise 5/25 dolar maliyetle çalışıyor. Daha geniş perspektiften bakıldığında, Claude Opus 4 ile Haiku 3 arasında 60 kat maliyet farkı var: Opus 4 milyon token başına 15/75 dolar, Haiku 3 ise 0.25/1.25 dolar.

Çoklu model yönlendirme bu farkı kullanır. Basit sınıflandırma, duygu analizi veya şablon yanıtlar ucuz modele gider. Karmaşık muhakeme gerektiren görevler, örneğin kredi başvurusu değerlendirmesi veya düzenleyici metin yorumlama, frontier modele yönlendirilir.

Bunu doğru uygulayan ekipler trafiğin yüzde 70-90'ını ucuz katmana yönlendiriyor. Pahalı model yalnızca gerçekten zor olan kuyruk için ayrılıyor. AT&T bu modeli büyük ölçekte doğruladı: günlük 8 milyar token işlerken büyük "süper ajanlar"ın görevleri küçük, alan özgü modellere yönlendirdiği mimariyle yüzde 90 maliyet azaltımı ve 3 kat hız artışı bildirdi.

SHIM bu tür otomatik model yönlendirmesini yapmaz. OpenAI, Anthropic ve Google için yerel API şemalarını korur; sağlayıcı seçimi, karmaşıklık sınıflandırması ve failover politikası uygulama tarafında açıkça tanımlanmalıdır.

Prompt Önbellekleme ile Tekrarlayan İçeriği Onda Bir Fiyata İşleyin

Fintech uygulamalarında sistem promptları uzundur. Uyumluluk kuralları, müşteri segmentasyonu mantığı, yanıt formatları. Her API çağrısında bu içerik baştan işleniyor ve her seferinde tam fiyat ödeniyor.

Prompt önbellekleme ile tekrarlayan içerik normal giriş fiyatının yaklaşık onda biriyle işlenir. İlk yazma 1,25 kat maliyetle gerçekleşir, ama bu fazlalık bir veya iki tekrar kullanımda geri kazanılır.

Somut hesap: günlük 500 konuşma işleyen, 2.000 tokenlik sistem komutuna sahip bir destek botu. Önbellekleme olmadan, o sistem komutunun tam fiyatını günde 500 kez ödüyorsunuz. Önbelleklemeyle bir kez tam fiyat, 499 kez ise çok küçük bir oran. Bu tek optimizasyon, orta ölçekli bir uygulama için yıllık on binlerce dolar tasarruf sağlayabiliyor. Fintech'te kredi skorlama promptları, KYC doğrulama şablonları ve dolandırıcılık tespit kuralları hep aynı yapıyı taşır; 2.000 tokenlik bir KYC şablonu günde 500 kez çağrılıyorsa, aynı hesap bu pipeline için de geçerli. Akıllı önbellekleme stratejileri hakkında detaylı bilgiyi ayrı bir yazımızda ele aldık.

24 Saatlik Pencerede Toplu İşleme ile Yüzde 50 İndirim

Her LLM çağrısının anlık yanıt vermesi gerekmiyor. Gece çalışan risk raporları, toplu KYC taramaları, AML batch kontrolleri, aylık müşteri segmentasyonu analizleri. Bunların hiçbiri milisaniye gecikme gerektirmiyor.

Toplu işleme API'leri bu kategori için hem giriş hem çıkış tokenlarında yaklaşık yüzde 50 indirim sunuyor. İstekler asenkron olarak, genellikle 24 saatlik bir pencerede işleniyor.

Toplu işleme ile önbellekleme bir arada kullanıldığında maliyet standart oranın 15-20 katı daha ucuz hale gelebiliyor. Aynı prompt yapısıyla binlerce dokümanı batch olarak işlerken hem önbellek indirimi hem toplu işleme indirimi üst üste biniyor.

Fintech ekipleri için pratik uygulama: gündüz gelen dokümanları kuyruğa al, gece batch API ile işle, sabah sonuçları sun. LLM bütçe limitleri ile her batch işinin harcama tavanını önceden belirleyebilirsiniz.

Bağlam Disiplini ile 500.000 Token İsrafını Önleyin

Ajanlı sistemlerde bağlam yönetimi kritik. 10.000 tokenlik bir sistem komutu, 50 turlu bir oturumda modelin tek kelime üretmesinden önce 500.000 giriş tokeni tüketir. Eşzamanlı kullanıcı sayısıyla çarpın, rakamlar hızla büyür.

Çözüm: RAG (Retrieval Augmented Generation) ile yalnızca ilgili bağlam parçalarını göndermek. Tam transkript yerine özet, tüm müşteri geçmişi yerine son 5 işlem, tüm düzenleyici metin yerine ilgili madde. 50 turlu bir oturumda RAG ile her turda gönderilen bağlamı 10.000'den 1.200 tokene indirirseniz, toplam giriş tüketimi 500.000 yerine 60.000 tokene düşer, yüzde 88 azalma.

Çıkış Tokenları Girişten 5-8 Kat Pahalı

Kredi değerlendirme raporları, müşteriye sunulan red gerekçeleri, AML belgeleri. Hepsi uzun format çıkış gerektiriyor. Ve çıkış tokenları giriş tokenlarından çok daha pahalı. GPT-5.1'de giriş milyon token başına 1,25 dolar iken çıkış 10 dolar: 8 kat fark.

ModelGiriş ($/M token)Çıkış ($/M token)Fark
GPT-5.1$1,25$10,008x
Claude Opus 4$15,00$75,005x
Claude Haiku 3$0,25$1,255x

Çıkış maliyetini düşürmek için: yanıt uzunluğunu sınırlayın (max_tokens), yapılandırılmış çıkış formatları kullanın (düz metin yerine JSON), ve uzun raporları batch API ile üretin. Bir kredi değerlendirme pipeline'ı günlük 200 milyon token tüketiyorsa ve çoğunluğu çıkış ağırlıklıysa, Claude Haiku 3 üzerinde max_tokens'ı 500'den 150'ye kısıtlamak günlük çıkış token sayısını yüzde 70 azaltır, bu da Haiku 3'ün 1,25 $/M çıkış fiyatıyla günde yüzlerce dolar tasarruf demektir.

Düzenleyici Zorunluluklar ve Uyumluluk Maliyeti

Finans sektörü tek bir yılda 157 yapay zeka ile ilgili düzenleyici güncellemeyle karşılaştı. Bu rakam önceki hacimlerin neredeyse iki katı. 2025'te büyük işletmeler uyumsuzluk dahil yapay zeka risklerine bağlı toplam 4,4 milyar dolarlık mali kayıp yaşadı. AB Yapay Zeka Yasası kapsamındaki yaptırımlar 35 milyon Euro veya küresel yıllık cironun yüzde 7'sine kadar çıkabiliyor. Yüksek riskli yükümlülükler 2 Ağustos 2026'da yürürlüğe giriyor. Küresel yapay zeka yönetişim ve uyumluluk harcamalarının 2026'da 2,54 milyar dolara, 2034'te 8,23 milyar dolara ulaşması bekleniyor.

AB Yapay Zeka Yasası yüksek riskli sistemler için istek bazında loglama ve denetlenebilirlik gerektiriyor. Hangi modele hangi veri gönderildi, hangi yanıt üretildi, hangi kullanıcı ne kadar harcadı: bu kayıtlar 2 Ağustos 2026 itibarıyla zorunlu hale gelecek. AI FinOps yaklaşımı maliyet görünürlüğü ile uyumluluk kaydını aynı veri altyapısında çözüyor.

Ekip ve Pipeline Bazında Token Tüketimini İzleyin

Bain verisi tüketimin yüzde 95'inin küçük bir kullanıcı diliminde toplandığını gösteriyor: şirketlerin en iyi yüzde 5'lik kullanıcı dilimi, diğer yüzde 95'in birlikte tükettiğinden daha fazla token harcıyor. Anahtar bazlı izleme olmadan bu dilimi tespit etmek mümkün değil.

Bir kredi skorlama pipeline'ı günde 200 milyon token tüketirken müşteri destek botu 20 milyonda kalabilir. Kredi skorlama pipeline'ı çıkış ağırlıklıysa, ilk kaldıraç model yönlendirme ve max_tokens sınırlaması: Haiku 3 üzerinde çıkış tokenını kısıtlamak en hızlı etkiyi gösterir. Destek botu gibi giriş ağırlıklı, tekrarlayan promptları olan bir pipeline'da ise önbellekleme öncelikli; 2.000 tokenlik sistem komutu günde 500 kez çağrılıyorsa, önbellekleme tek başına o pipeline'ın giriş maliyetini onda bire düşürür.

Exadel'in çerçevesine göre bu kaldıraçlar birlikte uygulandığında çıkarım maliyeti kalite feda edilmeden yüzde 50-80 oranında düşürülebilir.

SHIM, desteklenen yerel sağlayıcı rotaları için PII yer tutucu işleme, politika ve maliyet muhasebesi sunar. Yönlendirme ve önbellekleme uygulama sorumluluğundadır; kalıcı istek kayıtları ham gövdeleri içermez. AB Yapay Zeka Yasası kapsamındaki kanıt saklama gereksinimleri için ayrıca uygun bir kayıt altyapısı kurulmalıdır.

Back to all articlesGet Started Free

The enterprise-grade AI Gateway for security-conscious teams. Protect your data, govern spend, and account for usage.

Read Documentation→

Product

  • Features
  • Security
  • Pricing
  • Docs

Company

  • About Us
  • Blog
  • Playground
  • Contact Us

© 2026 Shim. All rights reserved.

Trust · Care · Precision
SecurityPrivacy PolicyTerms of Service