Seyahat ipuçları ve şehir rehberleri
AI Ops Katmanı ve LLM Router: Çoklu Model, Maliyet ve KVKK Uyumu
Yapay Zeka ve Ajanlar ·
LLM router nedir ve şirketler neden AI Ops katmanına ihtiyaç duyar?
LLM router, iş uygulamalarınızdan gelen her yapay zeka isteğini inceleyip o isteğe en uygun dil modeline yönlendiren ara katmandır. Bir yıl önce çoğu şirket tek bir sağlayıcının API anahtarını koda gömüp işe başlıyordu. Bugün aynı şirket; müşteri e-postalarını özetlemek için hızlı ve ucuz bir model, sözleşme analizi için güçlü bir model, kişisel veri içeren talepler için Türkiye’de çalışan bir model kullanmak istiyor. Üç modeli üç farklı yerden çağıran kod, kısa sürede yönetilemez hale geliyor.
Bu yazıda iş uygulamaları ile birden fazla model arasına konan AI Ops katmanını ele alıyoruz: yönlendirme kuralları, fallback, kişisel veri maskeleme, loglama, kalite değerlendirmesi ve bütçe sınırları. KVKK’nın 2024’te değişen 9. maddesinin yurt dışındaki modellere veri göndermeyi nasıl etkilediğini, EVREN ve Kumru gibi yerli seçeneklerin bu mimariye nereden bağlandığını ve OpenAI uyumlu tek bir arayüzün tedarikçi bağımlılığını nasıl azalttığını somut örneklerle anlatıyoruz.
Kısaca
- LLM router, her isteği veri hassasiyeti, maliyet, gecikme ve kaliteye göre doğru modele gönderir.
- AI Ops katmanı router’ın yanında fallback, PII maskeleme, loglama, değerlendirme ve bütçe kontrolünü de üstlenir.
- KVKK m.9 değişikliğiyle yurt dışına aktarım standart sözleşme gibi uygun güvencelerle mümkün; ama kural setinizi buna göre kurmanız gerekir.
- EVREN’in OpenAI uyumlu çıkarım servisi ve Kumru gibi yerli modeller, kişisel veri içeren istekler için güçlü bir rota seçeneği sunar.
- Uygulamalar tek bir OpenAI uyumlu arayüzle konuşursa model değiştirmek kod değil yapılandırma işi olur.
• • •
AI Ops katmanı tam olarak ne yapar?
Internative’in 2026’nın ilk yarısı için yayımladığı Türkiye yazılım sektörü raporu, yedinci trend olarak “AI operasyon katmanı”nı tanımlıyor: tek model çağrısı yerine gelen isteği doğru modele yönlendiren, hatayı yöneten ve izleme yapan bir ara katman. Aynı rapor ikinci trendde yerli dil modellerinin sahaya çıktığını ve “yerli LLM + global LLM router” biçimindeki hibrit mimarinin yaygınlaştığını yazıyor. Bizim projelerde gördüğümüz tablo da bu.
Pratikte AI Ops katmanı, uygulamalarınızın gördüğü tek bir uç noktadır. Arkasında birden fazla model sağlayıcısı, kural motoru, maskeleme servisi, log deposu ve değerlendirme hattı çalışır. Uygulama “bu müşteri talebini sınıflandır” der; hangi modelin, hangi bölgede, hangi bütçeyle bu işi yapacağına katman karar verir.
Router ile API gateway arasındaki fark
Klasik bir API gateway kimlik doğrulama, hız sınırı ve yönlendirme yapar ama isteğin içeriğine bakmaz. LLM router ise içeriği anlamak zorundadır: istemde T.C. kimlik numarası var mı, görev kısa bir sınıflandırma mı yoksa uzun bir akıl yürütme mi, kullanıcı hangi departmanda? Bu yüzden router genellikle gateway’in arkasında, içerik farkındalığı olan ayrı bir katman olarak kurulur.
Katmanın beş temel görevi
Yönlendirme isteği kurallara göre modele gönderir. Fallback sağlayıcı hata verdiğinde ya da yavaşladığında isteği yedek modele aktarır. Maskeleme kişisel veriyi modele gitmeden önce gizler ve yanıtta geri yerine koyar. Loglama ve değerlendirme her çağrının maliyetini, gecikmesini ve kalitesini kaydeder. Bütçe kontrolü ise departman, uygulama ya da kullanıcı bazında harcama sınırı uygular.
• • •
LLM router hangi kriterlere göre karar verir?
IBM Research’ün LLM router yazısı konuyu bir hava trafik kontrolörüne benzetiyor: router sorguyu değerlendirip kütüphanenizdeki en iyi değeri sunan modele gönderir; seçimi fiyat, kalite, gecikme ya da başka herhangi bir kritere göre yapabilirsiniz. Kurumsal tarafta bu listeye iki kriter daha eklenir: veri hassasiyeti ve verinin işlendiği yer.
| Kriter | Ne ölçülür? | Örnek kural | Dikkat edilecek nokta |
|---|---|---|---|
| Veri hassasiyeti | İstemde kişisel veya özel nitelikli kişisel veri var mı? | T.C. kimlik no, IBAN ya da sağlık verisi tespit edilirse şirket içi veya Türkiye’de işleyen modele git | Tespit hatalı olabilir; şüphede güvenli rotayı seçin |
| Maliyet | Token başına fiyat, aylık bütçe kalanı | Basit sınıflandırma ve özetleme küçük modele gider | En ucuz model her görevde en ucuz sonuç değildir; tekrar denemeleri de sayın |
| Gecikme | İlk token süresi ve toplam yanıt süresi | Canlı sohbet ekranları için hedef süreyi aşan model devre dışı kalır | Toplu işler gecikmeye toleranslıdır; ayrı kuyrukta çalıştırın |
| Kalite | Görev bazlı değerlendirme puanı | Sözleşme analizi yalnızca test setinde eşiği geçen modellere gider | Genel benchmark değil, kendi verinizle ölçün |
| Erişilebilirlik | Hata oranı, zaman aşımı, kota durumu | Art arda hata veren sağlayıcı geçici olarak devreden çıkar, istek yedeğe gider | Yedek model de aynı veri kuralına uymalı |
| Veri konumu | Modelin hangi ülkede çalıştığı, sözleşme durumu | Yurt dışı rotası yalnızca KVKK m.9 güvencesi olan sağlayıcılar için açılır | Sağlayıcının alt işleyenlerini de sorgulayın |
Kriterlerin sırası önemlidir. Biz kural motorunu her zaman önce veri hassasiyeti ve konumu, sonra kalite eşiği, en son maliyet ve gecikme sırasıyla kurguluyoruz. Böylece ucuz bir model, kişisel veri içeren bir isteği “daha hızlı” olduğu için asla alamaz.
• • •
KVKK 9. madde yurt dışındaki LLM’lere veri göndermeyi nasıl etkiler?
Kişisel veri içeren bir istemi yurt dışında çalışan bir modele göndermek, KVKK açısından yurt dışına aktarım anlamına gelir. 6698 sayılı Kanun’un 9. maddesi, 7499 sayılı Kanun’la (Resmî Gazete, 12.03.2024) değiştirildi ve yeni hükümler 01.06.2024’te yürürlüğe girdi. Uygulama esasları, 10.07.2024 tarihli Resmî Gazete’de yayımlanan yönetmelikle belirlendi.
Kurum’un yurt dışına aktarım sayfasına göre yeni düzende aktarım, 5. veya 6. maddedeki işleme şartlarından biri varsa ve aktarımın yapılacağı ülke için yeterlilik kararı bulunuyorsa yapılabiliyor. Yeterlilik kararı yoksa; ilgili kişinin haklarını kullanabilmesi ve aktarılan ülkede etkili kanun yollarına başvurabilmesi koşuluyla standart sözleşme, bağlayıcı şirket kuralları gibi uygun güvencelerden biri sağlanmalı. Standart sözleşme metni değiştirilemiyor ve imzadan itibaren beş iş günü içinde Kurum’a bildirilmesi gerekiyor. Ayrıca istisnai ve arızi aktarımlar için sınırlı durumlar tanımlanmış durumda.
Router tasarımına yansıması
Bu kurallar, LLM router’ın kural setine doğrudan yansımalı. Her model hedefi için “veri nerede işleniyor, hangi güvence var, sağlayıcı veri işleyen mi” sorularının yanıtı yapılandırmada tutulmalı; güvencesi olmayan bir yurt dışı modele kişisel veri içeren istek hiçbir koşulda gitmemeli. LLM sağlayıcısı sizin adınıza veri işleyen konumundadır; bu ilişkinin sözleşme ve denetim tarafını tedarikçi kaynaklı veri ihlali ve KVKK yazımızda ayrıntılı ele aldık. Bu yazı hukuki görüş değildir; somut aktarım senaryolarınızı hukuk danışmanınızla birlikte değerlendirmenizi öneririz.
Bir uyarı da sektör raporlarına: Internative raporu, KVKK kısıtı olan şirketler için yerli LLM’in “seçenek değil zorunluluk” olduğunu savunuyor. Değişen 9. madde uygun güvencelerle aktarıma izin verdiği için biz konuyu mutlak bir yasak olarak değil, risk ve maliyet dengesi olarak görüyoruz. Yerli model rotası, güvence yükünü azaltan en sade yoldur; tek yol değildir.
• • •
Yerli modeller EVREN ve Kumru router’a nasıl eklenir?
Router mimarisinin güzel yanı, yeni bir model hedefini eklemenin uygulamaları etkilememesidir. Türkiye’de son haftalarda bu açıdan iki önemli gelişme oldu.
EVREN: Türkiye’de işlenen, OpenAI uyumlu çıkarım servisi
Cumhurbaşkanlığı Savunma Sanayii Başkanlığı bünyesinde geliştirilen EVREN platformunun büyük dil modeli çıkarım servisi 23 Eylül 2026’da duyuruldu; platform 27 Eylül 2026’da resmen kullanıma açıldı. Anadolu Ajansı ve Dünya’nın aktardığına göre 11 açık ağırlıklı model tek bir OpenAI uyumlu API üzerinden sunuluyor; istemler, yanıtlar ve kullanım kayıtları Türkiye’deki yüksek performanslı GPU altyapısında işleniyor. Platform katkı esaslı bir kredi modeliyle çalışıyor, erişim e-Devlet kimlik doğrulamasıyla sağlanıyor ve 1 Kasım 2026’ya kadar yapılan API çağrıları kredi bakiyesinden düşülmüyor. Servis kendi içinde otomatik model yönlendirme de sunuyor.
Ayrıntılar için EVREN LLM çıkarım servisi ve milli yapay zeka platformu EVREN kullanıma açıldı haberlerimize bakabilirsiniz. EVREN’i mevcut uygulamalarınıza bağlamanın teknik adımlarını ise EVREN API’yi kurumsal yazılıma bağlamak rehberinde anlattık. Router açısından EVREN, “kişisel veri içeren ama Türkiye’de işlenmesi yeterli” istekler için doğal bir hedeftir.
Kumru: şirket içinde çalışabilen Türkçe model
VNGRS’in geliştirdiği Kumru, Türkçe için sıfırdan ön eğitilmiş 7,4 milyar parametreli, decoder-only bir dil modeli. VNGRS’in duyurusuna göre model 500 GB’lık, 300 milyar tokenlık bir veriyle eğitildi, 8.192 tokenlık bağlam penceresine (yaklaşık 20 A4 sayfası) sahip ve RTX A4000 ya da 3090 gibi 16 GB VRAM’li GPU’larda çalışabiliyor. Daha küçük Kumru-2B sürümü Hugging Face’te açık kaynak olarak yayımlanmış durumda. Verinin şirket dışına hiç çıkmaması gereken senaryolarda router’ın “şirket içi” hedefi böyle bir model olabilir.
• • •
Fallback, PII maskeleme ve loglama nasıl tasarlanır?
Fallback zinciri
Her rota için en az bir yedek model tanımlanmalı ve yedeğin de aynı veri kuralına uyması gerekir. Kişisel veri içeren bir istek için şirket içi modelden yurt dışı modele düşmek bir fallback değil, ihlal riskidir. Doğru zincir; şirket içi model, ardından Türkiye’de işleyen model, o da yoksa kullanıcıya anlaşılır bir “şu an işlenemiyor” yanıtıdır. Sağlık kontrolü, zaman aşımı ve devre kesici (circuit breaker) eşikleri her sağlayıcı için ayrı ayarlanmalı.
PII maskeleme
Maskeleme servisi istemdeki T.C. kimlik numarası, telefon, e-posta, IBAN ve adres gibi alanları tespit edip yer tutucularla değiştirir; model yanıtı döndüğünde yer tutucular orijinal değerlerle yeniden doldurulur. Böylece özetleme gibi kişisel veriye ihtiyaç duymayan görevler güçlü bir yurt dışı modelde de çalışabilir. Ancak tespit algoritmaları hata yapabilir; serbest metinlerde maskeleme tek başına güvence sayılmamalı, hassas iş akışları yine yerli rotada kalmalı.
Loglama ve erişim
Her çağrı için kullanıcı, uygulama, seçilen model, rota gerekçesi, token sayısı, maliyet, gecikme ve sonuç durumu kaydedilmeli. İstem ve yanıt metinlerinin kendisi ise maskelenmiş halde ve sınırlı süreyle tutulmalı. Bu loglara kimin erişeceği de bir yetki tasarımı konusudur; RBAC ile erişim modeli tasarımı yazımız bu noktada iyi bir başlangıç.
• • •
Maliyet ve kaliteyi nasıl ölçersiniz?
Router kurmanın en büyük getirisi maliyet kontrolüdür ama bu getiri ancak ölçülürse görünür. IBM Research yazısındaki temel fikir şu: büyük modelleri yüksek değerli, karmaşık işler için saklayın; zor olmayan işleri küçük ve ucuz modellere bırakın. Bunu yapabilmek için her görev tipine ait bir değerlendirme seti gerekir: gerçek, maskelenmiş örnek istekler ve beklenen çıktılar.
Biz değerlendirmeyi üç aşamada kuruyoruz. İlki, yeni bir modeli rotaya almadan önce değerlendirme setinde çevrimdışı test. İkincisi, canlı trafiğin küçük bir yüzdesini yeni modele yönlendiren kontrollü deneme. Üçüncüsü, kullanıcı geri bildirimi ve örneklem bazlı insan incelemesiyle sürekli izleme. Bütçe tarafında ise departman ve uygulama bazında aylık sınır, sınıra yaklaşıldığında uyarı ve sınır aşıldığında daha ucuz rotaya geçiş ya da durdurma kuralı tanımlanır.
Bu metrikleri ayrı bir panelde değil, mevcut izleme altyapınızda görmek gerekir. Gecikme ve hata oranlarının uygulama metrikleriyle aynı yerde durması, sorunun modelde mi yoksa entegrasyonda mı olduğunu hızla ayırt etmenizi sağlar.
• • •
OpenAI uyumlu arayüz tedarikçi bağımlılığını nasıl azaltır?
Internative raporunun dördüncü trendi, şirketlerin yeni yatırımlarda vendor lock-in
toleransının düştüğünü söylüyor. Yapay zeka tarafında bunun en pratik karşılığı, uygulamaların
belirli bir sağlayıcının SDK’sına değil, OpenAI uyumlu tek bir arayüze yazılmasıdır.
Birçok açık kaynak sunucu ve EVREN gibi servisler bu arayüzü desteklediği için, AI Ops katmanı
uygulamaya aynı /v1/chat/completions benzeri sözleşmeyi sunar; arkada hangi
modelin çalıştığı yapılandırmayla değişir.
Uygulama kodunda model adı yerine “görev profili” kullanmak işi daha da kolaylaştırır:
uygulama model="ozetleme-standart" gibi mantıksal bir ad gönderir, router bunu o
günkü kurala göre gerçek modele çevirir. Bir sağlayıcının fiyatı değiştiğinde ya da yeni bir
yerli model çıktığında yalnızca kural tablosu güncellenir. Uyumluluk her zaman yüzde yüz
değildir; araç çağırma (tool calling) ve yapılandırılmış çıktı gibi özelliklerin her hedefte
test edilmesi gerekir.
Aynı katman, yapay zeka ajanları için de omurga görevi görür. Ajan döngüsünün model çağrılarını doğrudan sağlayıcıya değil router’a yapması, bütçe ve veri kurallarını ajanlar için de geçerli kılar. Bu konuyu yapay zeka ajanlarını üretime almak rehberimizde middleware zinciri üzerinden anlattık.
• • •
LLM router kontrol listesi
Router’ı canlıya almadan önce aşağıdaki maddelerin her birinin yazılı bir yanıtı olmalı.
- Her model hedefi için verinin işlendiği ülke, sözleşme durumu ve KVKK m.9 güvencesi kayıt altında mı?
- Kişisel veri tespiti hangi alanları kapsıyor ve şüpheli durumda varsayılan rota güvenli rota mı?
- Her rotanın yedek modeli aynı veri kuralına uyuyor mu, devre kesici eşikleri tanımlı mı?
- Uygulamalar sağlayıcı SDK’sı yerine OpenAI uyumlu tek arayüze ve mantıksal görev profillerine mi yazıyor?
- Her görev tipi için değerlendirme seti ve kalite eşiği var mı?
- Departman ve uygulama bazında bütçe sınırı, uyarı ve aşım davranışı tanımlı mı?
- Loglarda istem ve yanıt metinleri maskeleniyor mu, saklama süresi ve erişim yetkileri belirlendi mi?
- Maliyet, gecikme ve hata metrikleri mevcut izleme altyapısına akıyor mu?
- Yeni bir modeli rotaya almak için çevrimdışı test ve kontrollü deneme süreci yazılı mı?
• • •
Aksiyon Soft nasıl yardımcı olur?
API ve entegrasyon hizmetimiz kapsamında uygulamalarınız ile dil modelleri arasındaki AI Ops katmanını; yönlendirme kuralları, maskeleme, fallback ve loglama dahil olmak üzere tasarlayıp kuruyoruz. Router’ı ERP, CRM ve iç portallarınıza bağlayan süreçleri kurumsal yazılım çözümleri hizmetimizle hayata geçiriyoruz. Mimari yaklaşımımızı API ve veri entegrasyon platformu sayfasında inceleyebilirsiniz.
Çalışma modelimiz keşifle başlar: hangi uygulamaların hangi görevler için model kullandığı, hangi verilerin kişisel veri sayıldığı ve hangi sağlayıcıların hangi güvenceyle kullanılabileceği yazıya dökülür. Ardından tek bir uygulama ve iki model hedefiyle bir MVP kurar, her sprint sonunda çalışan akışı gösterir, canlıya geçiş sonrasında hypercare dönemi ve SLA’lı destekle devam ederiz. Merkezimiz Samsun’dadır; Türkiye’nin her yerindeki ekiplerle uzaktan çalışır, gerektiğinde planlı yerinde ziyaretler yaparız.
Sık sorulan sorular
LLM router kullanmak için kaç modele ihtiyacım var?
İki model bile yeterlidir: örneğin kişisel veri içeren istekler için Türkiye’de işleyen bir model ve diğer işler için güçlü bir genel model. Router’ın değeri model sayısından çok, kuralların tek yerde yönetilmesinden gelir.
Router her isteğe ek gecikme ekler mi?
Kural tabanlı bir router çoğu durumda modelin yanıt süresine göre ihmal edilebilir bir ek yük getirir. İçeriği ayrı bir modelle sınıflandıran router’larda ek gecikme artar; bu yüzden basit kurallarla başlamak mantıklıdır.
Kişisel veri içeren istemleri yurt dışındaki bir modele gönderebilir miyim?
Değişen KVKK 9. maddesi; işleme şartı ve yeterlilik kararı ya da standart sözleşme gibi uygun güvenceler varsa aktarıma izin veriyor. Somut senaryonuzu hukuk danışmanınızla değerlendirin; teknik tarafta ise güvencesi olmayan rotaları router seviyesinde kapatın.
EVREN’i kurumsal uygulamalarda kullanabilir miyiz?
EVREN’in çıkarım servisi OpenAI uyumlu bir API sunduğu için teknik olarak router’a bir hedef olarak eklenebilir. Erişim e-Devlet kimlik doğrulamasıyla sağlanıyor; kullanım koşullarını ve kredi modelini projeniz için ayrıca değerlendirmenizi öneririz.
Hazır bir AI gateway ürünü mü almalıyız, kendimiz mi kurmalıyız?
Hazır ürünler hızlı başlangıç sağlar; ancak KVKK kuralları, iç sistem entegrasyonu ve yerli model hedefleri çoğu zaman özelleştirme gerektirir. Keşif aşamasında iki seçeneği ihtiyaç listenize göre karşılaştırıyoruz.
Router kurulumu ne kadar sürer?
Tek uygulama ve iki model hedefiyle bir MVP birkaç sprintte canlıya alınabilir. Maskeleme, değerlendirme hattı ve çok sayıda uygulamanın taşınması kapsamı genişletir; keşif sonrasında yazılı bir takvim paylaşırız.
Projenizi konuşalım
Birden fazla dil modelini maliyet, kalite ve KVKK dengesini koruyarak kullanmak istiyorsanız iletişim sayfamızdan kısa bir özet gönderin. Hangi uygulamaların router’a taşınacağını, hangi model hedeflerinin uygun olduğunu ve entegrasyon kapsamını birlikte netleştirelim.
Kaynaklar
- KVKK — Kişisel Verilerin Yurt Dışına Aktarılması
- KVKK — Kişisel Verilerin Yurt Dışına Aktarılması Rehberi
- Resmî Gazete — Kişisel Verilerin Yurt Dışına Aktarılmasına İlişkin Usul ve Esaslar Hakkında Yönetmelik (10 Temmuz 2024)
- Anadolu Ajansı — Savunma sanayisinin milli yapay zeka platformu EVREN kullanıma açıldı (27 Eylül 2026)
- Dünya — Yapay zekâda yerli altyapı büyüdü, 11 model EVREN’e bağlandı (28 Eylül 2026)
- VNGRS — Kumru LLM
- Hugging Face — vngrs-ai/Kumru-2B
- Internative — Türkiye Yazılım Sektörü 2026 H1 Raporu: 7 Anahtar Trend
- IBM Research — An air traffic controller for LLMs (10 Ekim 2024)
İlgili içerikler
Yazılım Rehberi
Gaziantep Yazılım Ortağı: İhracat ERP, e-Belge ve B2B Portallar
Gaziantep yazılım ihtiyaçlarını tekstil, halı ve gıda ihracatçıları açısından ele alıyoruz: ihracat ERP, e-Fatura ve gümrük entegrasyonu, çok tesisli üretim ve B2B bayi portalları.
Yazılım Rehberi
Malatya Yazılım Ortağı: Kayısı, İhracat ve İş Sürekliliği İçin Kurumsal Yazılım
Malatya yazılım ihtiyaçlarını kayısı işleme ve ihracatı, OSB tekstili ve deprem sonrası yeniden yapılanma açısından ele alıyoruz: izlenebilirlik, ihracat belgeleri, bulut yedekleme ve iş sürekliliği.
