TB
← Tüm yazılar

Üretim AI yigini: context, RAG, fine-tuning ve harness

Tam bir üretim AI yigini dört katmanı — context, RAG, fine-tuning ve harness — orchestrasyon, gozlemlenebilirlik ve maliyet kontrolu ile birlestirir. Bu yigin tek bir model seciminden ibaret degildir; her katmanin SLA'si ve sahipligi net olmadan ölçeklenebilir operasyon kurulamaz.

Üretim AI yigini, kullanicidan gelen istegin cevaplanmasina kadar gecen tüm katmanlarin bilincli tasarımını ifade eder. Dört temel blok vardir: context engineering, RAG altyapisi, fine-tuned modeller ve agent harness. Bu yazida bu bloklarin nasil entegre edildigini, hangi SLA'larin tanimlandigini ve gerçek operasyon tuzaklarini inceliyoruz.

Yigin mimarisi: yüksek seviye

Istek once API gateway ve kimlik dogrulamadan gecer. Harness katmanı tenant, rol ve rate limit uygular. Context builder oturum ozetini ve sabit talimatlari birlestirir. RAG servisi sorguyu zenginlestirip vektor ve keyword indekslerinden kanit getirir. Inference katmanı fine-tune edilmis (veya hibrit) modeli calistirir. Çıktı faithfulness ve güvenlik filtresinden gecer; audit log yazilir.

[Client] → [Gateway] → [Harness/Policy]
              ↓
       [Context Builder] ← [Session Store]
              ↓
         [RAG Service] ← [Vector + Doc Store]
              ↓
      [Inference FT Model]
              ↓
    [Output Guard + Eval Sample]
              ↓
         [Audit + Metrics]

Katman sahipligi ve SLA

Her katmanin ayri sahibi olmali: platform ekibi harness, bilgi ekibi RAG indeksi, ML ekibi fine-tune pipeline, ürün ekibi context sablonlari. SLA ornekleri: RAG P95 400 ms, inference P95 2 s, harness policy 10 ms, toplam P95 4 s. SLA asimi otomatik degrade moduna gecer — örneğin RAG timeout'ta yalnizca oturum baglami ile cevap veya "daha sonra tekrar deneyin".

Degrade modlari

  • RAG down: Cache'lenmis özet cevap veya sinirli FAQ modu.
  • FT model down: Base model fallback, format kontrolu harness'te sıkılastirilir.
  • Harness policy servisi down: Fail-closed; istek reddedilir, fail-open yapilmaz.

Fail-open harness icin kabul edilemez; güvenlik her zaman kullanilabilirlikten onde gelmelidir.

Context katmanı detay

Context builder sadece string birlestirmez. Mesaj onceliklendirme, PII maskeleme, dil tespiti ve tool ciktisi normalizasyonu yapar. Şablon surumleme zorunludur; prompt degisikligi eval tetiklemeden canliya cikmamali. Feature flag ile yeni şablon %5 trafige acilir.

Oturum store Redis veya benzeri düşük gecikmeli depoda tutulur. Uzun oturumlar icin arsiv + özet stratejisi harness memory kalibina baglanir. Context token raporu her istekte metrik olarak gonderilir; sisme erken fark edilir.

RAG katmanı detay

Indeksleme pipeline: doküman cekme → temizleme → chunk → embed → metadata zenginlestirme. Incremental indeksleme sart; tam rebuild haftalik. Embedding model degisikligi re-embed gerektirir; sürüm metadata'si her vektorle saklanir.

Cok kiracili mimaride fiziksel veya mantiksal indeks ayrimi yapin. Mantiksal ayrimda filtre her sorguda zorunlu parametre olmali — unutulursa felaket olur. Retrieval sonuclari context'e eklenmeden once skor esigi uygulanir; düşük skorlu parçalar modele verilmez.

Cache ve tutarlılık

Sik sorulan sorular icin semantic cache maliyeti dusurur. Cache invalidation doküman surumu ile baglanmali. Yanlış cache hit faithfulness dusurur; cache hit oranini kalite metrikleri ile birlikte izleyin.

Fine-tuning katmanı detay

Pipeline: veri toplama → temizleme → etiketleme → egitim → offline eval → staging shadow → kademeli rollout. Model artifact surumleme ve geri alma (rollback) otomatik olmali. Ayni anda tek üretim FT surumu aktif tutmak operasyonu basitlestirir.

Base model guncellemesi saglayici tarafindan gelir; FT adapter yeniden uyum gerektirebilir. Pinning ve uyumluluk matrisi dokumante edin. Küçük modeller (8B-70B arasi domain modelleri) maliyet/performans icin inference katmaninda base ile birlikte routing ile kullanılabilir.

Harness entegrasyonu

Harness tüm katmanlarin ortasinda degil, dis cercevede durur. Giriste kimlik ve politika, cikista output guard, yanlarda tool ve memory kontrolu. Eval harness orneklemis istekleri offline set ile karsilastirir; sapma alarmi üretir.

class ProductionStack {
  async handle(req: Request) {
    const ctx = await harness.authenticate(req);
    await harness.checkRateLimit(ctx);
    const context = await contextBuilder.build(ctx);
    const evidence = await rag.fetch(req.query, ctx.tenant);
    const raw = await inference.generate(context, evidence, ctx.modelRoute);
    const safe = await harness.guardOutput(raw, ctx);
    await observability.record(ctx, { context, evidence, raw, safe });
    return safe;
  }
}

Gozlemlenebilirlik

Distributed trace her istek icin tek ID. Span'ler: gateway, policy, context, retrieval, embed, generate, guard. Loglar yapilandirilmis JSON; arama alanlari tenant, model_surumu, rag_hit, faithfulness_skoru. Dashboard: başarı orani, maliyet, latency, injection deny, cache hit.

SLO ihlalinde otomatik runbook: RAG gecikmesi artiyorsa indeks shard kontrolu; faithfulness dusuyorsa son indeks veya prompt degisikligi diff'i. Onceden tanimli runbook olay mudahale suresini kisaltir.

Maliyet yönetimi

Maliyet dagilimi genelde: inference %55, RAG embed/retrieve %25, eval ve guard %10, diger %10. Routing ile basit sorular küçük modele, karmaşık sorular büyük modele gider. Token butcesi kullanıcı veya tenant bazinda limitlenebilir.

FinOps raporunda "başarılı cevap basina maliyet" en anlamli metriktir. Düşük maliyetli ama yanlış cevap toplam maliyeti artirir (destek ticket, itibar). Kalite-metriklerini maliyetle birlikte optimize edin.

Güvenlik ve uyumluluk

Veri residency: embedding ve inference bolgesi uyumu. Audit log saklama suresi regulasyona gore. Kullanıcı silme talebi hem oturum store hem RAG kaynagi hem eval loglarini kapsamali. Harness delete API'leri bu orchestrasyonu tetikler.

Penetrasyon testi yiginin tamamina uygulanmali; yalnizca API degil RAG injection ve tool abuse senaryolari dahil.

Ölçeklendirme

Inference GPU/TPU otoscaling gecikme metriklerine baglanir. RAG read replica ve shard. Context store cluster. Harness stateless; yatay ölçeklenebilir. Bottleneck profilleme ile belirlenir; çoğu ekipte once RAG sonra inference sınırı cikar.

Yigin evrimi

Baslangic: base model + RAG + basit harness. Orta: fine-tune + eval harness + degrade modlari. Ileri: cok model routing, otomatik eval rollback, tam agent tool zinciri. Her asamada once gozlemlenebilirlik, sonra karmasiklik ekleyin.

Context, RAG, fine-tuning ve harness birlikte calistiginda üretim AI yigini tekrarlanabilir, ölçeklenebilir ve denetlenebilir bir platform haline gelir. Tekil parça optimizasyonu yerine uctan uca SLA ve sahiplik tanımlamak uzun vadede en yüksek getiriyi sağlar.

Ek derinlemesine notlar

Üretim ortamlarinda bu konunun pratik etkisi çoğu zaman dokumantasyondaki teorik anlatimdan farklı seyler cikar. Ekipler ilk deploy sonrasinda gerçek trafik altinda gecikme dagiliminin staging ortamindaki tahminlerden sapabildigini görür. Bu nedenle metrikleri erken tasmak ve esik degerleri gerçek veriye gore kalibre etmek kritik oneme sahiptir.

Operasyonel olgunluk, hata oranini sifira indirmekten ziyade hatalari hızlı tespit edip sinirli etki alaniyla izole edebilmektir. Canary release, feature flag ve otomatik rollback mekanizmalarini harness ve eval katmanlariyla birlikte düşünmek gerekir. Aksi halde model veya indeks guncellemesi tüm kullanıcıları ayni anda etkiler.

Capraz fonksiyonel sahiplik de başarı icin sarttir. Platform muhendisligi altyapiyi, ML ekibi modeli, ürün ekibi deneyimi, güvenlik ekibi politika ve denetimi sahiplenmelidir. Tek bir "AI ekibi" hepsini tasimaya calistiginda bilgi silolari ve gecikmeler olusur. RFC süreci ile mimari kararlar kayıt altina alinmali; "neden RAG yerine fine-tune sectik" sorusunun cevabi alti ay sonra hala bulunabilmelidir.

Son olarak maliyet ve kalite dengesi statik degildir. Saglayici fiyatlandirmasi, yeni model aileleri ve hardware gelismeleri uc ayda bir dengeyi degistirebilir. Üretim yiginini periyodik olarak yeniden degerlendirmek — gereksiz katmanı kapatmak, cache stratejisini guncellemek, daha küçük ama yeterli modele gecmek — sürdürülebilir operasyonun parcasidir.

Operasyonel sureklilik

Canli sistemde yapılan her değişiklik icin on-ortam replay testi calistirmak regresyon riskini belirgin sekerde azaltir. Özellikle model saglayicisinin arka planda yaptigi guncellemeler, sizin release takviminizden bagimsiz olarak davranis degistirebilir; bu nedenle haftalik otomatik eval kosusu üretim kalitesinin temel guvencesi haline gelmelidir.

Ekip icinde incident post-mortem kulturu kuruldugunda harness ve eval metrikleri somut kok neden analizi sağlar. Soyut model kalitesi tartismalari yerine tool denial spike, faithfulness dususu veya latency SLO ihlali gibi ölçülebilir sinyaller uzerinden iyileştirme yapilir.