# Büyük Dil Modelleri

> Büyük dil modellerini dil modellemesi ve Transformer mimarisinden ön eğitim, sonradan eğitim, RAG, ince ayar, akıl yürütme, araç kullanımı, ajanlar, güvenlik, değerlendirme ve üretim mühendisliğine kadar; diğer yapay zeka yaklaşımlarıyla ilişkileri içinde ele alan kapsamlı ders notu.

- Author: Muhammet Ali Köker
- Language: tr
- Canonical: https://alikoker.com.tr/buyuk-dil-modelleri
- Translation: https://alikoker.com.tr/en/large-language-models
- Published: 2023-09-01T12:00:00+03:00
- Modified: 2026-09-19T00:48:47+03:00
- Type: article

Büyük dil modelleri (Large Language Models, LLM), doğal dil dizileri üzerinde olasılıksal örüntüler öğrenen, çoğunlukla Transformer ailesine dayanan ve geniş veri, parametre ve hesaplama ölçeğinde eğitilen yapay sinir ağı modelleridir. "Büyük" sözcüğünün sabit bir parametre eşiği yoktur; kavram, dönemin donanım ve model ölçeğine göre değişir. Bu nedenle bir modeli yalnız parametre sayısıyla tanımlamak yerine mimari, eğitim verisi, bağlam uzunluğu, çıkarım maliyeti, sonradan eğitim yöntemi ve görev kapsamı birlikte değerlendirilmelidir.

Büyük dil modelleri tek başına yapay zekânın bütünü değildir. [Yapay Sinir Ağları ve Öğrenme Modelleri](/yapay-sinir-aglari-ve-ogrenme-modelleri) bu modellerin sinir ağı temelini; [İstatistiksel Öğrenme ve Makine Öğrenmesi](/istatistiksel-ogrenme-makine-ogrenmesi) veri, olasılık, genelleme ve değerlendirme çerçevesini; [Mantıksal Programlama ve Prolog](/mantiksal-programlama-ve-prolog) açık kurallar ve biçimsel çıkarımı; [Bulanık Mantık](/bulanik-mantik) üyelik derecesiyle belirsiz kavramların gösterimini; [Genetik Algoritmalar ve Uygulamaları](/genetik-algoritmalar-ve-uygulamalari) türev gerektirmeyen stokastik aramayı ele alır. [Yapay Zeka: Felsefe, Kuram ve Uygulama](/yapay-zeka-felsefe-kuram-uygulama) ise dil üretimi, akıl yürütme, anlama, amaç, özerklik ve bilinç gibi kavramların birbirine karıştırılmaması için daha geniş çerçeveyi sağlar.

```text
İstatistiksel öğrenme ──> olasılık, genelleme, ölçüm
          |                         |
          v                         v
Yapay sinir ağları ──> Transformer ──> Büyük Dil Modeli
          |                         |
          |                         +──> RAG / araç kullanımı / ajanlar
          |                         +──> ince ayar / tercih öğrenmesi
          |                         +──> çok kipli sistemler
          |
Mantıksal programlama ──> doğrulama / sembolik araçlar
Bulanık mantık ─────────> üyelik tabanlı karar katmanları
Genetik algoritmalar ───> arama / ayar / mimari ve istem optimizasyonu
Yapay zekâ felsefesi ───> anlama, amaç, özerklik ve sorumluluk sınırları
```

## Ünite 1: Dil Modellemesinden Büyük Dil Modellerine

### 1.1 Dil modeli nedir?

Bir dil modeli, bir dizinin olasılığını veya dizideki bir sonraki birimin koşullu olasılığını kestirmeye çalışır. Otoregresif bir model için:

`P(x1, x2, ..., xT) = Π P(xt | x1, ..., x(t-1))`

Bu çarpanlara ayırma, metin üretimini ardışık bir olasılık kestirimi problemine dönüştürür. Model her adımda önceki bağlamı kullanarak sıradaki token için bir olasılık dağılımı üretir. Üretim sırasında seçilen token bağlama eklenir ve süreç yinelenir.

Bu mekanizma önemli bir sınırı da açıklar: **yüksek olasılık doğruluk anlamına gelmez**. Modelin amacı eğitim hedefi neyi gerektiriyorsa onu optimize etmektir; dünyadaki bir önermenin doğruluğunu biçimsel olarak kanıtlamak ayrı bir problemdir. Bir cümlenin akıcı olması, kaynağının bulunması veya mantıksal olarak geçerli olmasıyla aynı şey değildir.

### 1.2 İstatistiksel dil modellerinden sinirsel dil modellerine

Klasik n-gram modellerinde bir sonraki sözcüğün olasılığı sınırlı uzunluktaki geçmişe göre tahmin edilir. Bu yaklaşım yalın ve yorumlanabilirdir; ancak seyrek veri, bağlam uzunluğu ve genelleme sorunları vardır. Sinirsel dil modelleri sözcük veya alt sözcükleri sürekli vektör uzayında temsil ederek benzer bağlamları ortak parametreler üzerinden öğrenebilir.

RNN ve LSTM gibi geri beslemeli ağlar değişken uzunluklu dizileri işler; buna karşın uzun bağımlılıkların taşınması, ardışık hesaplama ve eğitim paralelliği sınırlamaları büyük ölçeği zorlaştırır. Attention mekanizması, modelin dizideki farklı konumlara doğrudan ağırlık vermesini sağlar. 2017 tarihli Transformer mimarisi, tekrarlayıcı bağlantıları zorunlu olmaktan çıkararak büyük dil modellerinin temel mimari çizgisini oluşturmuştur.

### 1.3 Temel model, sohbet modeli, akıl yürütme modeli ve ajan aynı şey değildir

Terminoloji sistem tasarımında önemlidir:

- **Temel model:** Geniş veri üzerinde genel amaçlı ön eğitim görmüş modeldir.
- **Dil modeli:** Dilsel diziler üzerinde olasılık dağılımı modelleyen yapıdır.
- **Talimat izleyen model:** Sonradan eğitimle kullanıcı talimatlarına daha uygun davranacak biçimde ayarlanmıştır.
- **Sohbet modeli:** Çok turlu konuşma biçimine ve rol yapısına göre uyarlanmıştır.
- **Akıl yürütme modeli:** Özellikle çok adımlı problem çözmede daha fazla çıkarım zamanı hesabı veya bu yönde sonradan eğitim kullanabilir.
- **Ajan:** Modelin kendisi değil; modele durum, bellek, araç, yetki ve eylem döngüsü bağlayan daha geniş yazılım sistemidir.
- **Çok kipli model:** Metnin yanında görüntü, ses, video veya başka veri kiplerini de işleyebilir.

Bu ayrım, bir sohbet arayüzündeki başarının model mimarisine, araç katmanına, arama sistemine veya uygulama koduna yanlışlıkla atfedilmesini önler.

## Ünite 2: Tokenleştirme, Sözlük ve Temsil

### 2.1 Token neden gereklidir?

Sinir ağları ham karakter dizisini doğrudan anlam olarak işlemez. Metin önce model sözlüğündeki sayısal kimliklere dönüştürülür. Token bir sözcük, alt sözcük, karakter veya bayt tabanlı bir parça olabilir. BPE, WordPiece ve unigram tabanlı yaklaşımlar yaygın alt sözcük yöntemleridir.

```text
Metin
  |
  v
Normalleştirme
  |
  v
Tokenleştirme ──> token kimlikleri
  |                    |
  v                    v
Sözlük            Gömme tablosu
                       |
                       v
                yoğun vektörler
```

Tokenleştirme yalnız ön işleme ayrıntısı değildir. Bağlam penceresi token cinsinden ölçüldüğü için aynı anlamsal içeriğin farklı tokenleştiricilerde farklı maliyeti olabilir. Türkçe gibi eklemeli dillerde sözcüğün kök ve ek yapısı alt sözcük ayrımını doğrudan etkiler. Bu nedenle çok dilli veya Türkçe odaklı bir sistemi değerlendirirken yalnız İngilizce token başına maliyet değerleriyle karar verilmemelidir.

### 2.2 Türkçe metinde özel durumlar

Türkçede büyük-küçük harf dönüşümlerinde `I/ı` ve `İ/i` ayrımı, Unicode normalleştirmesi, birleşik sözcükler, ek zincirleri ve özel adlara gelen ekler önemlidir. Eğitim ve çıkarım hattında normalleştirme davranışının farklı olması gereksiz token parçalanmasına veya arama eşleşmesi kaybına neden olabilir.

Bir alan modeli için şu ölçümler yararlıdır:

- karakter başına token sayısı,
- sözcük başına token sayısı,
- alan terimlerinin kaç parçaya ayrıldığı,
- kısaltma ve kod parçalarının bölünme biçimi,
- aynı içeriğin Türkçe ve İngilizce token maliyeti,
- uzun belge kesme oranı.

### 2.3 Gömme vektörleri

Token kimlikleri, öğrenilebilir bir gömme tablosundan yoğun vektörlere dönüştürülür. Bu vektörler tek başına sözlük tanımı değildir; eğitim hedefini gerçekleştirmeye yarayan dağıtık temsillerdir. Aynı sözcüğün bağlama göre anlam farkı, Transformer katmanları ilerledikçe bağlamsal temsile yansır.

Ayrı gömme modelleri ise metin, belge veya sorguları benzerlik aramasında kullanılacak vektörlere dönüştürür. Dil modelinin token gömmesi ile RAG için kullanılan belge gömmesini aynı kavrammış gibi değerlendirmemek gerekir.

### 2.4 Konum bilgisi ve bağlam penceresi

Attention işlemi token sırasını kendiliğinden bilmez. Bu nedenle mutlak, göreli veya döndürmeli konum gösterimleri gibi yöntemlerle sıra bilgisi eklenir. Güncel decoder mimarilerinde RoPE ailesi yaygın bir örnektir.

Bağlam penceresi, modelin tek istekte işleyebildiği toplam token sınırını gösterir; **kalıcı bellek anlamına gelmez**. Uzun bağlam desteklemek, modelin bağlamın her bölümünü eşit kalitede kullanacağını da garanti etmez. Uzun bağlam değerlendirmelerinde bilginin başta, ortada veya sonda bulunmasına göre performans değişebildiği gösterilmiştir.

## Ünite 3: Transformer Mimarisi

### 3.1 Self-attention

Bir katmandaki giriş gösterimi `X`, öğrenilen matrislerle sorgu, anahtar ve değer uzaylarına yansıtılır:

`Q = XWQ`

`K = XWK`

`V = XWV`

Ölçekli noktasal çarpım attention işlemi:

`Attention(Q,K,V) = softmax(QK^T / sqrt(dk)) V`

olarak yazılır. Her sorgu konumu, izin verilen anahtar konumlarına göre ağırlık üretir ve değer vektörlerini bu ağırlıklarla birleştirir.

Decoder tipi otoregresif modellerde gelecek tokenlerin görülmemesi için nedensel maske uygulanır.

```text
Token vektörleri
      |
      +------> Q
      +------> K ----+
      +------> V     |
                     v
              Q K^T / sqrt(d)
                     |
                  softmax
                     |
                     v
             ağırlıklı V toplamı
                     |
                     v
              Attention çıktısı
```

### 3.2 Çok başlı attention

Tek attention başlığı bütün ilişkileri tek benzerlik uzayında öğrenmek zorundadır. Multi-Head Attention, farklı yansıtma matrisleriyle birden fazla başlık çalıştırır ve sonuçları birleştirir. Çıkarım verimliliği için Multi-Query Attention ve Grouped-Query Attention gibi yaklaşımlar, sorgu başlıklarının anahtar/değer başlıklarını paylaşmasını sağlayarak özellikle [KV cache](/wiki/kv-cache) maliyetini azaltır.

### 3.3 Transformer bloğu

Modern blokların ayrıntısı modele göre değişse de ana yapı şu şekilde düşünülebilir:

```text
x
|
+--> Normalizasyon --> Attention --> +
|                                    |
+------------------------------------+ --> h
                                         |
                                         +--> Normalizasyon --> MLP --> +
                                         |                              |
                                         +------------------------------+ --> y
```

Residual bağlantılar derin ağlarda gradyan akışını ve bilgi taşınmasını kolaylaştırır. MLP/FFN bölümü token başına doğrusal dönüşümler ve doğrusal olmayan aktivasyonlardan oluşur. LayerNorm veya RMSNorm gibi normalizasyon yöntemleri eğitim kararlılığına katkı sağlar.

### 3.4 Encoder, decoder ve encoder-decoder

- **Encoder-only:** Girdinin çift yönlü temsilini üretir; sınıflandırma ve temsil öğrenmesi için uygundur.
- **Decoder-only:** Önceki tokenlerden sonraki tokeni üretir; güncel üretici LLM'lerin büyük bölümü bu çizgidedir.
- **Encoder-decoder:** Kaynak diziyi encoder ile temsil edip decoder ile hedef dizi üretir; çeviri ve dönüştürme görevlerinde doğal bir yapıdır.

Bir BERT benzeri encoder modeli ile bir GPT benzeri decoder modeli aynı Transformer ailesindendir; ancak eğitim hedefleri ve çıkarım biçimleri farklıdır.

### 3.5 Mixture of Experts

Mixture of Experts (MoE), her token için bütün ileri beslemeli uzmanları çalıştırmak yerine yönlendirici bir ağın sınırlı sayıdaki uzmanı etkinleştirmesine dayanır. Böylece toplam parametre sayısı artarken token başına etkin hesap daha sınırlı tutulabilir. Kazanç bedelsiz değildir: yük dengeleme, uzman kapasitesi, ağlar arası iletişim ve dağıtık eğitim karmaşıklığı ortaya çıkar.

## Ünite 4: Ön Eğitim, Veri ve Ölçekleme

### 4.1 Ön eğitim hattı

Bir LLM'in niteliği yalnız mimariyle belirlenmez. Veri hattı çoğu zaman eşit derecede belirleyicidir.

```text
ham kaynaklar
   |
   v
lisans / köken / erişim denetimi
   |
   v
ayrıştırma ve normalleştirme
   |
   v
kalite filtreleri ----> kişisel veri / güvenlik filtreleri
   |
   v
tekrar giderme
   |
   v
dil ve alan dengelemesi
   |
   v
tokenleştirme
   |
   v
ön eğitim
```

Web, kitap, kod, bilimsel metin, konuşma dökümleri veya kurumsal belgeler farklı dağılımlara sahiptir. Kaynak karışımının oranı model davranışını etkiler. Tekrarlı içerik ezber riskini ve değerlendirme sızıntısını artırabilir; düşük kaliteli otomatik içerik dil dağılımını bozabilir.

### 4.2 Veri kökeni ve lisans

"İnternette bulunuyor" ifadesi veri kullanım hakkı anlamına gelmez. Üretim amaçlı veri hattında kaynağın kökeni, lisansı, kullanım koşulu, kişisel veri durumu, silme yükümlülüğü ve yeniden dağıtım hakkı ayrı alanlar olarak izlenmelidir. Eğitim veri setinin kendisi bir yazılım bağımlılığı gibi sürümlenebilir olmalıdır.

### 4.3 Kayıp işlevi

Otoregresif eğitimde tipik hedef, doğru sonraki tokene verilen olasılığın negatif logaritmasını küçültmektir:

`L = - Σ log Pθ(xt | x<t)`

Ortalama çapraz entropinin üstel karşılığı perplexity olarak ifade edilebilir:

`PPL = exp(L_mean)`

Perplexity aynı veri ve aynı tokenleştirme koşullarında yararlıdır. Farklı sözlükler veya farklı veri dağılımları kullanan modeller arasında tek başına doğrudan kalite sıralaması değildir.

### 4.4 Ölçekleme yasaları

Model parametreleri, eğitim token sayısı ve hesap bütçesi birlikte ölçeklenir. Chinchilla çalışması, sabit hesap bütçesinde yalnız parametre sayısını büyütmenin optimum olmadığını; model boyutu ile eğitim verisinin dengeli ölçeklenmesi gerektiğini göstermiştir. Bu sonuç pratikte "en büyük model" yerine **hesap bütçesine göre yeterince eğitilmiş model** kavramını güçlendirmiştir.

Ölçekleme yasaları ampirik ilişkilerdir; mimari, veri kalitesi, tokenizer ve sonradan eğitim değiştiğinde aynı katsayıların değişmeden geçerli olacağı varsayılmamalıdır.

### 4.5 Dağıtık eğitim

Büyük modeller tek hızlandırıcıya sığmadığında farklı paralellik türleri birleştirilir:

- veri paralelliği,
- tensor/model paralelliği,
- pipeline paralelliği,
- sequence/context paralelliği,
- MoE için expert paralelliği.

Karma hassasiyet, gradyan biriktirme, aktivasyon yeniden hesaplama ve optimizer durumlarının parçalanması bellek gereksinimini azaltabilir. Fakat çok düğümlü eğitimde ağ bant genişliği ve kolektif iletişim, FLOP kapasitesi kadar önemli hale gelir.

## Ünite 5: Sonradan Eğitim ve Davranışın Şekillendirilmesi

Ön eğitim, modele geniş dilsel ve kavramsal örüntüler kazandırır; ancak kullanıcı talimatını güvenilir biçimde izlemek farklı bir hedeftir. Modern modeller bu nedenle birkaç aşamalı sonradan eğitimden geçebilir.

```text
Ön eğitimli temel model
        |
        v
Gözetimli talimat ince ayarı (SFT)
        |
        +----------------------+
        |                      |
        v                      v
Tercih verisi              Güvenlik verisi
        |                      |
        v                      |
RLHF / DPO / diğer tercih yöntemleri
        |
        v
Değerlendirme + adversarial test
        |
        v
Üretim adayı
```

### 5.1 SFT

Supervised Fine-Tuning, istek-cevap veya görev-çıktı örnekleri üzerinde denetimli öğrenmedir. Kaliteli ve temsil gücü yüksek az veri, çok miktarda zayıf veriden daha değerli olabilir. SFT davranış biçimini öğretir; modelin bütün olgusal bilgisini güncel tutmak için her zaman doğru araç değildir.

### 5.2 RLHF

Reinforcement Learning from Human Feedback yaklaşımında insan tercihleri, model yanıtlarının sıralanması yoluyla ödül modeline dönüştürülebilir; ardından politika bu ödüle göre optimize edilir. InstructGPT çalışması, büyük bir temel modelin boyutunu artırmanın tek başına kullanıcı niyetini izlemeyi çözmediğini göstermiştir.

### 5.3 Doğrudan tercih optimizasyonu

Direct Preference Optimization (DPO), tercih verisinden ayrı bir ödül modeli ve karmaşık çevrim içi pekiştirmeli öğrenme döngüsü kurmadan politika güncellemeyi mümkün kılan daha yalın bir yaklaşımdır. Her yöntemin veri dağılımı, kararlılık ve çevrim içi/çevrim dışı geri bildirim bakımından farklı ödünleşimleri vardır.

### 5.4 Akıl yürütme için pekiştirmeli öğrenme

2025 ve 2026 döneminde görünür hale gelen akıl yürütme modelleri, sonradan eğitimin yalnız "yardımcı sohbet" davranışı için değil, çok adımlı problem çözme stratejileri için de kullanılabileceğini gösterdi. DeepSeek-R1 çalışması, doğrulanabilir görevlerde pekiştirmeli öğrenmenin uzun problem çözme davranışlarını teşvik edebildiğini; ancak okunabilirlik ve dil karışması gibi sorunların ek veri ve çok aşamalı eğitim gerektirebildiğini raporlamıştır.

Bu tür sonuçlar **modelin bilinç kazandığını** göstermez. Gözlenen şey, belirli eğitim ve çıkarım düzeninde görev başarımının artmasıdır.

## Ünite 6: İstem, Bağlam ve Örnek İçinde Öğrenme

### 6.1 İstem mühendisliğinin yeri

İstem, model ağırlıklarını değiştirmeden davranışı koşullandırır. Sistem düzeyindeki talimatlar, kullanıcı girdisi, örnekler, araç şemaları ve getirilen belgeler aynı bağlam penceresinde farklı roller üstlenebilir.

İyi bir istem genellikle şu bileşenleri açıklar:

- amaç,
- bağlam,
- girişin sınırı,
- çıktı biçimi,
- başarı ölçütü,
- yasak veya riskli durumlar,
- gerekirse az sayıda örnek.

### 6.2 Bağlam mühendisliği

Üretim sisteminde problem yalnız "iyi cümle yazmak" değildir. Modele hangi bilginin, hangi sırayla, hangi güven düzeyinde ve hangi token bütçesiyle verileceği tasarlanır. Buna sistem talimatı, konuşma geçmişi, RAG sonuçları, araç çıktıları, kullanıcı tercihleri ve görev durumu dâhildir.

```text
                +--> sistem ilkeleri
                +--> kullanıcı isteği
Bağlam derleyici+--> ilgili geçmiş
                +--> getirilen belgeler
                +--> araç şemaları
                +--> görev durumu
                         |
                         v
                      Model
```

### 6.3 Zero-shot, few-shot ve in-context learning

Bir görev örneksiz veriliyorsa zero-shot; birkaç gösterimle veriliyorsa few-shot olarak adlandırılır. Model ağırlıkları güncellenmeden bağlamdaki örüntülerden görev biçimi çıkarılabilir. Bu davranış "öğrenme" olarak anılsa da kalıcı ağırlık güncellemesi değildir.

### 6.4 Üretim parametreleri

Temperature [logit](/wiki/logit) dağılımını yumuşatır veya keskinleştirir. Top-k yalnız en yüksek `k` adayını, top-p ise kümülatif olasılığı belirli eşiğe ulaşan aday kümesini dikkate alır. Düşük sıcaklık genellikle daha dar dağılım üretir; fakat aynı girdinin her donanım/yazılım sürümünde bit düzeyinde aynı çıktıyı vereceği garanti edilmemelidir.

### 6.5 Zincirleme akıl yürütme ve self-consistency

Ara adımlar üretmek karmaşık görevlerde yararlı olabilir. Self-consistency, tek bir greedy yol yerine birden çok aday çözüm üretip tutarlı sonuca göre seçim yapar. Ancak uzun açıklama **doğruluk kanıtı değildir**. Kritik görevlerde görünür akıl yürütme metni yerine bağımsız hesaplama, test, biçimsel doğrulama veya kaynak denetimi daha güçlü kanıttır.

### 6.6 Uzun bağlamın sınırı

Bağlam penceresinin büyümesi, bütün tokenlerin eşit derecede kullanılacağı anlamına gelmez. "Lost in the Middle" çalışması, ilgili bilginin uzun bağlam içindeki konumunun performansı değiştirebildiğini göstermiştir. Bu nedenle çok uzun belgeleri kör biçimde isteme eklemek yerine bölümleme, arama, özetleme, hiyerarşik bellek ve görev odaklı seçim kullanılmalıdır.

## Ünite 7: Retrieval-Augmented Generation — RAG

RAG, modelin parametrelerinde saklı bilgiye ek olarak çalışma zamanında harici kaynaklardan bilgi getirir. Amaç, güncel veya kuruma özgü bilginin modele bağlam olarak sunulmasıdır.

```text
Belge havuzu
   |
   v
parçalama -> gömme -> indeks
                      |
Kullanıcı sorgusu -> sorgu gömmesi
                      |
                      v
                 benzerlik araması
                      |
                 yeniden sıralama
                      |
                      v
                 seçilmiş bağlam
                      |
                      v
                    LLM
                      |
                      v
              kaynaklı yanıt
```

### 7.1 RAG hattının bileşenleri

1. Belge toplama ve köken kaydı
2. Temizleme ve yapısal ayrıştırma
3. Parçalama
4. Gömme üretimi
5. Vektör veya hibrit indeks
6. Sorgu dönüştürme
7. Aday getirme
8. Yeniden sıralama
9. Bağlam oluşturma
10. Üretim ve kaynak gösterimi

### 7.2 Parçalama

Sabit karakter uzunluğu en basit yöntemdir; fakat başlık, paragraf, tablo veya kod sınırlarını bozabilir. Semantik bölümleme, yapısal bölümleme ve kayan pencere gibi yöntemler görev türüne göre seçilir. Çok küçük parça bağlamı kaybeder; çok büyük parça ise arama hassasiyetini ve token verimliliğini azaltabilir.

### 7.3 Yoğun, seyrek ve hibrit arama

Dense retrieval anlamsal gömme benzerliğine, sparse retrieval sözcüksel eşleşmeye dayanır. Teknik kod, kimlik, hata numarası veya ürün adı gibi tam eşleşmenin önemli olduğu alanlarda yalnız dense retrieval yeterli olmayabilir. Hibrit arama iki sinyali birleştirebilir.

### 7.4 RAG ne değildir?

RAG model ağırlıklarını güncellemez. İnce ayar ile karıştırılmamalıdır. Ayrıca RAG:

- yanlış kaynağı getirirse yanlış bağlam sağlar,
- kaynaktaki zararlı talimatı modele taşıyabilir,
- halüsinasyonu tamamen ortadan kaldırmaz,
- yetkilendirmeyi kendiliğinden çözmez.

Belge erişim kontrolü, kullanıcı yetkisiyle retrieval aşamasında uygulanmalıdır. Modele "bu belgeyi gösterme" demek güvenlik sınırı değildir.

### 7.5 Kaynak kökeni

Yanıtta kullanılan cümle ile getirilen belge arasındaki izlenebilirlik korunmalıdır. Belge kimliği, sürümü, bölüm konumu ve erişim zamanı saklanırsa daha sonra hangi kanıtın kullanıldığı denetlenebilir.

## Ünite 8: İnce Ayar ve Parametre-Verimli Uyarlama

### 8.1 Tam ince ayar

Tam fine-tuning bütün veya büyük bölümdeki ağırlıkları günceller. Yüksek bellek, optimizer durumu ve eğitim maliyeti gerektirir. Alan davranışını güçlü biçimde değiştirebilir; fakat küçük veriyle aşırı uyum ve genel yetenek kaybı riski vardır.

### 8.2 LoRA

Low-Rank Adaptation, temel ağırlıkları dondurup güncellemeyi düşük-rank matrislerle ifade eder. Bir ağırlık değişimi kabaca:

`ΔW = B A`

şeklinde modellenebilir; burada rank, özgün ağırlık boyutundan çok daha küçük seçilir. Eğitimde güncellenen parametre sayısı ciddi biçimde azalır.

### 8.3 QLoRA

QLoRA, dondurulmuş temel modeli düşük bitli nicemlenmiş biçimde tutarken LoRA adaptörlerini eğitir. Bu yaklaşım daha sınırlı GPU belleğinde büyük model uyarlamayı mümkün kılmıştır. Nicemleme eğitim ve çıkarımda farklı hata/kazanç profillerine sahip olabilir; son karar yalnız bellek kullanımına göre verilmemelidir.

### 8.4 Hangi yöntem ne zaman?

| Gereksinim | Öncelikli yöntem |
|---|---|
| Yalnız çıktı biçimi ve kısa davranış değişikliği | İstem / few-shot |
| Güncel veya özel bilgi | RAG |
| Özel üslup veya görev davranışı | SFT / LoRA |
| Tercih ve davranış hizalama | Tercih optimizasyonu |
| Kesin hesap / kurallar | Harici araç veya sembolik sistem |
| Çok sık değişen kurumsal bilgi | RAG + erişim kontrolü |
| Küçük cihaz / sınırlı bellek | Küçük model + nicemleme / distillation |

Bu yöntemler birbirini dışlamaz. Üretim sistemi RAG, LoRA, araç çağrısı ve politika katmanını birlikte kullanabilir.

## Ünite 9: Akıl Yürütme ve Çıkarım Zamanı Hesabı

Büyük dil modellerinde problem çözme başarımı yalnız ön eğitim ölçeğiyle artırılmaz. Çıkarım sırasında daha fazla aday üretmek, ara durumları değerlendirmek, verifier kullanmak veya problemi alt görevlere bölmek de ek hesap bütçesini kaliteye dönüştürebilir.

### 9.1 Test-time compute

Test-time compute, model ağırlıkları sabitken bir isteğe ayrılan çıkarım hesabının artırılmasıdır. Best-of-N örnekleme, yeniden değerlendirme, arama, verifier tabanlı seçim veya yinelemeli düzeltme bu ailenin örnekleridir. 2024 tarihli çalışmalar, problem zorluğuna göre uyarlanmış çıkarım bütçesinin bazı görevlerde daha büyük bir temel modelden daha verimli olabileceğini göstermiştir.

Bu bulgu evrensel değildir. Kolay ve zor sorular aynı ek hesap stratejisinden eşit yarar görmez. Üretim sisteminde kalite hedefi, gecikme SLO'su ve maliyet birlikte ele alınmalıdır.

### 9.2 Verifier kavramı

Bir üretici model çözüm önerir, ayrı bir verifier ise sonucu denetleyebilir:

```text
problem
  |
  v
üretici LLM ---> aday 1 ---+
       |        aday 2 ----+--> verifier --> seçilen sonuç
       +------> aday N ----+
```

Verifier matematik motoru, test sistemi, derleyici, Prolog/SMT çözücü, veri tabanı sorgusu veya başka bir model olabilir. Biçimsel araç kullanılabiliyorsa doğal dildeki öz değerlendirmeden daha güçlü bir güvence sağlar.

### 9.3 Akıl yürütme ile bilinç ayrımı

Bir modelin çok adımlı problemi çözmesi, öznel deneyime veya bilince sahip olduğunu kanıtlamaz. Görev davranışı gözlenebilir; içsel deneyim ise farklı bir felsefi ve bilimsel problemdir. Bu ayrım [Yapay Zeka: Felsefe, Kuram ve Uygulama](/yapay-zeka-felsefe-kuram-uygulama) dersinde daha geniş ele alınır.

## Ünite 10: Araç Kullanımı ve Ajan Sistemleri

LLM, tek başına veri tabanını sorgulamaz veya dosya değiştirmez; uygulama model çıktısını bir araç çağrısına dönüştürür. Güvenli mimaride model **yetki kaynağı değil, karar öneren bileşen** olarak ele alınır.

```text
Kullanıcı
   |
   v
Orkestratör -----> Politika / Yetki denetimi
   |                         |
   v                         v
  LLM ---- araç isteği --> doğrulayıcı
   ^                         |
   |                         v
   +----- araç sonucu ---- araç / API / DB
```

### 10.1 Tool calling

[Araç çağırma (Tool Calling)](/wiki/tool-calling) bağlamında araç şeması, ad, parametre ve beklenen çıktı türünü tanımlar. Model hangi aracı çağıracağını ve argümanları önerebilir; fakat argüman doğrulama, kimlik doğrulama, yetki, hız sınırı ve işlem bütünlüğü uygulama kodunda kalmalıdır.

### 10.2 Ajan döngüsü

Bir ajan tipik olarak:

`gözlem -> plan -> eylem -> sonuç -> durum güncelleme`

döngüsünü yürütür. Gerçek sistemde bu döngüye zaman aşımı, maksimum adım sayısı, bütçe, iptal, geri alma ve insan onayı eklenmelidir.

### 10.3 ReAct ve araçla desteklenen akıl yürütme

ReAct yaklaşımı, akıl yürütme ile dış ortam eylemlerini ardışık biçimde birleştirir. Toolformer çalışması ise modelin hangi API'nin ne zaman kullanılacağını öğrenebileceğini göstermiştir. Bu çizgi güncel ajan mimarilerinin tarihsel temelindedir.

### 10.4 Araç protokolleri

2026 itibarıyla model ile araç/veri kaynakları arasındaki entegrasyonu standartlaştırmaya yönelik protokoller yaygınlaşmıştır. Model Context Protocol (MCP) bunlardan biridir; 2026-07-28 sürümü durumsuz protokol çekirdeği, genişletme çerçevesi ve yetkilendirme sertleştirmeleri gibi değişiklikler içermektedir. Bu tür protokoller **model yeteneği değil entegrasyon katmanıdır**; güvenlik sınırları yine uygulama ve altyapıda kurulmalıdır.

### 10.5 Yüksek riskli eylemler

Para transferi, kalıcı veri silme, ayrıcalık değiştirme, dış sistemde komut çalıştırma veya insan güvenliğini etkileyen işlemler yalnız model kararına bırakılmamalıdır. İki aşamalı onay, insan denetimi veya deterministik politika katmanı kullanılabilir.

## Ünite 11: Çok Kipli Büyük Modeller

Metin merkezli LLM'ler görüntü, ses veya video kodlayıcılarıyla birleştirilebilir. Genel desen:

```text
metin --> tokenizer ---------------------+
                                          |
görüntü --> vision encoder --> projector -+--> ortak temsil --> dil modeli --> çıktı
                                          |
ses -----> audio encoder ----> projector -+
```

Farklı kiplerden gelen temsil, modelin dil üretim katmanıyla birleştirilir. Mimariye göre görüntü veya ses temsilcileri token benzeri vektörler olarak bağlama eklenebilir.

Çok kipli sistemlerde hata yüzeyi genişler. OCR yanlışı, görüntüde gizli talimat, ses transkripsiyon hatası veya zaman eşleştirme sorunu metin katmanına taşınabilir. Bu nedenle her kip ayrı kalite ve güvenlik testine ihtiyaç duyar.

## Ünite 12: Değerlendirme

### 12.1 Tek bir benchmark yeterli değildir

LLM değerlendirmesi çok boyutludur. Genel bilgi benchmark'ı, kod üretim sistemi veya kurumsal RAG uygulamasının başarısını tek başına ölçemez. Değerlendirme katmanları ayrılmalıdır:

```text
Model düzeyi       : loss, perplexity, genel benchmark
Görev düzeyi       : accuracy, F1, exact match, pass@k
RAG düzeyi         : retrieval recall, ranking, groundedness
Ajan düzeyi        : görev başarı oranı, adım sayısı, yanlış araç çağrısı
Sistem düzeyi      : TTFT, token/s, hata oranı, maliyet, kaynak kullanımı
Güvenlik düzeyi    : injection, veri sızıntısı, yetki aşımı, adversarial test
```

### 12.2 Benchmark kirliliği

Bir benchmark örneği eğitim verisinde yer aldıysa ölçüm genelleme yerine hatırlamayı kısmen ödüllendirebilir. Bu nedenle zaman ayrımlı veri, özel kapalı test seti, varyant üretimi ve eğitim verisiyle örtüşme analizi önemlidir.

### 12.3 LLM-as-a-Judge

Güçlü bir model başka bir modelin yanıtını değerlendirebilir. Bu, insan değerlendirmesini ölçeklendirmek için yararlıdır; ancak sıra etkisi, uzun yanıt tercihi, kendi model ailesine eğilim ve akıl yürütme sınırları gibi yanlılıklar raporlanmıştır. Hakem model de ölçülmesi gereken bir bileşendir.

### 12.4 Alan değerlendirmesi

Üretimde en değerli test seti çoğu zaman gerçek kullanım dağılımını temsil eden, sürümlenmiş ve insan tarafından doğrulanmış "golden set"tir. Zor örnekler ayrı hata dilimlerinde tutulmalıdır:

- eksik bilgi,
- çelişkili belge,
- uzun bağlam,
- tablo/kod,
- Türkçe özel karakter,
- yanlış kullanıcı varsayımı,
- yetkisiz veri isteği,
- araç hatası,
- dış servis zaman aşımı.

### 12.5 İstatistiksel güven

İki model arasındaki küçük benchmark farkı her zaman anlamlı değildir. Örnek sayısı, güven aralığı ve tekrarlı ölçüm dikkate alınmalıdır. Bu konu [İstatistiksel Öğrenme ve Makine Öğrenmesi](/istatistiksel-ogrenme-makine-ogrenmesi) dersindeki model karşılaştırma ilkelerinin doğrudan devamıdır.

## Ünite 13: Halüsinasyon, Belirsizlik ve Doğrulama

"Halüsinasyon" genellikle modelin desteklenmeyen, yanlış veya uydurma içerik üretmesini kapsayan geniş bir terimdir. Bütün hata türlerini tek kavram altında toplamak kök nedeni gizleyebilir.

Ayrı hata sınıfları düşünmek daha yararlıdır:

- kaynakta olmayan olgu üretimi,
- getirilen kaynağı yanlış yorumlama,
- mantıksal çıkarım hatası,
- aritmetik hata,
- araç sonucunu yanlış aktarma,
- belirsizliği saklama,
- talimat çatışması.

### 13.1 Token olasılığı güvenilirlik skoru değildir

Modelin token olasılıkları yerel üretim dağılımını gösterir. Bir yanıtın olgusal doğruluğu, kalibrasyonu veya kullanıcı açısından güvenilirliğiyle aynı değildir. Üstelik API düzeyinde bütün olasılık bilgileri her zaman sunulmaz.

### 13.2 Bulanık mantıkla fark

[Bulanık Mantık](/bulanik-mantik) dersindeki üyelik derecesi, bir kavramın seçilmiş bulanık kümeye ne ölçüde ait olduğunu gösterir. LLM token olasılığı ise sıradaki tokenin model dağılımındaki olasılığıdır.

```text
Bulanık üyelik:       μ_sıcaklık(26°C) = 0.7
Dil modeli olasılığı: P(token | bağlam) = 0.7

Aynı sayı aralığı ≠ aynı anlam
```

Bulanık mantık, LLM çevresinde karar birleştirme veya risk puanlama katmanı olarak kullanılabilir; fakat LLM'in olasılık çıktısı doğrudan bulanık üyelik olarak yorumlanmamalıdır.

### 13.3 Doğrulama katmanları

- Kaynak getirme ve kaynak eşleme
- İkinci model veya verifier
- Deterministik hesap motoru
- Şema ve tür doğrulama
- Birim testleri / derleme
- İnsan onayı
- Alan kuralı

Göreve göre en güçlü kanıt türü seçilmelidir.

## Ünite 14: Güvenlik, Gizlilik ve Yönetişim

LLM uygulamasının saldırı yüzeyi, klasik web/API güvenliğinin üzerine doğal dil tabanlı kontrol kanalını ekler. Model çıktısı ve modele verilen harici içerik **güvenilmeyen veri** olarak ele alınmalıdır.

### 14.1 Prompt injection

Prompt injection, kullanıcının veya harici belgenin modele uygulamanın amaçlamadığı talimatları kabul ettirmesidir. Doğrudan saldırı kullanıcı isteminden; dolaylı saldırı web sayfası, dosya, e-posta veya RAG belgesinden gelebilir.

OWASP LLM Top 10:2025, prompt injection'ı başlıca risklerden biri olarak ele alır. RAG veya fine-tuning bunu bütünüyle çözmez.

### 14.2 Güven sınırı

```text
[Güvenilmeyen]
Kullanıcı / Web / Dosya / RAG belgesi
             |
             v
     içerik ayrıştırma
             |
             v
            LLM
             |
             v
       önerilen eylem
             |
      +------v-------+
      | Politika     |  <-- güven sınırı
      | Yetki        |
      | Doğrulama    |
      +------|-------+
             v
        Gerçek araç
```

Modelin "yetkim var" demesi yetkilendirme değildir. Kullanıcı kimliği ve erişim hakkı deterministik uygulama katmanında doğrulanmalıdır.

### 14.3 Sistem promptu sır değildir

Sistem talimatı davranışı yönlendirebilir; fakat parola, bağlantı dizesi, API anahtarı veya güvenlik kararı burada saklanmamalıdır. Sistem promptu sızdırılsa bile yetkisiz işlem yapılamayacak mimari hedeflenmelidir.

### 14.4 Çıktı işleme

LLM çıktısı HTML, SQL, kabuk komutu veya kod üretiyorsa çıktı doğrudan yorumlayıcıya gönderilmemelidir. Parametreli sorgu, allowlist, sandbox, AST doğrulama, şema kontrolü ve en az yetki ilkesi uygulanır.

### 14.5 Veri zehirleme ve tedarik zinciri

Ön eğitim verisi, ince ayar veri seti, gömme modeli, tokenizer, model ağırlığı, dönüştürme aracı ve çalışma zamanı kütüphaneleri tedarik zincirinin parçasıdır. Model dosyasının kaynağı, hash'i, lisansı ve sürümü izlenmelidir.

### 14.6 Risk yönetimi

NIST AI RMF ve Generative AI Profile, üretken yapay zekâ risklerini yaşam döngüsü boyunca yönetişim, ölçüm ve yönetim bağlamında ele alır. Yüksek riskli sistemlerde yalnız model benchmark'ı değil veri kökeni, insan denetimi, kullanım sınırı, olay kaydı ve geri alma planı da değerlendirilmelidir.

## Ünite 15: Çıkarım, Performans ve Sunum Mühendisliği

Bir LLM'in üretimdeki başarısı yalnız kalite metriği değildir. Gecikme, throughput, GPU belleği, enerji, maliyet ve kuyruk davranışı birlikte değerlendirilir.

### 15.1 Bellek bileşenleri

Basitleştirilmiş bellek bütçesi:

`toplam ≈ model ağırlıkları + KV cache + aktivasyonlar + çalışma alanı`

Eğitimde bunlara gradyanlar ve optimizer durumları da eklenir.

### 15.2 Prefill ve decode

LLM çıkarımı iki farklı davranış gösterir:

```text
İstek tokenleri --[prefill]--> ilk token
                               |
                               +--[decode]--> token 2
                               +--[decode]--> token 3
                               +--[decode]--> ...
```

Prefill bütün giriş tokenlerini paralel işler ve genellikle hesap yoğunlukludur. Decode ise her adımda bir veya birkaç yeni token üretir; KV cache üzerinden önceki durumları kullanır ve çoğu sistemde bellek bant genişliği önemli hale gelir.

### 15.3 Ölçüler

- **TTFT (Time to First Token):** ilk token gecikmesi
- **TPOT (Time per Output Token):** sonraki token başına süre
- **Tokens/s:** üretim hızı
- **Throughput:** zaman başına tamamlanan istek veya token
- **P50/P95/P99 gecikme:** dağılım kuyruğunu gösterir
- **Goodput:** SLO içinde tamamlanan yararlı iş

Ortalama gecikme tek başına kuyruk patlamalarını gizleyebilir.

### 15.4 KV cache

Otoregresif decode sırasında önceki tokenlerin K/V tensörleri yeniden hesaplanmak yerine saklanır. Bağlam uzadıkça KV cache büyür ve eşzamanlı kullanıcı sayısını sınırlayabilir. GQA/MQA, düşük hassasiyetli cache veya sayfalı bellek yönetimi bu baskıyı azaltabilir.

### 15.5 FlashAttention

FlashAttention, standart attention'ın matematiksel sonucunu korurken GPU bellek hiyerarşisindeki veri hareketini azaltan I/O-aware bir algoritmadır. Temel ders, FLOP sayısının tek performans ölçüsü olmadığıdır; HBM-SRAM veri hareketi duvar saati süresini belirleyebilir.

### 15.6 PagedAttention ve sürekli batching

PagedAttention yaklaşımı KV cache'i işletim sistemlerindeki sayfalama fikrine benzer biçimde bloklar halinde yöneterek parçalanmayı azaltır. Sürekli batching ise tamamlanan istekleri beklemeden yeni istekleri çalışan batch'e alarak GPU kullanımını artırabilir.

### 15.7 Spekülatif çözümleme

Küçük ve hızlı bir draft model birkaç aday token üretir; büyük hedef model bunları toplu biçimde doğrular. Uygun koşullarda hedef model dağılımını bozmadan decode gecikmesi azaltılabilir. Hızlanma draft modelin kalitesi, donanım ve batch düzenine bağlıdır.

### 15.8 Nicemleme

FP16/[BF16](/wiki/bf16) ağırlıkları INT8, INT4 veya başka düşük hassasiyetli temsillere indirgenebilir. Kazanç:

- daha az model belleği,
- daha yüksek bellek bant genişliği verimliliği,
- bazı donanımlarda daha yüksek throughput.

Bedel ise nicemleme hatası, kernel desteği ve görev bazlı kalite kaybıdır. Ölçüm yapılmadan "4-bit model aynı kalitededir" genellemesi yapılmamalıdır.

## Ünite 16: Diğer Yapay Zekâ Yaklaşımlarıyla Bağlantı

### 16.1 Yapay sinir ağları

LLM, [Yapay Sinir Ağları ve Öğrenme Modelleri](/yapay-sinir-aglari-ve-ogrenme-modelleri) dersindeki temel kavramların büyük ölçekli bir uygulamasıdır. Ağırlık, aktivasyon, kayıp, geri yayılım, optimizer, aşırı uyum ve dağılım değişimi aynen geçerlidir. Transformer bu çerçevenin dışında ayrı bir "zeka türü" değildir.

Daha tarihsel sinir ağı çerçevesi için [Yapay Zeka ve Yapay Sinir Ağları](/yapay-sinir-aglari) notu da tamamlayıcıdır.

### 16.2 İstatistiksel öğrenme

[İstatistiksel Öğrenme ve Makine Öğrenmesi](/istatistiksel-ogrenme-makine-ogrenmesi), LLM eğitiminde kullanılan ampirik risk, genelleme, veri dağılımı, sınıflandırma ve değerlendirme düşüncesinin matematiksel arka planını sağlar. LLM'ler klasik yöntemlerden çok daha büyük olsa da veri dağılımı değişimi ve ölçüm yanlılığı ortadan kalkmaz.

### 16.3 Bulanık mantık

[Bulanık Mantık](/bulanik-mantik), doğal dildeki "yüksek risk", "yakın", "uygun" gibi dereceli kavramları açık üyelik fonksiyonlarıyla modelleyebilir. LLM ise bu kavramların dilsel kullanımlarını veri üzerinden öğrenebilir; fakat modelin iç temsili açık bir bulanık kural tabanı değildir. Hibrit sistemde LLM metinden özellik çıkarabilir, bulanık sistem ise şeffaf karar kuralı uygulayabilir.

### 16.4 Genetik algoritmalar

[Genetik Algoritmalar ve Uygulamaları](/genetik-algoritmalar-ve-uygulamalari), türevin olmadığı veya arama uzayının ayrık olduğu LLM çevresi problemlerinde kullanılabilir: istem şablonu seçimi, RAG parametreleri, araç sırası, model bileşimi veya çok amaçlı maliyet-kalite optimizasyonu. Buna karşın milyarlarca LLM ağırlığını doğrudan genetik algoritmayla eğitmek çoğu üretim ölçeğinde pratik değildir.

### 16.5 Mantıksal programlama

[Mantıksal Programlama ve Prolog](/mantiksal-programlama-ve-prolog) açık olgu ve kurallar üzerinde çözümleme yapar. LLM ise dildeki örüntülerden aday ifade üretebilir. İkisi birlikte kullanıldığında:

```text
doğal dil
   |
   v
  LLM ---> aday olgu / kural / sorgu
                      |
                      v
               Prolog / SMT / kural motoru
                      |
                 doğrulama sonucu
                      |
                      v
                     LLM
                      |
                      v
                açıklanmış yanıt
```

Bu mimari, üretim ile biçimsel doğrulamayı ayırır.

### 16.6 Yapay zekâ ve felsefe

[Yapay Zeka: Felsefe, Kuram ve Uygulama](/yapay-zeka-felsefe-kuram-uygulama), LLM tartışmasındaki temel kategorik ayrımları sağlar:

- dil üretimi ≠ doğruluk,
- problem çözme ≠ bilinç,
- araç kullanımı ≠ bağımsız amaç,
- insan benzeri ifade ≠ insan benzeri öznel deneyim,
- yüksek benchmark ≠ bütün bağlamlarda güvenilirlik.

LLM'ler bu soruları görünür hale getirir; fakat tek başına çözmez.

## Ünite 17: Türkçe ve Alan Uyarlaması

### 17.1 Türkçe değerlendirme zorunluluğu

Çok dilli modelde İngilizce benchmark sonucu Türkçe üretim kalitesini garanti etmez. Türkçe için ayrı değerlendirme seti oluşturulmalıdır. Özellikle:

- eklemeli yapı,
- deyimler,
- alan terimleri,
- özel adlar,
- `I/İ/ı/i` dönüşümü,
- resmi ve gündelik dil farkı,
- tarih/sayı biçimleri,
- kod ve İngilizce teknik terimlerin karışması

test edilmelidir.

### 17.2 Alan modellemesi

Bir kurum veya teknik alan için üç ayrı sorun olabilir:

1. Model terminolojiyi bilmiyor.
2. Bilgi güncel değil.
3. İstenen davranış biçimini izlemiyor.

Bunların çözümü sırasıyla aynı değildir. Terim/üslup için SFT veya LoRA, güncel bilgi için RAG, eylem için araç entegrasyonu daha uygun olabilir.

### 17.3 Veri kaçağı

Alan verisiyle ince ayar yaparken model ağırlıklarının daha sonra kimlerin eline geçeceği düşünülmelidir. Gizli belgeyi modele öğretmek, erişim kontrolü uygulanmış belge deposunda tutmakla aynı değildir. Erişim hakkı kullanıcıya göre değişiyorsa RAG tabanlı retrieval katmanı genellikle daha denetlenebilir bir sınır sağlar.

## Ünite 18: Üretim Mimarisi

Bir LLM uygulamasını tek `prompt -> model -> cevap` zinciri olarak tasarlamak prototipte yeterli olabilir; üretimde sorumlulukların ayrılması gerekir.

```text
                   +-------------------+
Kullanıcı -------->| API / Oturum      |
                   +---------+---------+
                             |
                    +--------v--------+
                    | Politika / ACL   |
                    +--------+--------+
                             |
              +--------------+--------------+
              |                             |
      +-------v-------+             +-------v-------+
      | Bağlam/RAG    |             | Araç kayıtları|
      +-------+-------+             +-------+-------+
              |                             |
              +--------------+--------------+
                             |
                      +------v------+
                      |    LLM      |
                      +------+------+ 
                             |
                      +------v------+
                      | Çıktı       |
                      | doğrulama   |
                      +------+------+ 
                             |
             +---------------+---------------+
             |                               |
        kullanıcı                        araç/eylem
```

### 18.1 Sürümleme

Aşağıdaki bileşenler ayrı sürümlenmelidir:

- model ve ağırlık hash'i,
- tokenizer,
- sistem talimatı,
- retrieval indeksi,
- gömme modeli,
- reranker,
- araç şemaları,
- güvenlik politikası,
- değerlendirme seti.

Model sabit kalsa bile prompt veya RAG indeksi değişikliği davranışı değiştirebilir.

### 18.2 Gözlemlenebilirlik

Üretim telemetrisi yalnız cevap metnini saklamak değildir. Gizlilik ilkelerine uygun biçimde şu ölçüler izlenebilir:

- istek sınıfı,
- token girdi/çıktı sayısı,
- TTFT/TPOT,
- retrieval aday sayısı ve skorları,
- araç çağrıları,
- hata sınıfı,
- kullanıcı geri bildirimi,
- model/prompt sürümü,
- güvenlik filtresi sonucu.

Kişisel veya gizli içeriği loglamak zorunlu değildir; çoğu zaman yapısal metadata yeterlidir.

### 18.3 Hata dayanımı

Model sunucusu, vektör veritabanı veya dış araç başarısız olabilir. Uygulama:

- zaman aşımı,
- sınırlı yeniden deneme,
- devre kesici,
- geri dönüş modeli,
- kısmi özellik kaybı,
- kuyruk sınırı,
- yük atma

gibi klasik dağıtık sistem desenlerini kullanmalıdır.

## Ünite 19: 2026 İtibarıyla Güncel Yönelimler

Bu bölüm kalıcı kuramdan ziyade alanın 2026'ya kadar belirginleşen mühendislik yönlerini özetler.

### 19.1 Çıkarım zamanı ölçekleme

Kaliteyi yalnız daha büyük ön eğitimle artırmak yerine zor soruya daha fazla çıkarım bütçesi ayıran modeller yaygınlaşmıştır. Verifier, arama ve pekiştirmeli öğrenmeyle edinilmiş problem çözme davranışları bu çizginin parçalarıdır.

### 19.2 Seyrek uzman modelleri

MoE mimarileri toplam parametre sayısını artırırken token başına etkin parametreleri sınırlama olanağı verir. Donanım tarafında uzmanların GPU'lar arasında dağılımı ve all-to-all iletişim kritik darboğazdır.

### 19.3 Uzun bağlam ve dış bellek

Bağlam pencereleri büyürken RAG ortadan kalkmamıştır. Uzun bağlam ham belgeyi taşıma kapasitesi sağlar; retrieval ise ilgili bilginin seçimi, yetkilendirme, tazelik ve kaynak kökeni sorunlarını çözer. İki yaklaşım tamamlayıcıdır.

### 19.4 Ajanlaşma ve protokol katmanı

Modelin web, dosya, kod çalıştırma, veri tabanı ve kurumsal uygulamalarla araç üzerinden etkileşmesi yaygınlaşmıştır. Bunun sonucu model kalitesinden çok **yetki sınırı, işlem güvenliği ve protokol tasarımı** önem kazanmıştır. MCP gibi standartlaşma girişimleri bu entegrasyon katmanını ortaklaştırmayı hedefler.

### 19.5 Küçük ve uzman modeller

Her görev en büyük modeli gerektirmez. Distillation, nicemleme ve alan odaklı eğitimle daha küçük modeller düşük gecikme, düşük enerji ve yerel/on-prem dağıtım avantajı sağlayabilir. Doğru seçim benchmark yerine gerçek trafik üzerinde kalite-maliyet eğrisiyle yapılmalıdır.

### 19.6 Çok kipli modeller

Metin, görüntü, ses ve video tek sistemde birleşmektedir. Buna karşın kip sayısı arttıkça değerlendirme ve güvenlik yüzeyi de büyür. Metindeki güvenlik filtresi görüntü içindeki gizli talimatı algılamayabilir.

### 19.7 Sentetik veri ve modelden modele öğrenme

Güçlü modeller eğitim örneği, tercih verisi veya distillation hedefi üretebilir. Sentetik veri maliyeti düşürür; ancak kendi hatalarının yeniden üretilmesi, çeşitlilik kaybı ve değerlendirme sızıntısı riskleri vardır. İnsan veya harici doğrulama tamamen kaldırılmamalıdır.

## Ünite 20: Bilgi, Anlama ve Sistem Sınırı

Bir LLM'in parametrelerinde geniş olgusal örüntüler bulunabilir; ancak "bilgi" kavramı epistemolojide yalnız doğru cümle üretmekten daha geniştir. Kaynağın bilinmesi, gerekçenin kurulması ve yanlış olduğunda düzeltilebilirlik de önem taşır.

LLM sistemi için üç ayrı katman düşünmek yararlıdır:

```text
Modelin parametrik örüntüsü
          |
          v
Çalışma zamanı bağlamı ve dış kaynaklar
          |
          v
Uygulamanın doğrulama / yetki / eylem katmanı
```

Modelin cevabı tek başına sistem kararı değildir. Özellikle adli, güvenlik, sağlık, finans veya fiziksel kontrol gibi yüksek etkili alanlarda karar zincirinin hangi bölümünün modele, hangi bölümünün deterministik kurala ve hangi bölümünün insana ait olduğu açıkça tanımlanmalıdır.

Akıcı dil insan zihninde "anlıyor" izlenimi oluşturabilir. Bu izlenim yararlı bir kullanıcı arayüzü etkisi olabilir; fakat mimari değerlendirmede antropomorfik varsayım yerine ölçülebilir davranışa dönülmelidir.

## Ünite 21: Tasarım Kararı İçin Kısa Başvuru

```text
Sorun: Güncel bilgi mi gerekiyor?
  Evet -> RAG / araç
  Hayır
    |
    +-> Özel davranış mı gerekiyor?
          Evet -> SFT / LoRA / tercih eğitimi
          Hayır
            |
            +-> Kesin hesap veya kural mı gerekiyor?
                  Evet -> araç / sembolik motor
                  Hayır
                    |
                    +-> Yalnız görev tanımı mı eksik?
                          Evet -> istem / örnek içinde öğrenme
```

### Üretime geçmeden önce

- Modelin görev kapsamı açık mı?
- Kapalı test seti var mı?
- Türkçe ve alan verisi ayrı değerlendirildi mi?
- RAG erişim kontrolü kullanıcı yetkisiyle uyumlu mu?
- Model çıktısı güvenilmeyen veri olarak doğrulanıyor mu?
- Araçlar en az yetkiyle mi çalışıyor?
- Prompt injection senaryoları test edildi mi?
- Model, tokenizer, prompt ve indeks sürümleniyor mu?
- P95/P99 gecikme ve throughput ölçüldü mü?
- KV cache ve uzun bağlam bellek bütçesi hesaplandı mı?
- Hata durumunda geri dönüş davranışı tanımlı mı?
- Yüksek riskli eylem için insan veya deterministik onay var mı?

## Sonuç

Büyük dil modellerini anlamanın en sağlıklı yolu onları tek başına "zeki sohbet sistemi" olarak değil, **istatistiksel öğrenme + büyük ölçekli sinir ağı + veri mühendisliği + dağıtık eğitim + çıkarım sistemi + doğrulama + güvenlik** bileşimi olarak incelemektir.

Transformer, bu sistemin sinirsel çekirdeğini sağlar. Ön eğitim dilsel ve kavramsal örüntüleri; sonradan eğitim talimat ve tercih davranışını; RAG güncel ve yerel bilgiyi; araç katmanı dış dünyadaki eylemi; değerlendirme ve güvenlik katmanı ise sistem sınırını tanımlar.

Bu bakış, yapay zekâ yöntemlerini birbirinin rakibi olarak değil tamamlayıcı araçlar olarak görmeyi sağlar. Sinir ağları temsil öğrenir; istatistiksel öğrenme ölçüm disiplinini sağlar; bulanık mantık dereceli kavramları açık biçimde modelleyebilir; genetik algoritmalar türevsiz arama sunar; mantıksal programlama biçimsel kuralları doğrular. Büyük dil modeli bu yöntemlerin yerine geçmek zorunda değildir; doğru mimaride onların arasında doğal dil tabanlı bir arayüz ve üretici bileşen olabilir.

## Kaynakça

### Temel kitaplar

- Pere Martra. *Large Language Models Projects: Apply and Implement Strategies for Large Language Models*. Apress, 2024. ISBN 979-8-8688-0515-8.
- Raj Arun R. *Mastering Large Language Models with Python*. Orange Education, 2024. ISBN 9788197081828.
- John Atkinson-Abutridy. *Large Language Models: Concepts, Techniques and Applications*. CRC Press, 2024. DOI: https://doi.org/10.1201/9781003517245
- Morteza SaberiKamarposhti. *Building Large Language Models (LLM): A Step-by-Step Guide to Practical LLM Development*. 2024.

### Temel ve güncel teknik çalışmalar

- Ashish Vaswani et al. “Attention Is All You Need.” *NeurIPS*, 2017. https://arxiv.org/abs/1706.03762
- Jordan Hoffmann et al. “Training Compute-Optimal Large Language Models.” 2022. https://arxiv.org/abs/2203.15556
- Edward J. Hu et al. “LoRA: Low-Rank Adaptation of Large Language Models.” *ICLR*, 2022. https://arxiv.org/abs/2106.09685
- Tim Dettmers et al. “QLoRA: Efficient Finetuning of Quantized LLMs.” *NeurIPS*, 2023. https://arxiv.org/abs/2305.14314
- Patrick Lewis et al. “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.” *NeurIPS*, 2020. https://arxiv.org/abs/2005.11401
- Long Ouyang et al. “Training Language Models to Follow Instructions with Human Feedback.” *NeurIPS*, 2022. https://arxiv.org/abs/2203.02155
- Rafael Rafailov et al. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model.” *NeurIPS*, 2023. https://arxiv.org/abs/2305.18290
- William Fedus; Barret Zoph; Noam Shazeer. “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity.” 2021. https://arxiv.org/abs/2101.03961
- Tri Dao et al. “FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.” *NeurIPS*, 2022. https://arxiv.org/abs/2205.14135
- Joshua Ainslie et al. “GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.” 2023. https://arxiv.org/abs/2305.13245
- Woosuk Kwon et al. “Efficient Memory Management for Large Language Model Serving with PagedAttention.” *SOSP*, 2023. https://arxiv.org/abs/2309.06180
- Charlie Chen et al. “Accelerating Large Language Model Decoding with Speculative Sampling.” 2023. https://arxiv.org/abs/2302.01318
- Nelson F. Liu et al. “Lost in the Middle: How Language Models Use Long Contexts.” 2023. https://arxiv.org/abs/2307.03172
- Shunyu Yao et al. “ReAct: Synergizing Reasoning and Acting in Language Models.” *ICLR*, 2023. https://arxiv.org/abs/2210.03629
- Timo Schick et al. “Toolformer: Language Models Can Teach Themselves to Use Tools.” *NeurIPS*, 2023. https://arxiv.org/abs/2302.04761
- Lianmin Zheng et al. “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.” 2023. https://arxiv.org/abs/2306.05685
- Carlos E. Jimenez et al. “SWE-bench: Can Language Models Resolve Real-World GitHub Issues?” 2023. https://arxiv.org/abs/2310.06770
- Charlie Snell et al. “Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.” arXiv preprint, 2024. https://arxiv.org/abs/2408.03314
- DeepSeek-AI et al. “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.” arXiv preprint, 2025; revised 2026. https://arxiv.org/abs/2501.12948

### Güvenlik ve risk yönetimi

- NIST. *Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1)*, 2024; web sürümü 2026'da güncellenmiştir. https://doi.org/10.6028/NIST.AI.600-1
- OWASP GenAI Security Project. *OWASP Top 10 for LLM Applications 2025*. https://genai.owasp.org/llm-top-10/
- Model Context Protocol. *Specification 2026-07-28*. https://modelcontextprotocol.io/

## Bu Çalışmaya Atıf

Köker, M. A. (2023). Büyük Dil Modelleri. alikoker.com.tr. https://alikoker.com.tr/buyuk-dil-modelleri

- BibTeX: https://alikoker.com.tr/buyuk-dil-modelleri.bib
- RIS: https://alikoker.com.tr/buyuk-dil-modelleri.ris
- CSL-JSON: https://alikoker.com.tr/buyuk-dil-modelleri.csl.json
