Olasılık ve İstatistik: Dağılımlar, Örnekleme ve Regresyon
Betimsel istatistik, olasılık, dağılımlar, örnekleme, regresyon, stokastik süreçler ve Markov zincirlerini; bootstrap, permutation, Monte Carlo, güç analizi ve istatistiksel öğrenmeye geçişle birleştiren ders notları.
Ünite 1: İstatistiğe Giriş
Temel kavramlar
İstatistik, veriyi toplama, düzenleme, çözümleme ve yorumlama yöntemlerinin bütünüdür.
Anakütle, hakkında bilgi edinilmek istenen birimlerin tümüdür.
Örnek, anakütleden seçilen alt kümedir.
Tamsayım, anakütledeki bütün birimlerin incelenmesidir.
Örnekleme, anakütleden belirli bir yöntemle örnek seçme işlemidir.
Birim, incelemeye konu olan tek gözlemdir.
Değişken, birimlerin ölçülen veya sınıflandırılan özelliğidir.
Anakütleyi tanımlayan sayısal büyüklüğe parametre, örnekten hesaplanan karşılığına istatistik denir. İstatistiksel çıkarım, örnekten anakütle hakkında sonuç üretir.
Ölçme düzeyleri
- Sınıflayıcı (nominal): yalnız sınıf belirtir; doğal sırası yoktur.
- Sıralayıcı (ordinal): sıralama vardır; düzeyler arasındaki farkın eşit olduğu söylenemez.
- Aralık (interval): eşit farklar anlamlıdır; mutlak sıfır yoktur.
- Oran (ratio): eşit farklara ek olarak gerçek sıfır vardır; oranlar anlamlıdır.
Bir kategorinin 1, 2, 3 gibi sayılarla kodlanması onu nicel değişken yapmaz. Kodlama ile ölçme düzeyi farklı kavramlardır.
Veri hangi düzeyde toplulaştırıldıysa yorum da o düzeyde yapılmalıdır. İl, birim veya dönem düzeyinde bulunan ilişkinin tek tek gözlemler için de geçerli olduğunu varsaymak ekolojik yanılgıdır.
Betimleyici ve çıkarımsal istatistik
Betimleyici istatistik, eldeki veriyi özetler.
Çıkarımsal istatistik, örnekten anakütle hakkında belirsizlik içeren sonuçlar üretir.
Bu ayrım merkezîdir: ortalama ve standart sapma veriyi betimler; standart hata ve güven aralığı örnekleme belirsizliğini ölçer.
Merkezi eğilim ölçüleri
Aritmetik ortalama
x̄ = Σxᵢ / n
x̄ = Σ(fᵢ·xᵢ) / ΣfᵢGruplanmış seride xᵢ sınıf orta noktasıdır.
Aritmetik ortalama bütün gözlemleri kullanır ve aykırı değerlere duyarlıdır.
Geometrik ortalama
G = ⁿ√(x₁·x₂·...·xₙ)
log G = Σ(log xᵢ) / nPozitif değerlerde oransal değişim, büyüme ve bileşik getiri için kullanılır.
Harmonik ortalama
H = n / Σ(1/xᵢ)Oran ve hızların uygun biçimde ortalanmasında kullanılır.
Kareli ortalama
K = √(Σxᵢ² / n)İşaretten bağımsız büyüklük ölçümünde kullanılır.
Pozitif değerlerde:
H ≤ G ≤ x̄ ≤ KMedyan
Sıralanmış dizinin ortasındaki değerdir. Aykırı değerlere ortalamadan daha dayanıklıdır.
Gruplanmış seride:
Md = L + [ (n/2 − F) / f ] · cL medyan sınıfının alt sınırı, F önceki birikimli frekans, f medyan sınıfının frekansı, c sınıf genişliğidir.
Mod
En sık gözlenen değerdir. Bir dağılımın modu olmayabilir veya birden çok modu olabilir.
Gruplanmış seride:
Mo = L + [ Δ₁ / (Δ₁ + Δ₂) ] · cSimetrik tek modlu dağılımda:
x̄ = Md = MoDağılma ölçüleri
Değişim aralığı:
R = x_max − x_minYalnız en küçük ve en büyük değeri kullandığı için aykırı değerlere duyarlıdır.
Kartiller arası açıklık:
IQR = Q₃ − Q₁Ortadaki yüzde 50'lik bölgenin yayılımını gösterir ve uç değerlere daha dayanıklıdır.
Anakütle varyansı:
σ² = Σ(xᵢ − μ)² / NÖrnek varyansı:
s² = Σ(xᵢ − x̄)² / (n − 1)Standart sapma:
s = √s²Standart sapma gözlemlerin yayılımını, standart hata ise bir tahmin edicinin örnekten örneğe değişkenliğini anlatır.
Bağımsız gözlemlerde örnek ortalamasının tahmini standart hatası:
SE(x̄) = s / √nDeğişim katsayısı:
DK = (s / x̄) · 100Farklı ölçeklerdeki pozitif niceliklerin göreli değişkenliğini karşılaştırmak için kullanılabilir. Ortalama sıfıra yakınsa kararsızlaşır.
Yüzdelikler ve kuantiller
Medyan 50. yüzdeliktir. Q₁, Q₂, Q₃ sırasıyla yüzde 25, 50 ve 75 noktalarını gösterir.
P90, P95 ve P99 üst kuyruk davranışını özetler. Örneğin P95, gözlemlerin yaklaşık yüzde 95'inin bu değerde veya altında kaldığı eşiği gösterir.
Yüzdelik algoritmaları, özellikle küçük örneklerde sıra konumu ve iç değer bulma yöntemine göre farklı sonuç verebilir. Karşılaştırmalarda aynı yöntem kullanılmalıdır.
Dayanıklı istatistikler
Aykırı değerlerin ortalama ve standart sapmayı bozduğu serilerde medyan ve medyan mutlak sapması kullanılabilir:
MAD = medyan(|xᵢ − medyan(x)|)Değiştirilmiş z-puanı:
Mᵢ = 0,6745 · (xᵢ − medyan(x)) / MADBu puan olağandışı gözlemi işaretler; tek başına kanıt değildir. MAD = 0 ise formül doğrudan uygulanamaz.
Klasik z-puanı:
zᵢ = (xᵢ − x̄) / sÜnite 2: Kümeler Kuramı
Küme ve alt küme
Bir nesne topluluğuna küme, içindeki nesnelere eleman denir.
A kümesinin bütün elemanları B içinde bulunuyorsa:
A ⊆ Bn elemanlı bir kümenin alt küme sayısı:
2ⁿKesişim, birleşim, tümleyen
A ∩ B = {x : x ∈ A ve x ∈ B}
A ∪ B = {x : x ∈ A veya x ∈ B}
A' = {x ∈ E : x ∉ A}
A \ B = A ∩ B'De Morgan kuralları:
(A ∪ B)' = A' ∩ B'
(A ∩ B)' = A' ∪ B'İçerme-dışlama ilkesi:
|A ∪ B| = |A| + |B| − |A ∩ B|Kümeler kuramı olasılığın dilidir: örnek uzay bir küme, olay onun alt kümesidir.
Ünite 3: Permütasyon ve Kombinasyon
Sayma ilkeleri
Ayrık seçenekler için sayılar toplanır; ardışık aşamalar için çarpılır.
Permütasyon
Sıranın önemli olduğu seçimdir.
P(n,r) = n! / (n−r)!
P(n,n) = n!Tekrarlı seçim:
nʳÖzdeş elemanlar varsa:
n! / (n₁!·n₂!·...·nₖ!)Kombinasyon
Sıranın önemli olmadığı seçimdir.
C(n,r) = n! / [r!·(n−r)!]Tekrarlı kombinasyon:
C(n+r−1,r)Özellikler:
C(n,r) = C(n,n−r)
C(n,r) = C(n−1,r−1) + C(n−1,r)
Σ C(n,r) = 2ⁿSeçim ölçütü basittir: sıra sonucu değiştiriyorsa permütasyon, değiştirmiyorsa kombinasyon kullanılır.
Ünite 4: Olasılığa Giriş
Temel kavramlar
Sonucu önceden kesin bilinmeyen işleme rastgele deney, bütün olası sonuçların kümesine örnek uzay, örnek uzayın alt kümelerine olay denir.
Olasılık tanımları
Eşit olasılıklı sonuçlarda klasik tanım:
P(A) = elverişli durum sayısı / mümkün durum sayısıFrekans yaklaşımında olasılık, çok sayıda tekrar sonunda göreli frekansın yaklaştığı değerdir.
Kolmogorov aksiyomları:
0 ≤ P(A) ≤ 1
P(S) = 1
A ve B ayrık ise P(A ∪ B) = P(A) + P(B)Temel sonuçlar:
P(∅) = 0
P(A') = 1 − P(A)
P(A ∪ B) = P(A) + P(B) − P(A ∩ B)Üç olay için:
P(A∪B∪C)
= P(A)+P(B)+P(C)
− P(A∩B)−P(A∩C)−P(B∩C)
+ P(A∩B∩C)Koşullu olasılık
P(A|B) = P(A ∩ B) / P(B), P(B) > 0Çarpma teoremi:
P(A ∩ B) = P(B)·P(A|B)
= P(A)·P(B|A)Bağımsızlık
P(A|B) = P(A)eşdeğer olarak:
P(A ∩ B) = P(A)·P(B)Ayrıklık ve bağımsızlık aynı şey değildir. Olasılıkları sıfırdan farklı iki ayrık olay bağımsız olamaz.
Toplam olasılık
B₁, ..., Bₙ örnek uzayı ayrık biçimde bölüyorsa:
P(A) = Σ P(Bᵢ)·P(A|Bᵢ)Bayes teoremi
P(Bₖ|A)
= P(Bₖ)·P(A|Bₖ) / Σ[P(Bᵢ)·P(A|Bᵢ)]P(Bₖ) önsel, P(Bₖ|A) sonsal olasılıktır. Yeni gözlem, önceki olasılık bilgisini günceller.
Ünite 5: Rastgele Değişkenler
Kesikli ve sürekli değişken
Kesikli rastgele değişken sayılabilir değerler alır.
Sürekli rastgele değişken bir aralıktaki değerleri alabilir.
Kesikli dağılım
p(xᵢ) = P(X = xᵢ)
p(xᵢ) ≥ 0
Σp(xᵢ) = 1Birikimli dağılım:
F(x) = P(X ≤ x)Beklenen değer:
E(X) = μ = Σxᵢ·p(xᵢ)Varyans:
Var(X) = E[(X−μ)²]
= E(X²) − [E(X)]²Özellikler:
E(aX+b) = aE(X)+b
E(X+Y) = E(X)+E(Y)
Var(aX+b) = a²Var(X)Genel olarak:
Var(X+Y)
= Var(X)+Var(Y)+2Cov(X,Y)Sürekli dağılım
Yoğunluk fonksiyonu:
f(x) ≥ 0
∫f(x)dx = 1
P(a ≤ X ≤ b) = ∫[a,b] f(x)dxSürekli dağılımda tek noktanın olasılığı sıfırdır.
F(x) = ∫(−∞,x] f(t)dt
E(X) = ∫x·f(x)dx
Var(X) = ∫(x−μ)²f(x)dxÜnite 6: Kesikli Olasılık Dağılımları
Bernoulli dağılımı
İki sonuçlu tek deneme:
P(X=1) = p
P(X=0) = 1−p = q
E(X) = p
Var(X) = p·qBinom dağılımı
n bağımsız Bernoulli denemesindeki başarı sayısı:
P(X=k) = C(n,k)·pᵏ·q^(n−k)
E(X) = n·p
Var(X) = n·p·qKoşullar: sabit deneme sayısı, iki sonuç, sabit başarı olasılığı ve bağımsız denemeler.
Çok terimli dağılım
Binomun ikiden çok sonuçlu genişlemesidir:
P(X₁=n₁,...,Xₖ=nₖ)
= [n!/(n₁!·...·nₖ!)] · p₁^n₁ · ... · pₖ^nₖPoisson dağılımı
Sabit bir zaman veya alan aralığındaki olay sayısını modeller:
P(X=k) = e^(−λ)·λᵏ/k!
E(X) = λ
Var(X) = λKuramsal Poisson modelinde ortalama ve varyans eşittir. Örnek veride belirgin aşırı veya az saçılım model uygunluğunun incelenmesini gerektirir.
Binom için n büyür, p küçülür ve λ=n·p sınırlı kalırsa Poisson yaklaşımı kullanılabilir. Sabit eşikler yalnız pratik kuraldır.
Geometrik dağılım
İlk başarıya kadar geçen deneme sayısı:
P(X=k) = q^(k−1)·p
E(X) = 1/pBelleksizdir.
Negatif binom dağılımı
r başarının gerçekleşmesine kadar geçen deneme sayısını modeller. Geometrik dağılım r=1 özel durumudur.
Ünite 7: Sürekli Olasılık Dağılımları
Normal dağılım
f(x)
= [1/(σ√(2π))]
· e^(−(x−μ)²/(2σ²))μ konumu, σ yayılımı belirler.
Özellikleri:
μçevresinde simetriktir.- Ortalama, medyan ve mod çakışır.
- Eğri altındaki alan 1'dir.
- Dönüm noktaları
μ ± σkonumundadır.
Yaklaşık ampirik kural:
μ ± σ → %68
μ ± 2σ → %95
μ ± 3σ → %99,7Standart normal dağılım
Z = (X−μ)/σZ, gözlemin ortalamadan kaç standart sapma uzakta olduğunu gösterir.
Merkezî limit teoremi
Uygun bağımsızlık ve düzenlilik koşullarında örnek büyüklüğü arttıkça örnek ortalamasının standartlaştırılmış dağılımı normale yaklaşır:
X̄ ≈ N(μ, σ²/n)Ham gözlemlerin normalleştiğini söylemez. Yakınsama hızı dağılımın çarpıklığına, kuyruklarına ve bağımlılık yapısına bağlıdır.
Üstel dağılım
Olaylar arası bekleme süresini modeller:
f(x) = λe^(−λx), x ≥ 0
F(x) = 1−e^(−λx)
E(X) = 1/λ
Var(X) = 1/λ²Belleksizlik:
P(X>s+t | X>s) = P(X>t)Gamma dağılımı
r. olaya kadar geçen süre için:
E(X) = r/λ
Var(X) = r/λ²r=1 olduğunda üstel dağılıma indirgenir.
Beta dağılımı
Tanım aralığı [0,1] olan esnek bir dağılımdır. Oran ve olasılık modellemesinde kullanılır.
Ki-kare dağılımı
χ² = Z₁² + Z₂² + ... + Zₖ²k serbestlik derecesidir. Varyans çıkarımı ve bağımsızlık testlerinde kullanılır.
F dağılımı
F = (χ₁²/k₁) / (χ₂²/k₂)Varyans karşılaştırması ve varyans analizinde kullanılır.
Student t dağılımı
t = Z / √(χ²/k)Normal dağılıma göre daha kalın kuyrukludur. Serbestlik derecesi arttıkça standart normal dağılıma yaklaşır.
Anakütle standart sapmasının bilinmediği ortalama çıkarımlarında, varsayımlar sağlandığında uygun serbestlik derecesiyle kullanılır.
Ünite 8: Örnekleme ve Kestirim
Örnekleme çerçevesi
Örnekleme çerçevesi, anakütlede seçilebilecek birimlerin listesidir. Eksik çerçeve, temsil hatası üretir.
Örnekleme planı; anakütle, çerçeve, yöntem, örnek büyüklüğü, veri toplama biçimi ve tahmin edicileri tanımlar.
Nokta ve aralık tahmini
Nokta tahmini, parametre için tek değer üretir.
Güven aralığı, örnekleme belirsizliğini aralıkla gösterir.
Anakütle standart sapması biliniyorsa:
x̄ ± z(α/2)·σ/√nBilinmiyor ve normal model uygunsa:
x̄ ± t(α/2,n−1)·s/√nFrekansçı yorumda yüzde 95 güven düzeyi, aynı yöntem çok kez uygulandığında oluşturulan aralıkların uzun dönemde yaklaşık yüzde 95'inin sabit fakat bilinmeyen parametreyi kapsamasıdır.
Sonlu anakütle düzeltmesi
İadesiz örneklemede örnekleme oranı yüksekse:
√[(N−n)/(N−1)]kullanılır.
Örnek büyüklüğü
Basit durumda hedef hata payı d için:
n = [z(α/2)·σ/d]²Standart hata yaklaşık 1/√n ile azalır; hata payını yarıya indirmek için örnek büyüklüğünü yaklaşık dört katına çıkarmak gerekir.
Basit rastgele örnekleme
Her birimin seçilme olasılığı eşittir. Kuramsal olarak basittir; küçük alt grupların örnekte temsil edilmesini garanti etmez.
Sistematik örnekleme
k = N/nİlk k birim arasından rastgele başlangıç seçilir, ardından her k. birim alınır. Veri sırasındaki dönemlilik yanlılık üretebilir.
Tabakalı örnekleme
Anakütle kendi içinde benzer tabakalara ayrılır ve her tabakadan örnek çekilir.
N = N₁ + ... + Nₖ
n = n₁ + ... + nₖTabaka içi değişkenliğin düşük, tabakalar arası farkın yüksek olması yöntemin etkinliğini artırır.
Dağıtım eşit, orantılı veya Neyman dağıtımıyla yapılabilir.
Küme örneklemesi
Anakütle doğal kümelere ayrılır ve kümelerin bir bölümü seçilir. Coğrafi maliyeti azaltabilir; aynı kümedeki gözlemlerin benzerliği etkin örnek büyüklüğünü düşürebilir.
Ağırlıklandırma
Farklı seçilme olasılıklarında:
x̄_w = Σ(wᵢxᵢ) / Σwᵢkullanılabilir.
Karmaşık örnekleme tasarımında yalnız ortalama değil standart hata hesabı da tasarımı dikkate almalıdır.
Eksik veri
Eksik veri mekanizmaları:
- MCAR: eksiklik gözlenen ve gözlenmeyen değerlerden bağımsızdır.
- MAR: eksiklik gözlenen değişkenlerle açıklanabilir.
- MNAR: eksiklik gözlenmeyen değerin kendisiyle de ilişkilidir.
Eksik satırları doğrudan silmek veya ortalamayla doldurmak her durumda tarafsız değildir.
Ünite 9: Regresyon, Korelasyon ve Hipotez Sınaması
Saçılım diyagramı
İki nicel değişken arasındaki ilişkiyi incelemenin ilk adımı saçılım diyagramıdır. Doğrusal olmayan yapı, aykırı gözlem ve değişen yayılım çoğu zaman burada görülür.
Doğrusal regresyon
Y = a + bX + εEn küçük kareler kestirimleri:
b = Σ[(xᵢ−x̄)(yᵢ−ȳ)] / Σ(xᵢ−x̄)²
a = ȳ − b·x̄b, X bir birim arttığında Y için beklenen doğrusal değişimi verir.
Korelasyon
Pearson korelasyon katsayısı:
r = Σ[(xᵢ−x̄)(yᵢ−ȳ)]
/ √[Σ(xᵢ−x̄)² · Σ(yᵢ−ȳ)²]−1 ≤ r ≤ 1.
r≈0, doğrusal ilişkinin zayıf olduğunu gösterir; doğrusal olmayan ilişkiyi dışlamaz.
Aykırı değerlere veya sıralı yapıya duyarlılık önemliyse Spearman sıra korelasyonu değerlendirilebilir.
Korelasyon nedensellik değildir.
Belirlilik katsayısı
Basit doğrusal regresyonda:
R² = 1 − SSE/SSTModelin gözlenen değişkenliğin ne kadarını açıkladığını özetler. Yüksek R², modelin doğru, nedensel veya genellenebilir olduğunu tek başına göstermez.
Artıklar
eᵢ = yᵢ − ŷᵢArtıkların sistematik örüntü göstermesi model sorununa işaret edebilir.
- Eğrilik: doğrusal model yetersiz olabilir.
- Yayılımın değişmesi: değişen varyans olabilir.
- Zaman boyunca düzenlilik: otokorelasyon olabilir.
Aykırı gözlem ile etkili gözlem aynı değildir. Kaldıraç ve Cook uzaklığı, regresyon katsayılarını güçlü biçimde etkileyen gözlemleri incelemeye yardım eder.
Çoklu regresyon
Y = β₀ + β₁X₁ + ... + βₖXₖ + εBir katsayı, diğer açıklayıcı değişkenler modelde sabit tutulduğunda ilgili değişkenle bağlantılı koşullu doğrusal değişimi ifade eder.
Açıklayıcı değişkenler arasındaki güçlü doğrusal ilişki çoklu doğrusal bağlantı oluşturabilir. Varyans şişirme faktörü bu yapıyı inceleyen tanı ölçülerindendir; tek başına otomatik değişken eleme kuralı değildir.
Hipotez sınaması
Boş hipotez H₀, test edilen temel varsayımı; alternatif hipotez H₁, karşı seçeneği gösterir.
p-değeri, H₀ ve kullanılan model doğru kabul edildiğinde gözlenen test istatistiği kadar veya daha uç bir sonucun elde edilme olasılığıdır.
p-değeri:
P(H₀ | veri)değildir.
Küçük p-değeri etkinin büyük, önemli veya nedensel olduğunu göstermez. Büyük p-değeri de eşitliği kanıtlamaz.
Etki büyüklüğü
İstatistiksel anlamlılık ile etkinin büyüklüğü ayrıdır.
İki grup için standartlaştırılmış ortalama farkının temel biçimi:
d = (x̄₁ − x̄₂) / s_pooledHam fark, etki büyüklüğü ve güven aralığı birlikte daha anlamlıdır.
t-testi ve varyans analizi
İki bağımsız grubun ortalamaları için t-testi kullanılır. Varyans eşitliği güvenle varsayılamıyorsa Welch t-testi tercih edilebilir.
Üç veya daha fazla grubun ortalamaları için tek yönlü varyans analizi:
F = gruplar arası değişkenlik / grup içi değişkenlikAnlamlı F, bütün grup ortalamalarının eşit olduğu modelle uyuşmaz; hangi grupların farklı olduğunu tek başına göstermez.
Ki-kare bağımsızlık testi
İki kategorik değişken için beklenen hücre frekansı:
Eᵢⱼ = (satır toplamıᵢ · sütun toplamıⱼ) / genel toplamPearson ki-kare istatistiği:
χ² = Σ (Oᵢⱼ − Eᵢⱼ)² / Eᵢⱼİlişkinin gücü için Phi veya Cramér V kullanılabilir.
Tetrakorik korelasyon, yalnız ikili gözlemlerin altta yatan sürekli ve birlikte normal gizli değişkenlerin eşiklenmiş biçimi olarak modellenmesi anlamlıysa uygundur.
Çoklu sınama
Aynı veri üzerinde çok sayıda hipotez sınamak yanlış pozitif olasılığını artırır. Bonferroni aile düzeyi hata oranını, Benjamini-Hochberg yanlış keşif oranını denetlemek için kullanılan yöntemlerdendir.
Yeniden Örnekleme ve Benzetim
Analitik dağılımın bilinmediği veya kapalı form hesabın zor olduğu durumlarda verinin kendisinden yeniden örnekleme yapmak ya da rastgele benzetim kullanmak belirsizliği nicel olarak incelemeye yardımcı olur.
Bootstrap
Bootstrap, gözlenen n örnekten yerine koyarak tekrar n gözlem seçer ve ilgilenilen istatistiği her yeniden örnek üzerinde hesaplar.
orijinal örnek
↓ yerine koyarak örnekle
bootstrap örneği 1 -> θ1
bootstrap örneği 2 -> θ2
...
bootstrap örneği B -> θBθ dağılımı standart hata veya güven aralığı hakkında ampirik bilgi sağlar. Bootstrap veri üretim sürecindeki sistematik yanlılığı ortadan kaldırmaz; örneğin örnek temsil edici değilse yeniden örnekleme bu eksikliği çoğaltır.
Permütasyon testi
İki grup arasında fark olmadığı sıfır hipotezi altında grup etiketleri değiştirilebilir kabul ediliyorsa etiketler karıştırılarak test istatistiğinin null dağılımı oluşturulabilir.
Bu yaklaşım parametrik dağılım varsayımını azaltabilir; fakat exchangeability koşulu sağlanmıyorsa geçerli değildir.
Monte Carlo benzetimi
Bir çıktı birçok rastgele girdiye bağlıysa analitik dağılım yerine tekrar eden benzetim kullanılabilir:
girdileri dağılımlarından örnekle
↓
modeli çalıştır
↓
çıktıyı kaydet
↓
N kez tekrarlaSonuç dağılımı başarısızlık olasılığı, beklenen değer veya kuyruk davranışı gibi niceliklerin yaklaşık hesabında kullanılabilir.
Monte Carlo hatası örnek sayısıyla azalır; fakat model hatası örnek sayısı artırılarak giderilemez. Çok sayıda simülasyon yanlış modeli yalnız daha hassas biçimde simüle eder.
İstatistiksel güç
Bir testin anlamlı sonuç üretmemesi "etki yok" ile eş anlamlı değildir. Örnek sayısı, etki büyüklüğü, varyans ve seçilen anlamlılık düzeyi testin gerçek bir etkiyi saptama olasılığını belirler.
Çalışma tasarımında:
etki büyüklüğü
+ gürültü/varyans
+ örnek sayısı
+ alfa
-> güçilişkisi birlikte düşünülmelidir.
Yeniden örnekleme ve benzetim, klasik formüllerin yerine otomatik olarak geçmez. Ama varsayımların kırılgan olduğu veya türetilmiş istatistiğin dağılımının zor olduğu durumlarda belirsizliği görünür kılan güçlü doğrulama araçlarıdır.
Ünite 10: Stokastik Süreçler ve Markov Zincirleri
Rastgele değişkenden rastgele sürece
Tek bir rastgele değişken bir deneyin tek bir sayısal sonucunu modeller. Zaman, konum veya başka bir indis boyunca gelişen belirsiz davranışta ise tek değişken yeterli değildir. Stokastik süreç, aynı olgunun farklı indislerdeki rastgele değişkenlerinden oluşan bir ailedir.
X0, X1, X2, ...İndis zaman olduğunda Xt, sistemin t anındaki durumunu veya ölçümünü temsil edebilir. İndis ayrık ya da sürekli, durum uzayı da kesikli ya da sürekli olabilir. Bu iki ayrım birbirinden bağımsızdır.
Mühendislikte stokastik süreçler; kuyruk uzunluğu, arıza durumu, ağ yükü, kullanıcı oturumu, sensör ölçümü ve talep gibi zaman içinde belirsizlik taşıyan büyüklükleri modellemek için kullanılır.
Markov özelliği
Bir süreçte gelecek durumun koşullu dağılımı, geçmişin tamamı bilindiğinde yalnız mevcut duruma bağlı kabul ediliyorsa Markov özelliği kullanılır.
gelecek | bugün, geçmiş = gelecek | bugünBu eşitlik fiziksel dünyanın evrensel bir yasası değildir. Modelleme varsayımıdır. Gerçek sistemde geçmişin etkisi mevcut durumda yeterince temsil edilmiyorsa Markov modeli bilgi kaybeder. Böyle bir durumda durumu genişletmek veya daha zengin bir zaman modeli kullanmak gerekir.
Geçiş olasılıkları ve geçiş matrisi
Sonlu durumlu ayrık zamanlı Markov zincirinde bir durumdan diğerine geçiş olasılıkları bir matrisle gösterilebilir. Üç durumlu bir örnek:
sonraki durum
A B C
şimdiki A 0.80 0.15 0.05
B 0.20 0.60 0.20
C 0.10 0.25 0.65Her satır, mevcut durum sabitken sonraki durumların olasılık dağılımıdır ve toplamı 1 olmalıdır. Bu nedenle geçiş matrisi satır-stokastiktir.
Başlangıç durum dağılımı bir satır vektörüyle gösterildiğinde bir adım sonraki dağılım:
pi_next = pi_current * Pşeklinde bulunur. İki veya daha fazla adımlı geçişler aynı matrisin ardışık uygulanmasıyla elde edilir:
iki adım -> P * P
dört adım -> P * P * P * PBu gösterim tek bir geleceği kesin olarak tahmin etmez; olası durumların dağılımını taşır.
Durağan dağılım
Bir dağılım geçişten sonra değişmiyorsa durağan dağılımdır:
pi = pi * PDurağan dağılım uzun dönem davranışını özetlemek için yararlıdır; ancak her zincirin tek bir durağan dağılıma yakınsayacağı varsayılmamalıdır. Erişilebilirlik, indirgenebilirlik ve periyodiklik gibi yapısal özellikler yakınsama davranışını belirler.
Bir zincirde bütün durumların birbirine uygun sayıda adımla ulaşabilmesi indirgenemezlik fikrini, dönüşlerin tek bir ortak dönem tarafından zorlanmaması ise aperiyodiklik fikrini verir. Bu özellikler sonlu zincirlerde uzun dönem davranışını değerlendirirken önemlidir.
Soğurucu durumlar
Kendisine girildiğinde çıkış olasılığı sıfır olan durum soğurucu durum olarak ele alınabilir:
A -> A olasılığı = 1Arıza, tamamlanma, iptal veya geri dönülmeyen başka bir durum bu biçimde modellenebilir. İncelenen soru yalnız son durumun ne olduğu değil, o duruma ulaşma olasılığı ve beklenen geçiş sayısı da olabilir.
Modelleme sınırı
Markov zinciri gözlenen sıralı veriye geçiş yüzdeleri hesaplayıp isim vermekten ibaret değildir. Önce durumların neyi temsil ettiği, gözlemlerin hangi zaman çözünürlüğünde üretildiği ve süreçteki bağımlılığın mevcut durumla gerçekten temsil edilip edilemediği açıklanmalıdır.
Aynı veri farklı durum tanımlarıyla farklı zincirler üretir. Bu nedenle güvenli sıra şöyledir:
durum tanımı
→ gözlem ve zaman ölçeği
→ geçişlerin sayılması
→ geçiş olasılıklarının kestirimi
→ yapısal özelliklerin denetimi
→ uzun dönem veya soğurma analizi
→ alan bilgisiyle yorumMarkov modeli betimleyici veya kestirimsel bir araç olabilir; tek başına nedensellik kanıtı değildir.
Veri Analizinde Dağılım, Zaman ve Yoğunlaşma
Frekans ve ampirik dağılım
Kategori frekansı:
pᵢ = fᵢ / ΣfᵢAmpirik birikimli dağılım:
Fₙ(x) = (1/n)·ΣI(Xᵢ ≤ x)Histogram, dağılımın biçimini sınıf aralıklarıyla gösterir. Görünüm sınıf genişliğine bağlıdır.
Kümülatif pay ve yoğunlaşma
Kategori payı:
pᵢ = xᵢ / Σxⱼİlk k kategorinin kümülatif payı:
Cₖ = Σ(i=1..k) pᵢPareto yaklaşımı kümülatif yoğunlaşmayı görmeye yarar; 80/20 oranı evrensel yasa değildir.
Herfindahl-Hirschman endeksi:
HHI = Σpᵢ²Shannon entropisi:
H = −Σpᵢln(pᵢ)Etkin çeşitlilik:
Dₑ = eᴴGini katsayısı eşitsizliği ölçer. HHI, Gini ve entropi farklı özellikleri ölçer; birbirlerinin yerine kullanılmaz.
Zaman serisi özetleri
Mutlak değişim:
Δₜ = xₜ − xₜ₋₁Göreli değişim:
rₜ = (xₜ − xₜ₋₁) / xₜ₋₁Payda sıfırsa göreli değişim tanımsızdır.
Hareketli ortalama:
MAₜ = (1/m)·Σ(i=0..m−1)xₜ₋ᵢPencere büyüdükçe seri daha düzgün görünür ancak ani değişime tepki gecikir.
Ardışık farkların standart sapması kısa dönemli oynaklığın basit bir göstergesidir:
jitter = SD(xₜ − xₜ₋₁)Zaman indeksine göre doğrusal eğim:
xₜ = a + b·t + εₜb yönü ve doğrusal değişim hızını özetler; nedensellik göstermez.
Günlük, saatlik ve haftanın günlerine göre profiller takvim kaynaklı dönemsel yapıları ayırmaya yardım eder.
Tekil sapma, yerel düzey ve kalıcı değişim
Bir zaman serisinde tek bir yüksek değer, yakın dönemde yükselen genel düzey ve kalıcı bir rejim değişimi aynı problem değildir. Bunları tek bir "anomali puanı" altında toplamak yorum kolaylığı sağlıyor gibi görünse de hangi davranışın ölçüldüğünü belirsizleştirir.
Aykırı değerlere dayanıklı bir başlangıç için merkez medyanla, yayılım ise medyan mutlak sapmayla ölçülebilir:
m = median(x)
MAD = median(|x_i - m|)Normal dağılımla karşılaştırılabilir bir ölçek gerektiğinde robust standart sapma yaklaşık olarak:
sigma_r = MAD / 0.6745ve tek bir gözlemin robust sapması:
z_r = (x_t - m) / sigma_rbiçiminde yazılabilir. Bu ölçü özellikle birkaç uç gözlemin ortalama ve standart sapmayı sürüklediği serilerde yararlıdır. Ancak MAD = 0 olması mümkündür. Bu durumda formül körlemesine uygulanmamalı; veri yapısına göre daha uzun geçmiş, alternatif yayılım ölçüsü veya açıkça belirtilmiş bir geri dönüş (geri dönüş (fallback)) yöntemi kullanılmalıdır.
Yakın dönem düzeyini izlemek için üstel ağırlıklı hareketli ortalama (EWMA), en yeni gözleme daha yüksek, eski gözlemlere geometrik olarak azalan ağırlık verir:
E_t = lambda * x_t + (1 - lambda) * E_(t-1)
0 < lambda <= 1lambda büyüdükçe seri yeni gözleme daha hızlı tepki verir; küçüldükçe daha fazla yumuşar. Örneğin lambda = 0.30, son gözlemi önemli tutarken geçmişi tamamen silmeyen bir yerel baseline üretir. EWMA bir tahmin modeli olmak zorunda değildir; yalnızca serinin yakın dönem seviyesini görünür kılmak için de kullanılabilir. Geometrik hareketli ortalama kontrol yaklaşımının klasik kaynaklarından biri S. W. Roberts'ın 1959 tarihli çalışmasıdır: https://doi.org/10.1080/00401706.1959.10489860
Tek tek büyük sıçramalardan çok küçük fakat sürekli kaymaları ararken CUSUM farklı bir soru sorar. Robust merkez ve ölçekle standartlaştırılmış değer:
z_t = (x_t - m) / sigma_rolsun. İki yönlü birikim:
S+_t = max(0, S+_(t-1) + z_t - k)
S-_t = min(0, S-_(t-1) + z_t + k)biçiminde izlenebilir. k, önemsiz küçük dalgalanmaların ne kadarının tolere edileceğini; h ise sinyal eşiğini belirler. Böylece tek bir uç değer kısa süre sonra unutulabilirken aynı yönde art arda gelen orta büyüklükte sapmalar birikerek görünür hale gelir. CUSUM'un klasik başlangıç noktası E. S. Page'in 1954 tarihli Continuous Inspection Schemes çalışmasıdır: https://doi.org/10.1093/biomet/41.1-2.100
Bu yöntemlerin cevapladığı sorular ayrıdır:
Robust MAD -> Son gözlem tipik dağılımdan ne kadar uzak?
EWMA -> Yakın dönem düzeyi nereye yerleşti?
CUSUM -> Küçük sapmalar aynı yönde birikiyor mu?
Regresyon -> Uzun dönem doğrusal yön ne kadar belirgin?Bir sistemde aynı anda dört sonucun da tutulması tek bir birleşik skordan daha açıklanabilirdir. Örneğin son değer robust olarak olağandışı olmayabilir; buna rağmen EWMA yükselmiş ve CUSUM kalıcı artış sinyali üretmiş olabilir. Tersine tek günlük büyük bir sıçrama robust sapma üretirken CUSUM kısa sürede başlangıç düzeyine dönebilir.
Zaman ekseninin kurulması da sonuç kadar önemlidir. İncelenen tarih aralığı biliniyorsa hiç olay gerçekleşmeyen günleri veri kümesinden tamamen çıkarmak yerine 0 gözlem olarak seriye katmak çoğu operasyonel sayım probleminde daha doğrudur. Yalnız aktif günlerden hesaplanan baseline, sessiz dönemleri görünmez hale getirerek tipik düzeyi yapay biçimde yükseltebilir. Buna karşılık sistemin gerçekten veri üretmediği, eksik aktarılan veya kapsam dışında kalan günler 0 sayılmamalıdır; sıfır gözlem ile eksik gözlem aynı şey değildir.
Dönem paylarının doğru hesaplanması
Günlük yüzdelerin basit ortalaması, gün toplamları farklıysa dönem payını vermez.
Doğru dönem payı:
P = Σ(kategori değeri) / Σ(genel toplam)Oranlar, ham paydaları dikkate alınmadan toplanamaz veya doğrudan ortalanamaz.
Veri kalitesi ve payda
Ayrı tutulması gereken üç sayı:
fiziksel kayıt sayısı
mantıksal gözlem sayısı
analize uygun gözlem sayısıAynı olayı temsil eden yinelenen fiziksel kayıtları doğrudan saymak paydayı büyütebilir. Gerçekten ayrı olayları yanlış tekilleştirmek ise bilgi kaybettirir.
0, eksik değer, kayıt yokluğu ve yayımlanmamış veri aynı şey değildir. Eksik bir zaman noktasını sıfır kabul etmek yapay düşüş ve yükseliş üretebilir.
Betimleme, anomali ve kanıt
Betimleyici istatistik eldeki veriyi özetler. Keşifsel analiz örüntüleri görünür kılar. Anomali puanı incelemeye değer gözlemleri sıralar. Hiçbiri tek başına nedensellik veya kanıt oluşturmaz.
Sağlam sıra:
gözlem tanımı
→ veri kalitesi
→ doğru payda
→ betimsel özet
→ dağılım ve zaman örüntüsü
→ ilişki veya anomali göstergesi
→ varsayım denetimi
→ alan bilgisi
→ gerekiyorsa çıkarımEtki büyüklüğü, çoklu test ve yeniden üretilebilirlik
İstatistiksel anlamlılık ile pratik önem aynı değildir. Çok büyük örneklemde küçük ve önemsiz bir etki düşük p-değeri üretebilir. Sonuç raporunda etki büyüklüğü ve güven aralığı, yalnız hipotez testi kararından daha fazla bilgi verir.
Aynı veri üzerinde çok sayıda hipotez denenirse yanlış pozitif olasılığı büyür. Bonferroni gibi aile-düzeyi düzeltmeler veya false discovery rate yaklaşımı, probleme göre çoklu test riskini kontrol etmek için kullanılabilir.
Analiz planının veri görüldükten sonra sürekli değiştirilmesi sonuçları iyimserleştirebilir. Değişken tanımı, dışlama kriteri ve ana hipotezin önceden belirlenmesi; mümkün olduğunda bağımsız doğrulama verisi kullanılması yeniden üretilebilirliği güçlendirir.
İstatistiksel sonucu bağlamıyla raporlamak
Bir p-değeri, etkinin büyüklüğünü veya pratik önemini söylemez. Etki büyüklüğü, güven aralığı, örneklem büyüklüğü ve kullanılan varsayımlar birlikte raporlandığında sonuç daha yorumlanabilir hâle gelir.
Model varsayımları artık grafiklerinden ve tanı testlerinden kontrol edilmelidir. Regresyonda doğrusal ilişki, bağımsızlık, varyans yapısı ve etkili gözlemler; kullanılan modele göre ayrı ayrı incelenir. Varsayım ihlali otomatik olarak modeli geçersiz kılmaz, fakat yorum sınırını değiştirir.
Çoklu hipotez testinde yanlış pozitif riski artar. Hangi düzeltmenin kullanılacağı araştırma amacına bağlıdır; düzeltme seçimi sonuç görüldükten sonra değil analiz planının parçası olarak belirlenmelidir.
Ünite 11: İstatistikten İstatistiksel Öğrenmeye
Çıkarımdan tahmine
Örnekleme, olasılık dağılımları, Bayes teoremi ve regresyon yalnız klasik istatistiksel çıkarımın değil, istatistiksel makine öğrenmesinin de temelidir. Ayrım kullanılan matematikten çok sorunun ağırlık merkezindedir. Çıkarımsal istatistik bir parametre veya etki hakkındaki belirsizliği açıklamaya çalışırken, istatistiksel öğrenme çoğu zaman görülmemiş gözlem için tahmin hatasını azaltmayı hedefler.
örneklem
↓
olasılıksal / geometrik model
↓
parametre veya karar fonksiyonu
↓
görülmemiş veri
↓
tahmin + belirsizlik / hata ölçümüBir tahmin modelinin yüksek başarısı nedensellik göstermez; bir katsayının istatistiksel olarak anlamlı olması da modelin yeni veride en iyi tahmini vereceğini garanti etmez.
Olabilirlik ve parametre kestirimi
Gözlenen veri z_1,...,z_n ve parametre θ için olabilirlik:
L(θ) = Π p(z_i | θ)şeklinde yazılabilir. En çok olabilirlik kestirimi (MLE), bu ifadeyi en büyük yapan parametreyi seçer. Hesaplamada çarpım yerine çoğunlukla log-olabilirlik kullanılır:
log L(θ) = Σ log p(z_i | θ)Bayesçi yaklaşımda parametreye ilişkin önsel dağılım da modele girer. Maksimum sonsal kestirim (MAP):
θ_MAP = argmax p(data | θ) p(θ)biçiminde düşünülebilir. Böylece Bayes teoremi yalnız olay olasılığı hesabı değil, model parametrelerinin kestirimi için de doğrudan kullanılır.
Kayıp fonksiyonu
Tahmin ile hedef arasındaki fark bir kayıp fonksiyonuyla ölçülür. Regresyonda karesel veya mutlak hata, sınıflandırmada log-loss/cross-entropy gibi ölçüler kullanılabilir. Farklı kayıp fonksiyonları aynı veri üzerinde farklı “en iyi” modeli tanımlayabilir.
İş maliyeti matematiksel kayıptan farklı olabilir. Yanlış negatifin çok pahalı olduğu bir sağlık/güvenlik probleminde en yüksek doğruluğu veren eşik en iyi karar eşiği olmayabilir.
Düzenlileştirme ve genelleme
Örnek üzerindeki hatayı küçültmek modelin anakütlede de iyi davranacağını garanti etmez. Çok esnek model örnek gürültüsünü öğrenebilir. Düzenlileştirme model katsayılarını veya kapasitesini sınırlandırarak bu riski azaltmaya çalışır.
Ridge ve Lasso gibi cezalı regresyonlar, bu fikrin doğrusal model üzerindeki açık örnekleridir. Aynı genelleme sorunu karar ağacında derinlik, k-NN'de k, SVM'de C/γ, K-Means'te başlangıç ve küme sayısı gibi farklı hiperparametrelerle görünür.
Eğitim, doğrulama ve test
Model geliştirmede verinin rollerini ayırmak gerekir:
- eğitim kümesi parametreleri öğrenir,
- doğrulama kümesi model ve hiperparametre seçimini destekler,
- test kümesi seçim bittikten sonra genelleme başarısını ölçer.
Çapraz doğrulama küçük/orta veri kümelerinde değerlendirme verimliliğini artırır. Ancak ölçekleme, özellik seçimi veya eksik veri tamamlama gibi adımlar bütün veri üzerinde önceden uygulanırsa test bilgisi eğitim sürecine sızabilir.
İstatistiksel öğrenme yöntemleri
Bu temelin üzerinde farklı varsayımlar kullanan yöntem aileleri bulunur:
- olasılık tabanlı: Naive Bayes, Gaussian mixture, Bayes ağları ve HMM,
- uzaklık tabanlı: k-En Yakın Komşu,
- marj tabanlı: Support Vector Machine,
- bölme tabanlı: karar ağaçları ve topluluk yöntemleri,
- kümeleme: K-Means, K-Medoids, DBSCAN ve bulanık C-Ortalamalar,
- boyut indirgeme: PCA, SVD ve LDA,
- dizisel istatistik: n-gram dil modelleri.
Bu yöntemlerin matematiği, değerlendirmesi ve uygulama sınırları İstatistiksel Öğrenme ve Makine Öğrenmesi ders notunda devam eder.
Kalibrasyon, belirsizlik ve karar eşiği
Sınıflandırıcının ürettiği skor ile gerçek olasılık aynı kavram değildir. Eğer p̂=0.8 verilen örneklerin yaklaşık yüzde 80'i gerçekten pozitif çıkıyorsa model o bölgede kalibre kabul edilebilir. Doğruluk yüksek olsa bile olasılık tahminleri kötü kalibre olabilir. Bu ayrım, skorun insan kararına veya maliyet hesabına girdiği sistemlerde önemlidir.
Karar eşiği de modelden bağımsız bir iş kararıdır:
skor → eşik → kararEşik değiştiğinde yanlış pozitif ve yanlış negatif dengesi değişir; model parametreleri aynı kalabilir. Bu nedenle eşik, doğrulama verisi ve gerçek hata maliyeti üzerinden seçilmelidir.
Dağılım değişimi ve örnekleme sınırı
İstatistiksel öğrenmenin varsayımı çoğu zaman eğitim ve gelecek verisinin yeterince benzer dağılımdan gelmesidir. Üretimde popülasyon, ölçüm cihazı, kullanıcı davranışı veya veri toplama süreci değiştiğinde bu bağ zayıflar. Modelin eğitildiği örneklem artık hedef popülasyonu temsil etmeyebilir.
Bu durum klasik örnekleme bilgisini yeniden merkezi hale getirir. Büyük veri kümesi tek başına temsil güvencesi değildir; yanlış mekanizmayla toplanmış milyonlarca kayıt da yanlı örnek olabilir.
İstatistik ile öğrenme arasındaki süreklilik
Regresyon, likelihood, regularization ve Bayesçi kestirim hem istatistikte hem makine öğrenmesinde kullanılır. Keskin bir sınır çizmek yerine sorunun ağırlık merkezini belirlemek daha doğrudur:
parametre / etki belirsizliği ← istatistik → tahmin / genellemeGüvenilir uygulamada iki taraf birlikte kullanılır: model yalnız iyi tahmin etmeli değil, değerlendirme örneklemi ve belirsizlik yorumu da savunulabilir olmalıdır.
Hangi istatistik hangi soruya cevap verir?
Bir veri kümesini özetlemek ile anakütle hakkında çıkarım yapmak aynı işlem değildir. Ortalama, medyan, varyans ve çeyrekler eldeki gözlemleri betimler. Güven aralığı, hipotez testi ve regresyon ise örnekten daha geniş bir yapı hakkında belirsizlik altında sonuç üretir. Bu ayrım kurulmadan seçilen formül doğru olsa bile yorum yanlış olabilir.
Koşullu olasılık yönlüdür:
P(A|B) = P(A ∩ B) / P(B)P(A|B) ile P(B|A) genellikle aynı değildir. Bayes kuralı bu yön değişimini önceki olasılık ve olabilirlik üzerinden yapar. Özellikle düşük taban oranlı olaylarda yalnız testin doğruluğuna bakmak yeterli değildir; olayın başlangıçtaki görülme sıklığı son olasılığı belirgin biçimde etkiler.
Beklenen değer uzun dönemli ağırlıklı ortalamadır; varyans ise sonuçların bu merkezin çevresinde ne kadar yayıldığını ölçer. İki dağılım aynı ortalamaya sahip olup çok farklı risk profilleri gösterebilir. Standart sapmanın değişkenle aynı birimde olması yorumlamayı kolaylaştırır. Çarpık veya aykırı değer içeren örneklerde medyan ve çeyrekler arası açıklık, ortalama ve standart sapmadan daha sağlam olabilir.
Bir güven aralığı ile tek bir gelecek gözlem için tahmin aralığı da ayrılmalıdır. Güven aralığı parametrenin belirsizliğini, tahmin aralığı ise buna ek olarak yeni gözlemin doğal değişkenliğini taşır; bu yüzden tahmin aralığı genellikle daha geniştir.
Korelasyon doğrusal ilişkinin yönü ve gücü hakkında bilgi verir, nedensellik kanıtlamaz. Benzer biçimde küçük bir p değeri etkinin büyük veya pratik olarak önemli olduğunu söylemez. İstatistiksel sonuç; örnekleme biçimi, etki büyüklüğü, belirsizlik ve problem bağlamıyla birlikte okunmalıdır.
Kaynakça
- Christopher M. Bishop. Pattern Recognition and Machine Learning. Springer, 2006.
- Douglas C. Montgomery, George C. Runger. Applied Statistics and Probability for Engineers, 7th Edition. Wiley, 2018.
- George Casella, R. L. B. Statistical Inference, 2nd Edition. Duxbury, 2002.
- Kevin P. Murphy. Probabilistic Machine Learning: An Introduction. MIT Press, 2022.
- Morris H. DeGroot, Mark J. Schervish. Probability and Statistics, 4th Edition. Pearson, 2012.
- NIST/SEMATECH. e-Handbook of Statistical Methods. National Institute of Standards and Technology.
- Sheldon M. Ross. A First Course in Probability, 10th Edition. Pearson, 2018.
- William G. Cochran. Sampling Techniques, 3rd Edition. Wiley, 1977.