smaple.tr
kaos muhendisligi

Kaos Muhendisligi ve Dayaniklilik Testi Rehberi [2026]

Mehmet Kurtipek
December 26, 2025
11 min read
kaos muhendisligi
chaos engineering
dayaniklilik testi
resilience
Litmus
Chaos Mesh

Kaos Muhendisligi Nedir?

Kaos muhendisligi, uretim ortamindaki dagitik sistemlerin turbulanslara dayanma kapasitesini test etmek amaciyla kontrollü deneyler tasarlama disiplinidir. Geleneksel testlerin aksine, kaos muhendisligi "sistemi kirmak" yerine "sistemin nasil kirildigini anlamak" uzerine odaklanir.

Temel felsefe basittir: eger bir sorun eninde sonunda yasanacaksa, bunu kontrollü bir ortamda ve hazirlikli oldugunuz bir zamanda yasamaniz, gece 3'te musteteri sikayet telefonlariyla ogrenmekten cok daha iyidir. Bu yaklasim, reaktif sorun gidermeden proaktif dayaniklilik insasina gecisi temsil eder.

Netflix'in 2010 yilinda AWS'ye gecisi sirasinda ortaya cikan bu disiplin, bugun her olcekteki organizasyon icin vazgecilmez hale gelmistir. Mikroservis mimarileri, dagitik veritabanlari ve bulut-yerel altyapilar yayginlastikca, tek bir bilesendeki ariza tum sistemi etkileyebilir. Kaos muhendisligi, bu zayif halkalari uretimde sorun yaratmadan once tespit etmenizi saglar.

Kaos Muhendisliginin Temel Prensipleri

Netflix ekibinin yayinladigi "Principles of Chaos Engineering" manifesto, disiplinin temel taslarini olusturur. Bu prensipler, kaos deneylerinin bilimsel bir yontemle yurutulmesini garanti eder.

Steady-State Davranisini Tanimlayin

Her deneyin baslangic noktasi, sistemin "normal" davranisini olculebilir metriklerle tanimlamaktir. Bu metrikler is odakli olmalidir: saniye basina islem sayisi, hata orani, ortalama yanit suresi veya basarili siparis tamamlama yuzdesi gibi degerler, steady-state hipotezinizi olusturur.

Gercek Dunya Olaylarini Modelleyin

Kaos deneyleri teorik senaryolar degil, gercekte yasanmis veya yasanmasi muhtemel olaylari simule etmelidir. Sunucu cokmeleri, ag baglanti kesintileri, disk doluluklari, DNS cozumleme hatalari ve ucuncu parti servis yavaslamalari en yaygin deney turleridir.

Deneyleri Uretimd Calistirin

Gercek dayaniklilik, yalnizca uretim ortaminda test edilebilir. Staging ortamlari trafik kaliplari, veri hacimleri ve altyapi konfigurasyonlari acisindan uretimi tam olarak yansitamaz. Elbette bu, kontrol mekanizmalari olmadan yapilmamalidir.

Otomasyonla Surekli Calistirin

Tek seferlik deneyler sinirli deger sunar. Kaos deneyleri CI/CD pipeline'larina entegre edilerek surekli calistirilmali ve regresyonlar erken tespit edilmelidir.

Netflix'ten Dersler: Chaos Monkey ve Simian Army

Netflix'in kaos muhendisligine yaptigi katkilar, tum sektorun seyrini degistirmistir. 2011 yilinda acik kaynaga donusturulen Chaos Monkey, rastgele uretim sunucularini kapatarak muhendislerin hataya dayanikli sistemler tasarlamasini zorunlu kilmistir.

Chaos Monkey'in basarisi, Netflix ekibini daha kapsamli araclar gelistirmeye yonlendirmistir. Simian Army adini verdikleri arac ailesi, farkli ariza turlerini simule eden ozellestirilmis bilesenleri icerir:

  • Chaos Monkey: Rastgele instance'lari sonlandirir
  • Latency Monkey: Yapay gecikme enjekte eder
  • Conformity Monkey: Best practice'lere uymayan instance'lari tespit eder
  • Chaos Gorilla: Tum bir availability zone'u devre disi birakir
  • Chaos Kong: Bolgesel failover'i test etmek icin tum bir region'i simule eder

Netflix'in bu yaklasimdan cikardigi en onemli ders, kaos muhendisliginin yalnizca teknik bir pratik degil, kulturel bir donusum oldugudur. Muhendisler ariza beklemeye ve sistemlerini buna gore tasarlamaya basladiginda, tum yazilim gelistirme sureci daha saglam hale gelir.

Kaos Muhendisligi Araclari

Gunumuzde farkli ihtiyaclara yonelik birden fazla olgun kaos muhendisligi araci bulunmaktadir. Arac secimi, altyapi ortaminiza, ekip yetkinliklerinize ve deney gereksinimlerinize baglidir.

Arac Platform Lisans Ozellik
Litmus Kubernetes Apache 2.0 CNCF projesi, genis deney katalogu
Chaos Mesh Kubernetes Apache 2.0 CNCF projesi, zaman tabanlari deneyler
Gremlin Multi-platform Ticari Kullanimi kolay UI, kapsamli raporlama
AWS FIS AWS Ticari Yerel AWS entegrasyonu, IAM tabanli erisim
Steady State Multi-platform Acik kaynak Python tabanli, deklaratif deneyler
Pumba Docker MIT Container seviyesinde ag kaos testi
Toxiproxy Multi-platform MIT Ag proxy tabanli hata enjeksiyonu

Litmus Chaos

Litmus, Kubernetes ortamlari icin CNCF tarafindan barindirilan bir kaos muhendisligi platformudur. ChaosHub araciligiyla yuzlerce hazir deney sablonu sunar. Kubernetes CRD'leri (Custom Resource Definition) uzerinden deklaratif kaos deneyleri tanimlanir ve GitOps akisina dogal olarak entegre olur.

Chaos Mesh

Chaos Mesh, Kubernetes icin bir diger CNCF kaos muhendisligi projesidir. Ozellikle zaman tabanli kaos deneyleri, IO hata enjeksiyonu ve JVM seviyesinde kaos yetenekleri ile one cikar. Dashboard uzerinden gorsel deney tasarimi ve izleme imkani sunar.

Gremlin

Gremlin, ticari bir kaos muhendisligi platformu olarak hem bulut hem de on-premise ortamlari destekler. Ozellikle teknik bilgisi sinirli ekipler icin kullanici dostu arayuzu ve rehberli deney sihirbazlari ile tercih edilir. Ayrica kapsamli raporlama ve uyumluluk ozellikleri sunar.

AWS Fault Injection Simulator (FIS)

AWS FIS, Amazon'un yerel kaos muhendisligi hizmetidir. EC2, ECS, EKS, RDS ve diger AWS hizmetleriyle dogrudan entegre calisir. IAM politikalari uzerinden ince taneli erisim kontrolu saglar ve deney sonuclarini CloudWatch metrikleriyle iliskilendirir.

Game Day Planlama ve Chaos Experiments Tasarlama

Game day, ekiplerin kontrollü bir ortamda kaos deneyleri yuruttukleri planli etkinliklerdir. Basarili bir game day, dikkatli planlama, net roller ve belgelendirilmis sonuclar gerektirir.

Game Day Oncesi Hazirlik

Bir game day planlarken asagidaki adimlari takip edin:

  1. Hedef belirleme: Hangi sistemi veya hizmeti test edeceksiniz?
  2. Hipotez olusturma: "X ariza senaryosunda sistem Y davranisini gostermeye devam edecektir"
  3. Metrik tanimlama: Steady-state'i hangi metriklerle olceceksiniz?
  4. Blast radius belirleme: Deneyin etki alanini sinirlayin
  5. Rollback plani: Deney kontrolden cikarsa nasil geri doneceksiniz?
  6. Iletisim plani: Kimleri bilgilendirmeniz gerekiyor?

Deney Tasarim Sablonu

Her kaos deneyini sistematik bir sekilde belgelemek, tekrarlanabilirlik ve ogrenme transferi icin kritiktir:

  • Deney adi: Tanimlayici ve benzersiz bir isim
  • Hedef sistem: Etkilenen servis veya bilesenler
  • Steady-state hipotezi: Normal calisma metrikleri
  • Bagimsiz degisken: Enjekte edilecek ariza turu
  • Blast radius: Etkilenecek kaynak sayisi ve kapsamsi
  • Durdurma kosullari: Deneyin otomatik sonlandirilacagi esik degerler
  • Beklenen sonuc: Sistemin nasil tepki vermesi gerekiyor
  • Gercek sonuc: Gozlemlenen davranis
  • Aksiyonlar: Tespit edilen iyilestirme alanlari

Blast Radius Kontrolu ve Steady-State Hipotezi

Kaos muhendisliginde en kritik guvenlik mekanizmasi blast radius kontroludur. Deneyler, etki alanini sinirli tutacak sekilde tasarlanmali ve kademeli olarak genisletilmelidir.

Blast Radius Yonetimi

Blast radius kontrolu icin katmanli bir yaklasim benimseyin:

Seviye Kapsam Ornek
1 Tek instance Bir pod'u sonlandirma
2 Servis Bir mikrosservisi yavaslama
3 Availability Zone Bir AZ'yi devre disi birakma
4 Region Bolgesel failover testi
5 Global Multi-region ariza senaryosu

Her deney en dusuk seviyeden baslamali ve ancak alt seviyeler basariyla tamamlandiktan sonra bir ust seviyeye gecilmelidir. Ayrica her deney icin otomatik durdurma mekanizmalari (kill switch) tanimlanmalidir.

Steady-State Hipotezi Olusturma

Steady-state hipotezi, sisteminizin normal calisma durumunu olculebilir terimlerle ifade eder. Iyi bir hipotez is metrikleri uzerine kurulu olmalidir:

  • Siparis tamamlama orani > %99.5
  • API yanit suresi p99 < 500ms
  • Hata orani < %0.1
  • Kullanici oturum acma basari orani > %99.9

Bu metrikler, deney sirasinda surekli izlenir. Herhangi bir metrik belirlenen esigin altina dustugunde deney otomatik olarak durdurulur.

Resilience Patterns: Dayaniklilik Tasarim Desenleri

Kaos muhendisligi deneyleri, cogu zaman eksik veya hatali uygulanmis dayaniklilik desenlerini ortaya cikarir. Bu desenlerin dogru uygulanmasi, sistemin ariza toleransini dogrudan etkiler.

Circuit Breaker (Devre Kesici)

Circuit breaker deseni, basarisiz olan bir dissal bagimliliga yapilan cagrilari gecici olarak keserek kaskad ariza yayilimini onler. Uc durumda calisir:

  • Kapali: Normal islem akisi, hatalar sayilir
  • Acik: Tum cagrilar engellenir, fallback yanit donulur
  • Yari-acik: Sinirli sayida deneme cagrisina izin verilir

Bulkhead (Bolumleme)

Bulkhead deseni, gemi gomlegindeki su gecirmez bolumlerden esinlenmistir. Farkli is yukleri icin ayri kaynak havuzlari olusturarak, bir bilesenteki kaynak tukenmesinin diger bilesenleri etkilemesini onler. Thread pool izolasyonu ve connection pool ayirimi en yaygin uygulamalaridir.

Retry with Backoff (Geri Cekilmeli Yeniden Deneme)

Gecici hatalar icin yeniden deneme mekanizmasi hayati onem tasir. Ancak sabit araliklarla yeniden deneme, zaten yogun olan bir servise ek yuk bindirir. Exponential backoff ve jitter kullanarak yeniden denemeleri zamana yaymak, toparlanma sansini arttirir.

Timeout (Zaman Asimi)

Her dis bagimlilik cagrisi icin uygun zaman asimi degerleri tanimlanmalidir. Zaman asimi olmayan cagrilar, kaynak sizintisina ve baglanti havuzu tukenmesine yol acar. Zaman asimi degerleri, hedef servisin p99 yanit suresinin uzerinde ancak makul bir sinirda olmalidir.

Fallback (Yedek Yanit)

Birincil yol basarisiz oldugunda devreye giren alternatif yanit mekanizmalaridir. Onbellekten sunum, varsayilan deger donme veya indirgenimis islevsellikle devam etme gibi stratejiler uygulanabilir.

Kubernetes Ortaminda Chaos Testing

Kubernetes, konteyner orkestrasyon platformu olarak kaos muhendisligi icin dogal bir zemin saglar. Pod'larin gecici yapisi, servis kesfi mekanizmalari ve bildirimsel konfigurasyonu, kaos deneylerini hem kolaylastirir hem de zorunlu kilar.

Pod Seviyesinde Deneyler

Kubernetes ortaminda en temel kaos deneyleri pod seviyesinde gerceklestirilir:

  • Pod silme: Rastgele pod'lari sonlandirarak ReplicaSet'in toparlanma hizini olcme
  • Container kill: Pod icindeki belirli bir konteyner'i durdurma
  • Kaynak daraltma: CPU veya bellek limitlerini gecici olarak dusurme
  • Liveness probe manipulasyonu: Saglik kontrollerinin basarisiz olmasini tetikleme

Ag Seviyesinde Deneyler

Mikroservis mimarisinde servisler arasi iletisim, en yaygin ariza noktasidir:

  • Ag gecikmesi: Servisler arasi yapay latency enjekte etme
  • Paket kaybi: Belirli orandaki ag paketlerini dusurme
  • DNS hatasi: Servis kesfi mekanizmasini bozma
  • Baglanti koparmasi: Belirli servisler arasi trafigi engelleme

Node Seviyesinde Deneyler

Altyapi seviyesindeki arizalari simule etmek icin node bazli deneyler yapilir:

  • Node drain: Bir node'u planli olarak bosaltma
  • Node kapatma: Bir worker node'u aniden devre disi birakma
  • Disk basinci: Node uzerinde disk doluluguklari olusturma

Gozlemlenebilirlik ve Kaos Muhendisligi Iliskisi

Kaos muhendisligi ve gozlemlenebilirlik, birbirini besleyen iki disiplindir. Etkili kaos deneyleri, kapsamli gozlemlenebilirlik altyapisi olmadan anlamli sonuclar uretamez. Ayni sekilde, gozlemlenebilirlik araclarinin etkinligi ancak gercekci ariza senaryolarinda test edilebilir.

Uc Sutun Entegrasyonu

Kaos deneyleri sirasinda gozlemlenebilirligin uc temel sutunu birlikte degerlendirilmelidir:

  • Metrikler: Sistem ve is metrikleri uzerinden steady-state sapmasini olcme
  • Loglar: Hata mesajlari ve olagan disi olaylari yakalama
  • Izler (Traces): Dagitik istek akisinda ariza noktasini tespit etme

Smart Maple olarak muterilerimize onerdigimiz yaklasim, kaos deneylerinden once gozlemlenebilirlik altyapisinin olgunlugunu degerlendirmek ve gerektiginde guclendirmektir. Gorunur olmayan bir sorunu teshis etmek mumkun degildir.

Alarm Dogrulamasi

Kaos deneylerinin siklilkla gozden kacirilan bir faydasi, mevcut alarm ve uyari mekanizmalarinin dogrulanmasidir. Bir deney sirasinda beklenen alarmlarin tetiklenip tetiklenmedigini, dogru ekibe yonlendirilip yonlendirilmedigini ve aksyon alinabilir bilgi icerip icermedigini test edin.

Organizasyonel Hazirlik ve Chaos Maturity Model

Kaos muhendisligi, yalnizca arac ve teknik bilgi gerektirmez; organizasyonel olgunluk da kritik bir faktordur. Ekiplerin kaos muhendisligini benimseme surecini degerlendirmek icin olgunluk modelleri kullanilir.

Kaos Olgunluk Seviyeleri

Seviye Tanim Ozellikler
0 - Baslangic Kaos muhendisligi uygulanmiyor Reaktif sorun giderme, ariza sonrasi analiz yok
1 - Temel Ad-hoc deneyler Manuel deneyler, sinirli kapsam, staging ortami
2 - Gelismis Planli game day'ler Duzeli deneyler, belgelendirilmis sonuclar, uretim deneyleri
3 - Olgun Otomatik ve surekli CI/CD entegrasyonu, otomatik deneyler, genis kapsam
4 - Ileri Kultur olarak benimsenmis Tum ekiplerde yaygin, tasarim asamasinda dayaniklilik

Kulturel Donusum

Kaos muhendisligini basariyla benimsemek icin organizasyonel engellerin asilmasi gerekir:

Yonetim destegi: Ust yonetimin kaos muhendisliginin degerini anlamasi ve desteklemesi kritiktir. Uretim ortaminda kontrollü arizalar olusturma fikri, ilk basta tedirginlik yaratabilir.

Suclamama kulturu: Deneyler sirasinda ortaya cikan zayifliklar, bireysel basarisizlik olarak degil, sistem iyilestirme firsati olarak degerlendirilmelidir. Blameless post-mortem kulturu, kaos muhendisliginin on kosullarindan biridir.

Kademeli benimseme: Kucuk ve dusuk riskli deneylerle baslayin. Ilk basarilari paylasarak diger ekiplerin katilimini tesvik edin. Zorunluluk yerine gonullu katilim, uzun vadede daha surdurulebilir sonuclar verir.

Egitim ve yetkinlik gelistirme: Ekiplerin kaos muhendisligi prensiplerini, araclarini ve guvenlik mekanizmalarini anlamasi icin yapilandirilmis egitim programlari olusturun.

Kaos Muhendisligi Uygulama Yol Haritasi

Kaos muhendisligini organizasyonunuza entegre etmek icin asama asama bir yaklasim benimseyin:

Hafta 1-2: Mevcut gozlemlenebilirlik altyapisini degerlendirin. Steady-state metriklerini tanimlayin. Kritik is akislarini ve bagimlilik haritasini cikartin.

Hafta 3-4: Arac secimi yapin ve staging ortaminda ilk deneyleri gerceklestirin. Ekip icerisinde kaos muhendisligi egitimi duzenleyin.

Ay 2: Ilk game day'i planlayin ve uygulayin. Blast radius'u sinirli tutarak uretim ortaminda basit deneyler baslatin. Sonuclari belgelein ve iyilestirme aksiyonlarini tanimlayin.

Ay 3-6: Deneyleri genisleterek daha karmasik senaryolari kapsayin. CI/CD pipeline'ina otomatik kaos testleri entegre edin. Diger ekiplere yayilim icin basari hikayelerini paylasin.

Ay 6+: Surekli ve otomatik kaos deneyleri ile olgunluk seviyesini artirin. Kaos muhendisligini yazilim gelistirme yasam dongusuunun dogal bir parcasi haline getirin.

Sonuc

Kaos muhendisligi, modern dagitik sistemlerin kacinilmaz arizalara karsi dayanikliligini proaktif olarak gelistiren stratejik bir disiplindir. Netflix'in onculuk ettigi bu yaklasim, bugun Litmus, Chaos Mesh, Gremlin ve AWS FIS gibi olgun araclarla her olcekteki organizasyon icin erisilebilir hale gelmistir.

Basarili bir kaos muhendisligi programi, dogru araclarin otesinde kulturel olgunluk, guclu gozlemlenebilirlik altyapisi ve sistematik deney tasarimi gerektirir. Circuit breaker, bulkhead ve retry gibi dayaniklilik desenleri ile desteklenen bu yaklasim, sistemlerinizi gercek dunya kosullarina hazirlr.

Smart Maple olarak, kaos muhendisligi ve dayaniklilik testi konusundaki deneyimimizle, organizasyonunuzun olgunluk seviyesine uygun bir yol haritasi olusturmaniza yardimci oluyoruz. Kontrollü deneylerle zayif halkalari tespit etmek, musteteri deneyimini olumsuz etkileyen surpriz arizalari onlemenin en etkili yoludur.

Related Articles

August 10, 2026

MLOps Rehberi: Makine Öğrenmesi Modellerini Production'a Taşıma

Giriş: MLOps Nedir ve Neden Önemlidir? Makine öğrenmesi modelleri geliştirmek günümüzde nispeten kolaydır. Açık kaynak kütüphaneleri kullanarak son derece başarılı modeller oluşturabiliriz. Ancak bu modelleri production ortamına taşıyarak, ölçeklendirebilir, güvenilir ve sürdürülebilir şekilde çalıştırmak tamamen farklı bir hikayedir. Araştırmalara göre, veri bilimcileri tarafından geliştirilen makine öğrenmesi modellerinin %87'si hiçbir zaman production ortamına ulaşmaz. Bu başarısızlı

Read More
August 9, 2026

LLM Fine-Tuning ve Özel Model Eğitimi Rehberi [2026]

LLM Fine-Tuning: Kurumsal Yapay Zeka Stratejisinin Temel Taşı Büyük dil modelleri (LLM), genel amaçlı metin üretimi ve anlama konusunda etkileyici performans sergiliyor. Ancak kurumsal ortamlarda belirli bir alan, terminoloji veya iş sürecine uyum sağlamaları gerektiğinde, genel bilgileri çoğu zaman yetersiz kalıyor. Bu noktada fine-tuning, yani ince ayar süreci devreye giriyor. Fine-tuning sayesinde mevcut bir temel modeli, kendi verileriniz ve ihtiyaçlarınız doğrultusunda özelleştirmek

Read More
August 8, 2026

Bilgisayarlı Görü Uygulamaları: Nesne Tespiti, OCR ve Endüstriyel AI

Bilgisayarlı Görü Uygulamaları: Endüstriyel ve Medikal AI'nin Temel Teknolojisi Bilgisayarlı görü, makine öğrenmesinin en etkili alanlarından biridir. Türkiye'de yaşanan dijital dönüşüm sürecinde, özellikle üretim, sağlık ve lojistik sektörlerinde görü tabanlı otomasyon kritik hale gelmiştir. Smart Maple olarak Ankara'da geliştirdiğimiz çözümler, son beş yılda 150+ kuruluşunun üretim verimliliğini ortalama %35 oranında artırmıştır. Bu rehberde, bilgisayarlı görü teknolojisinin iş değeri

Read More