Slack #alerts kanalı spam gibiydi. CPU %70 üstü? Alert. Bir queue retry? Alert. Deploy bitti? Alert. Disk gerçekten dolunca kimse fark etmedi — son 50 mesaj "bilgilendirme"ydi.

Bir gün error rate gerçekten sıçradı ve 20 dakika kimse tepki vermedi. İlgisizlik değil — alert fatigue. Ekip kanalı ignore etmeyi öğrenmişti.

Oturduk ve basit kural koyduk: alert actionable olmalı — saat 03:00'te biri kalkıp belirli bir şey yapmalı. Cevap "bekle kendiliğinden düzelir" ise alert değildir.

Bilgilendirme sinyallerini Slack'ten dashboard'a taşıdık. Deploy başarısı, CPU %65, deploy sonrası pod restart — Grafana'ya. Slack sadece acil aksiyon gerektirenler için.

Severity ekledik: P1 (kullanıcı etkilendi), P2 (degraded), P3 (bu hafta bak). P1 on-call'u arar, P3 ticket açar.

Threshold'ları gerçek baseline'a göre ayarladık — dokümantasyondaki sihirli sayılara değil. Önce bir hafta metric topladık, sonra alert koyduk.

Küçük ekipte bile on-call rotation kurduk. Haftalık bir kişi P1/P2 sahibi. Herkesin gece telefon korkusu azaldı.

Alert kalitesi miktardan önemli. Temizlik sonrası alert hacmi ~%85 azaldı — ama gerçek incident'ler daha hızlı yakalanıyor. Kanal sessizken yeni mesaj gerçekten görülür.