PreSales Academy

Virtualization ve HCI

HCI Veri Yolu ve Failure Domain

Yaklaşık 56 dakika Kaynak izli editoryal içerik

HCI veri yolunu uçtan uca izle

Ön koşul: hypervisor/VM sınırları, network ve storage veri yolları, IOPS/throughput/latency, replication, erasure coding ve failure domain kavramlarını açıklayabilmelisin. Bu dersin sonunda HCI’yi tek kutu gibi değil compute, sanal network, dağıtık storage, metadata/control ve yönetim düzlemlerinin birleşimi olarak çizecek; bir guest write/read işlemini fiziksel medya ve kopyalara kadar izleyecek; veri yerleşimi ile gerçek host/rack/site topolojisini eşleştirecek; quorum, rebuild ve bakım durumlarını uygulama sonucu ile sınayabileceksin. Yaklaşık 30 dakika anlatı, 16 dakika uygulama ve 10 dakika kontrollerdir. Ürün sürümü, minimum node, ağ ve koruma limitleri güncel üretici belgesiyle doğrulanır.

Hyperconverged infrastructure compute, storage, network ve yönetim yeteneklerini ortak node’lar ve yazılım tanımlı bir kontrol katmanında birleştirir. Aynı fiziksel node VM çalıştırırken yerel diskleri dağıtık havuza sunabilir. Bu yakınlık kablolama ve operasyonu sadeleştirebilir; buna karşılık CPU, memory, NIC, switch, disk ve yazılım servisleri aynı hizmet yolunda daha sıkı bağlanır. “Üç node var, sistem yedekli” cümlesi bu bağımlılıkları kanıtlamaz. Bir guest write, uygulama ve guest filesystem’den sanal disk/controller’a, hypervisor veya storage istemcisine ve dağıtık veri servisine ulaşır. Politika veriyi replica veya erasure-code shard’larına ayırabilir; parçalar başka node’lara storage network üzerinden gönderilir. Acknowledgement’ın hangi noktada döndüğü, kaç kopya ya da shard’ın kalıcı hale geldiği ve cache’in güç kaybında davranışı durability sözleşmesidir. Yerel disk hızlı olsa bile uzak kopya, switch queue veya metadata kararı write latency’yi belirleyebilir. Read yolu veri yerelliği, cache ve placement’a göre yerel ya da uzak node’dan gelebilir. Cache hit, locality ve sıkıştırma sonucu workload’a bağlıdır; satış varsayımı olarak sabitlenmez. Bir VM başka hosta taşındığında compute ile verinin fiziksel yakınlığı değişebilir. HCI performansı bu nedenle yalnız disk modeliyle açıklanmaz; guest queue, vCPU scheduling, host memory, storage service CPU’su, NIC, fabric, medya ve arka plan işleri aynı zaman çizgisinde incelenir. Yönetim ekranı, metadata/control quorum ve veri yolu ayrı etkilere sahip olabilir. Yönetim arayüzü kaybolurken çalışan I/O sürebilir; cluster map veya quorum kaybı yeni placement ve write kabulünü etkileyebilir; bir disk kaybı ise veri hâlâ erişilebilirken rebuild trafiği başlatabilir. Her düzlemin detection, karar, veri ve recovery bağımlılığı açıkça yazılır.

Guest write işleminden kalıcı veriye HCI zinciri
AdımKanıtlanacak davranışÖlçü
GuestFlush ve queue semantiğiLatency, depth, timeout
Sanal katmanController ve storage istemcisiQueue/CPU wait
Yerel nodeCache, journal ve storage servisiCPU, memory, device latency
NetworkUzak kopya/shard trafiğiRTT, drop, queue, bandwidth
Dağıtık havuzPlacement ve kalıcılıkAck noktası, health, rebuild

ÖRNEK

Yerel NVMe, uzak write bekliyor

Arven node’unda NVMe latency düşük görünür; ERP write p99 yine yükselir. İnceleme, replica acknowledgement için ikinci node’a giden storage trafiğinin aynı uplinkte backup ile çakıştığını gösterir. Disk değiştirmek yerine guest, storage service, network ve uzak kopya zaman çizgisi karşılaştırılır; backup penceresi ayrıldığında hipotez doğrulanır.

MÜŞTERİYE SOR

Bir kritik write için guest’ten kalıcı kopya veya shard’lara kadar hangi servis, queue, NIC, switch ve medya geçiliyor; acknowledgement tam olarak hangi durability koşulunda dönüyor?

Tek disk metriğini uçtan uca veri yolu ve veri kaybı sözleşmesine dönüştürür.

BİLGİNİ KONTROL ET

HCI node’undaki yerel diskin düşük latency göstermesi neyi garanti eder?

Bir cevap seç

Veri yerleşimi ve koruma geometrisini çöz

Dağıtık storage mantıksal nesne veya blokları placement birimlerine eşler; bunları fiziksel cihaz, host, rack ya da site üzerinde politika ile dağıtır. Ceph CRUSH örneğinde fiziksel topoloji hiyerarşisi ve kurallar birlikte veri yerleşimini belirler; object önce placement group’a, ardından OSD’lere eşlenir. Her HCI ürünü aynı mekanizmayı kullanmaz, fakat karar sorusu aynıdır: veri parçaları hangi algoritma ve güncel cluster state ile hangi failure domain’lere konuyor? Replication birden çok tam kopya, erasure coding ise veri ve parity shard’ları kullanabilir. “İki kopya” veya “k+m” tek başına erişilebilirlik ve usable kapasite sonucu değildir. Placement’ın kaç bağımsız domain’e yayıldığı, write quorum/ack kuralı, izin verilen eşzamanlı kayıp, degraded halde yeni yazma ve yeniden koruma için gereken boşluk belirlenir. Snapshot ve backup bu korumanın eş anlamlısı değildir; aynı cluster hatası, kimlik veya silme olayı hepsini etkileyebilir. Topology etiketi fiziksel gerçekle uyuşmalıdır. Farklı host olarak kaydedilen node’lar aynı rack PDU, top-of-rack switch veya upstream yolu paylaşabilir. Rack etiketi yanlışsa yazılım kopyaları bağımsız sanarken ortak güç kaybı bütün parçaları götürebilir. Site ayrımı da latency, bandwidth, partition ve witness/quorum tasarımını değiştirir. Envanter etiketi ile kablo, güç ve fiziksel yerleşim sahada doğrulanır. Placement dengesi yalnız kapasite yüzdesi değildir. Device ağırlığı, pool politikası, hotspot, metadata, cache, VM locality ve arka plan rebalance davranışı sonuç üretir. Node veya disk eklendiğinde veri hareketi başlar; bu hareket üretim I/O’suyla aynı CPU, network ve medyayı paylaşabilir. Büyüme planı steady-state kadar rebalance süresini ve performans etkisini de ölçer.

Koruma geometrisini doğrula
BoyutSorulacak kanıtYanlış kısa yol
KodlamaReplica veya data/parity shardKopya sayısı tek başına yeter
YerleşimDevice/host/rack/site kuralıNode sayısı bağımsızlık demek
AckHangi kalıcılıkta write tamam?Cache yazısı durable sayılır
KayıpDegraded read/write davranışıErişilebilir veri tam korumalıdır
BoşlukRebuild ve rebalance headroomUsable boşluk yalnız yeni veri içindir

ÖRNEK

Üç kopya, tek rack

Üç HCI node’unun her birinde bir replica vardır; fakat üçü aynı rack PDU ve switch’e bağlıdır. Yazılım host kaybına dayanır, rack güç kaybına dayanmaz. Arven rack seviyesinde hedef istiyorsa fiziksel topoloji, placement etiketi, ağ ve quorum tasarımı yeniden kurulur; yalnız replica sayısı artırılmaz.

MÜŞTERİYE SOR

Her veri sınıfının replica/shard’ları hangi device, host, rack ve site’lara yerleşiyor; yazılım etiketleri gerçek güç ve network ortak nedenleriyle uyuşuyor mu?

Mantıksal koruma politikasını fiziksel bağımsızlık kanıtına bağlar.

ŞİMDİ SEN DENE

Bir veri nesnesinin yerleşim haritasını çıkar

Arven ERP diskinden bir mantıksal veri birimi seç. Pool/policy, replica veya shard, device, host, rack, güç ve switch yolunu çiz. Disk, host ve rack kaybında kalan parçaları hesapla; erişim, koruma ve rebuild durumunu ayrı yaz. Dört bilinmeyene owner ve doğrulama tarihi ekle.

BİLGİNİ KONTROL ET

Üç replica’nın üç farklı hostta olması hangi dayanıklılığı tek başına kanıtlamaz?

Bir cevap seç

Failure domain, quorum ve onarım zarfını kur

Failure domain, tek olayın birlikte etkileyebileceği kaynak kümesidir. Device, controller, node, chassis, rack, switch, PDU, oda ve site farklı domain olabilir. HCI’de bir node kaybı compute kapasitesini, o node’daki storage parçalarını ve yeniden koruma trafiğini aynı anda etkiler. Bu bağlı etki, geleneksel ayrık compute ve storage yaklaşımından farklı bir kapasite zarfı doğurur. N+1 yalnız VM’lerin CPU/RAM’ini değil storage service overhead’i, degraded I/O ve rebuild’i de taşımalıdır. Quorum, hangi katılımcıların cluster state veya write ilerlemesi hakkında geçerli karar verebildiğini belirler. Replica sayısı, data quorum, control/metadata quorum ve witness aynı kavram değildir. Network partition’da iki tarafın da yazmayı sürdürmesi split-brain ve tutarsızlık riski yaratabilir; güvenli sistem bir tarafı durdurabilir. Bu durma veri kaybı değildir, fakat uygulama erişilebilirliğini etkiler. Müşterinin CAP teoremi ezberinden çok gerçek partition davranışını ve recovery prosedürünü bilmesi gerekir. Kayıp sonrası durumlar ayrılır: healthy, degraded-but-available, unavailable, rebuilding/rebalancing ve restored. Degraded halde veri okunabilir olsa da ikinci kayba tolerans azalmış olabilir. Rebuild süresi yalnız kopyalanacak TB bölü bandwidth değildir; kaynak seçimi, küçük blok/metadata, foreground I/O, throttle, failure domain ve kapasite doluluğu etkiler. Yeni donanım gelme süresi ve operasyon onayı da risk penceresine eklenir. Heartbeat ve health alarmı gerçek servis kabulü değildir. Kontrollü deney disk, storage process, NIC, switch yolu, node ve mümkünse rack senaryolarını kapsar. VM restart/migration, read/write p99, timeout, data consistency, quorum state, rebuild başlangıç/bitiş ve ikinci kayba kalan tolerans aynı kayıtta tutulur. Fault injection üretici desteği ve güvenli test ortamı olmadan yapılmaz.

HCI arıza ve onarım matrisi
OlayEşzamanlı etkiKabul kanıtı
Disk/deviceParça kaybı ve rebuildI/O, health, koruma süresi
NodeVM kapasitesi ve storage parçalarıRestart, degraded I/O, headroom
Network partitionQuorum ve uzak kopya erişimiYetkili taraf, write davranışı
Rack/güçÇoklu node ve switch kaybıPlacement ve uygulama sonucu
RebalanceCPU/network/media tüketimiForeground SLA ve bitiş süresi

MÜŞTERİYE SOR

Disk, node, switch/rack ve network partition olaylarında control quorum, data erişimi, write kabulü, VM kapasitesi ve ikinci kayba tolerans nasıl değişiyor?

Tek “HA var” beyanını katman ve durum bazlı ölçülebilir davranışa dönüştürür.

ŞİMDİ SEN DENE

Degraded ve rebuild zaman çizgisini tasarla

Bir node kaybını t0 detection’dan tam korumaya dönüşe kadar çiz. VM etkisi, quorum, read/write p99, kopya seviyesi, rebuild throughput, foreground I/O, alarm/owner ve müdahaleyi ekle. Rebuild sürerken ikinci disk ve ikinci node kaybı için ayrı sonuç yaz; güvenli durdurma ve rollback koşulu belirle.

BİLGİNİ KONTROL ET

Bir node kaybından sonra bütün VM’lerin açılması hangi sonucu kanıtlamaz?

Bir cevap seç

Arven HCI kanıt paketini üret

Arven 200 VM’i altı HCI node’una taşımayı değerlendirir. İlk taslakta toplam core, RAM ve raw disk kapasitesi vardır; guest write acknowledgement, storage service CPU/memory payı, east-west storage trafiği, replica/shard placement, rack bağımsızlığı, quorum ve rebuild süresi yoktur. “Bir node kaybında çalışır” ifadesi compute, data ve protection durumlarını karıştırır. Ekip üç kanıt görünümü üretir. Veri yolu görünümü ERP, dosya ve analitik sınıfları için guest queue’dan kalıcı parçalara write/read yolunu; steady-state ve backup/rebuild sırasında CPU, network ve medya ölçülerini gösterir. Yerleşim görünümü her policy’nin device-host-rack-site dağılımını gerçek PDU ve switch topolojisiyle eşler. Durum görünümü healthy, degraded, unavailable, rebuilding ve fully protected geçişlerini süre ve owner ile kaydeder. Kabul senaryoları normal/tepe, backup çakışması, tek disk, storage process, uplink, node, rack yolu ve network partition’dır. Her senaryoda uygulama p99/throughput, VM restart, write/read erişimi, consistency, quorum, kalan koruma, rebuild/rebalance ve ikinci kayıp toleransı ölçülür. Bakımda bir node çıkarıldığında aynı zarf yeniden çalıştırılır. Ürün dokümanındaki minimumlar Arven’in workload kabulü yerine geçmez. Karar paketi HCI seçeneğini geleneksel shared storage veya başka mimariyle iş sonucu, dayanıklılık, operasyon, büyüme ve maliyet açısından kıyaslamaya hazırlar; bu ders ürün seçmez. Son derste node sayısı, N+1/N+2, usable kapasite, network, büyüme, lifecycle, migration, lisans/TCO ve koşullu öneri bu kanıt üzerinde tamamlanacaktır.

Arven HCI veri yolu ve failure-domain kanıtı
Kanıt paketiİçerikKarar kapısı
Veri yoluGuest, storage service, network, medyaAck ve p99 doğrulandı
PlacementPolicy, shard/replica, fiziksel topolojiHedef kayba yayılım
QuorumControl/data ve partition davranışıTek yetkili karar
DegradedErişim, koruma ve ikinci kayıpRisk penceresi kabulde
RebuildSüre, kaynak ve foreground etkiSLA ve headroom korunuyor

ŞİMDİ SEN DENE

Arven HCI kanıt paketini tamamla

ERP için write/read yolunu, her veri parçasının host-rack-power-switch yerleşimini ve node kaybından tam korumaya dönüş zaman çizgisini hazırla. Normal, tepe, bakım, partition ve rebuild senaryolarına ölçü, eşik, owner ve veri kaynağı ekle. Altı TBD, dört risk ve son sizing dersine aktarılacak beş karar girdisi yaz.

BU DERSTEN AL

Bu dersten taşıyacağın düşünceler

  • HCI compute, network, dağıtık storage ve kontrol bağımlılıklarını aynı node kümesinde birleştirir.
  • Guest I/O yerel diskten ibaret değildir; uzak kopya, network, metadata ve acknowledgement zinciri ölçülür.
  • Replica veya shard sayısı fiziksel failure-domain bağımsızlığını tek başına kanıtlamaz.
  • Quorum, veri kopyası ve VM HA farklı sözleşmelerdir.
  • Erişilebilir, degraded ve tam korumalı durumlar ayrı kaydedilir.
  • Arven kararı node kaybıyla birlikte azalan compute/storage kapasitesini ve rebuild penceresini taşır.

Son ders bu kanıt paketini nicel ve operasyonel karara dönüştürür. Normal, tepe, bakım, node/rack kaybı ve rebuild zarfından node sayısı, CPU/RAM, usable ve rebuild-ready kapasite, network headroom ile N+1/N+2 yaklaşımı çıkarılacak; scale-up/scale-out büyüme, firmware/software yaşam döngüsü, rolling upgrade, migration, lisans/TCO ve kabul planı koşullu öneride birleştirilecektir.

← Academy ders yoluna dön