Deduplikacija podataka: kako štedi prostor i ubrzava backup
Deduplikacija podataka (engl. data deduplication) je tehnika koja uklanja redundantne kopije podataka i u sustavu pohrane zadržava samo jedinstvene instance. Rezultat je izravno smanjenje potrebnog kapaciteta pohrane, brži backup ciklusi i manji mrežni promet pri replikaciji. Prema Microsoftovoj tehničkoj dokumentaciji, uštede kapaciteta u nekim scenarijima mogu doseći i do 90%.
Ključne implikacije za IT okruženja:
- Manje troškova pohrane: manji broj fizičkih diskova za isti volumen podataka
- Brži backupi: prenose se samo novi, jedinstveni blokovi podataka
- Smanjen mrežni promet: replikacija i DR procesi rade s bitno manjim skupom podataka
- Bolja iskorištenost infrastrukture: isti hardver pokriva veće logičke kapacitete
Sadržaj
- Kako zapravo rade chunking, hashing i referentne tablice?
- Koji model implementacije odgovara Vašem scenariju?
- Gdje deduplikacija donosi najveću vrijednost?
- Koliko prostora deduplikacija stvarno može uštedjeti?
- Na koje rizike treba računati prije aktivacije deduplikacije?
- Kako deduplikacija mijenja backup i Disaster Recovery procese?
- Kako odabrati pravi pristup i što testirati prije produkcije?
- Kada deduplikacija nije dovoljna i treba kontaktirati laboratorij?
- Ključne spoznaje
- Što učiniti ako su Vaši podaci ugroženi?
- Korisni izvori za daljnje čitanje
Kako zapravo rade chunking, hashing i referentne tablice?
Deduplikacija ne uspoređuje datoteke kao cjeline. Proces počinje podjelom podataka na manje segmente, tzv. chunkove, a zatim svaki segment identificira putem kriptografskog sažetka.
Razina deduplikacije: file-level vs block-level
File-level deduplikacija prepoznaje identične datoteke i zamjenjuje duplikate pokazivačima na jednu kopiju. Block-level pristup ide dublje: dijeli datoteke na manje blokove i uspoređuje ih neovisno o strukturi datoteke, što obično postiže znatno veću učinkovitost jer pronalazi preklapanja čak i unutar izmijenjenih datoteka.
Fiksni vs varijabilni chunking

Fiksni chunking dijeli podatke na blokove jednake veličine. Varijabilni chunking (variable-length chunking, VLC) prilagođava granice segmenata sadržaju, što znači da izmjena jednog dijela datoteke ne pomakne granice svih ostalih blokova. Varijabilni pristup pronalazi više preklapanja u stvarnim radnim opterećenjima, posebno kod dokumentnih repozitorija i virtualnih strojeva.
Hashing i referentne tablice
Svaki blok dobiva kriptografski sažetak, najčešće SHA-256. Sustav uspoređuje taj sažetak s referentnom tablicom (indeksom) već pohranjenih blokova. Ako sažetak postoji, blok se ne pohranjuje ponovo, nego se dodaje novi pokazivač na postojeću instancu. Oslanjanje isključivo na hash bez provjere kolizija može dovesti do grešaka u integritetu podataka, što profesionalni sustavi rješavaju dodatnom verifikacijom.
Vendori poput NetAppa, Oraclea i Supermicra detaljno opisuju vlastite implementacije u tehničkim bilješkama, no temeljni mehanizmi ostaju konzistentni.
Profesionalni savjet: Za poslovne sustave s heterogenim podacima, kombinacija pravila i strojnog učenja pri identifikaciji duplikata smanjuje logičke pogreške koje čisti hash pristup ne može otkriti.
Koji model implementacije odgovara Vašem scenariju?
Tri su osi po kojima se razlikuju pristupi implementacije: trenutak izvođenja, lokacija obrade i opseg indeksa.
Inline vs post-process
Inline deduplikacija obrađuje podatke u trenutku pisanja, što znači da se duplikati ne pohrane ni na trenutak. Post-process pristup podatke najprije pohrani, a deduplikaciju izvodi kao pozadinski zadatak. Block-level deduplikacija zahtijeva značajne računalne resurse u realnom vremenu, pa se u sustavima s visokim opterećenjem post-process model češće koristi kako bi se izbjeglo pogoršanje I/O performansi.

Source-side vs target-side
Source-side deduplikacija obrađuje podatke na izvoru (npr. backup agent na serveru) prije prijenosa. Target-side obrada odvija se na odredišnom sustavu pohrane. Source-side pristup drastično smanjuje mrežni promet jer se mrežom prenose samo jedinstveni blokovi.
Globalni indeks vs per-volume pristup
Globalni indeks pretražuje duplikate kroz sve volumene, što daje veće uštede, ali zahtijeva složenije upravljanje i veće resurse za indeksiranje. Per-volume pristup je jednostavniji za upravljanje i manje rizičan pri kvarovima.
| Dimenzija | Inline | Post-process |
|---|---|---|
| Razina deduplikacije | File ili block | Pretežno block |
| CPU/IOPS overhead | Visok, u realnom vremenu | Nizak za I/O, visok u pozadini |
| Procijenjena ušteda prostora | Identična | Identična |
| Kompatibilnost s enkripcijom | Ograničena (enkripcija sprječava dedup) | Ograničena (isti razlog) |
| Pogodnost za use case | VDI, NAS s predvidivim opterećenjem | Backup, arhiva, DR |
| Operativna složenost | Viša | Niža |
- Inline model zahtijeva dimenzioniranje sustava za vršno opterećenje
- Post-process model nudi fleksibilnost raspoređivanja obrade izvan radnog vremena
- Source-side dedup smanjuje troškove mrežne propusnosti, posebno kod udaljenih lokacija
Gdje deduplikacija donosi najveću vrijednost?
Korist nije jednaka u svim scenarijima. Razumijevanje gdje se duplikati prirodno nakupljaju ključno je za procjenu isplativosti.
- Backup i Disaster Recovery: najveća vrijednost jer se isti podaci sigurnosno kopiraju svakodnevno s minimalnim promjenama. Prenose se samo jedinstveni blokovi, što skraćuje backup prozore i smanjuje troškove prijenosa prema DR lokaciji.
- VDI (virtualne radne površine): deseci ili stotine virtualnih strojeva dijele isti operacijski sustav i aplikacije. Stopa deduplikacije ovdje je iznimno visoka jer su razlike između VM instanci minimalne.
- NAS i sekundarna pohrana: korisno za repozitorije dokumenata s mnogo verzija iste datoteke. Kontraindicirano za primarne baze podataka s visokim I/O zahtjevima ili za medijske datoteke (video, audio) koje su već komprimirane.
- Arhiva i replikacija: smanjuje volumen podataka koji se prenosi pri sinkronizaciji između lokacija, što je posebno relevantno za organizacije s ograničenom mrežnom propusnošću
Koliko prostora deduplikacija stvarno može uštedjeti?
Uštede ovise o tipu podataka, učestalosti promjena i odabranoj metodi. Microsoft navodi uštede do 90% u idealnim scenarijima, a to su tipično backup repozitoriji s dugom retencijom i VDI okruženja.
Što utječe na stvarnu stopu uštede:
- Tip podataka: dokumenti i virtualni strojevi daju visoke stope; komprimirani mediji gotovo nikakve
- Učestalost promjena: podaci koji se rijetko mijenjaju akumuliraju više duplikata
- Veličina chunkova: manji blokovi pronalaze više preklapanja, ali povećavaju overhead indeksa
- Retencija backupa: dulja retencija znači više identičnih blokova kroz više točaka oporavka
Financijska korist je izravna: manji broj diskova, niži troškovi licenci za kapacitet i smanjena potrošnja energije u podatkovnom centru. Za sigurnu zaštitu podataka deduplikacija nije zamjena za strategiju backupa, nego njezin sastavni dio.
Na koje rizike treba računati prije aktivacije deduplikacije?
Deduplikacija uvodi specifične rizike koji se rijetko spominju u marketinškim materijalima.
- CPU i IOPS overhead: inline dedup može usporiti primarne sustave; post-process zahtijeva pažljivo planiranje prozora obrade
- Hash kolizije: oslanjanje samo na hash bez provjere kolizija može prouzročiti tihe greške u podacima; profesionalni sustavi dodaju sekundarnu verifikaciju
- Jedna točka kvara: ako se ošteti master blok na koji se referenciraju mnoge datoteke, sve te logičke datoteke postaju nečitljive odjednom, što je scenarij znatno opasniji od oštećenja jedne datoteke
- Enkripcija i kompresija: enkripcija podataka prije deduplikacije čini blokove jedinstvenim i eliminira uštede; kompresija smanjuje redundanciju koju dedup može iskoristiti
- Forenzičke i arhivske posljedice: u reguliranim industrijama duplikati mogu biti funkcionalno potrebni kao neovisni dokazi ili revizijski tragovi; brisanje duplikata može narušiti zahtjeve usklađenosti
Profesionalni savjet: Prije aktivacije deduplikacije na produkcijskom sustavu, provjerite jesu li backup kopije pohrane indeksa uključene u plan oporavka. Oštećen indeks bez backup kopije može učiniti sve deduplicirane podatke nedostupnima.
Kako deduplikacija mijenja backup i Disaster Recovery procese?
Utjecaj na backup i DR nije samo pozitivan. Postoje i komplikacije koje zahtijevaju prilagodbu procedura.
- Restore time: deduplikacija smanjuje volumen podataka za prijenos, ali restore proces mora rekonstruirati originalne datoteke dereferenciranjem blokova, što može usporiti paralelni restore više datoteka istovremeno
- Replikacija: inicijalna replikacija između lokacija je bitno brža jer se prenose samo jedinstveni blokovi; sinkronizacija indeksa između primarnog i sekundarnog sustava zahtijeva dodatnu pažnju pri planiranju DR arhitekture
- Snapshot konzistentnost: snapshoti u deduplikacijskim sustavima dijele blokove s produkcijskim podacima; testiranje restore procesa mora uključiti scenarij potpunog oporavka, ne samo provjeru dostupnosti snapshotova
- Validacija restorea: aktivacija deduplikacije je trenutak kada testiranje restorea postaje obavezno, a ne preporučljivo; bez verifikacije ne možete znati je li referentna tablica konzistentna
Kako odabrati pravi pristup i što testirati prije produkcije?
Odabir modela deduplikacije bez prethodnog testiranja na stvarnim podacima je čest uzrok razočaranja. Evo strukturiranog pristupa za IT timove u srednjoeuropskom okruženju.
Ključni kriteriji pri odabiru:
- Kompatibilnost s postojećom infrastrukturom (HDD, SSD, RAID, NAS)
- Podrška enkripciji i usklađenost s GDPR zahtjevima
- Očekivana stopa uštede na uzorku stvarnih podataka
- Skalabilnost indeksa pri rastu kapaciteta
- SLA zahtjevi i tolerancija na overhead
Checklist testiranja prije produkcije:
- Uzmite reprezentativan uzorak podataka (minimalno 10% produkcijskog volumena)
- Izmjerite stvarnu stopu deduplikacije na uzorku
- Simulirajte puni backup/restore ciklus i zabilježite trajanje
- Izmjerite CPU i I/O opterećenje sustava za vrijeme dedup procesa
- Testirajte restore jedne datoteke, direktorija i punog volumena
- Verificirajte integritet podataka nakon restorea (checksum usporedba)
- Testirajte replikaciju između lokacija i izmjerite smanjenje mrežnog prometa
- Provjerite kompatibilnost s backup alatima koje koristite
Za procjenu razlika između cloud i lokalnog backupa u kontekstu deduplikacije, lokalni sustavi obično nude veću kontrolu nad indeksom, dok cloud rješenja mogu imati vlastite mehanizme deduplikacije koji se ne mogu kombinirati s lokalnom.
Organizacije u središnjoj Europi trebaju uzeti u obzir lokalne mrežne kapacitete pri planiranju source-side deduplikacije prema udaljenim DR lokacijama, kao i GDPR zahtjeve koji mogu ograničiti gdje se referentni indeks smije pohraniti.
Kada deduplikacija nije dovoljna i treba kontaktirati laboratorij?
Postoje situacije u kojima tehnički problem nadilazi mogućnosti deduplikacijskih alata i zahtijeva stručnu laboratorijsku intervenciju.
Situacije koje zahtijevaju hitni kontakt s laboratorijem:
- Fizičko oštećenje diska ili RAID polja na kojem je aktivan deduplikacijski sustav
- Nečitljivi ili oštećeni master blokovi koji uzrokuju masovnu nedostupnost datoteka
- Neočekivano ponašanje sustava pohrane nakon aktivacije ili nadogradnje deduplikacije
- Korupcija referentnog indeksa bez dostupne backup kopije
- Gubitak podataka koji se ne može riješiti standardnim restore procedurama
Što učiniti odmah:
- Zaustavite sve operacije pisanja na zahvaćeni uređaj ili volumen
- Ne pokrećite dodatne deduplikacijske procese ni alate za automatski popravak
- Sačuvajte uređaj u trenutnom stanju i dokumentirajte simptome
- Kontaktirajte laboratorij za dijagnostiku s opisom problema, datumom uređaja i popisom izvedenih koraka
Kada je oštećen master blok na koji se referenciraju stotine ili tisuće logičkih datoteka, svaki dodatni pokušaj automatskog popravka može trajno uništiti preostale reference. Konzervativna dijagnostika u laboratorijskim uvjetima jedina je sigurna opcija u takvim scenarijima.
InfoLAB je certificirani laboratorij za spašavanje podataka s HDD, SSD, RAID i NAS sustava, s ISO 9001:2015 certifikatom i više od 25 godina iskustva u regiji. Laboratorij raspolaže clean-room uvjetima i stručnom dijagnostikom za scenarije u kojima je deduplikacijska infrastruktura kompromitirana fizičkim ili logičkim kvarom.
Ključne spoznaje
Deduplikacija podataka donosi stvarne uštede prostora i ubrzava backup procese, ali zahtijeva pažljivo planiranje i testiranje kako bi se izbjegla nova točka kvara u infrastrukturi pohrane.
| Točka | Detalji |
|---|---|
| Definicija i korist | Deduplikacija uklanja redundantne kopije i u idealnim scenarijima može smanjiti kapacitet pohrane i do 90%. |
| Block-level vs file-level | Block-level pristup postiže veće uštede jer pronalazi preklapanja unutar izmijenjenih datoteka. |
| Ključni rizik | Oštećen master blok čini sve referencirane datoteke nečitljivima odjednom, što je ozbiljniji scenarij od standardnog kvara. |
| Testiranje restorea | Nakon aktivacije deduplikacije, testiranje punog restore ciklusa postaje obavezno, ne samo preporučljivo. |
| Datarecovery | Za fizičke kvarove i korupciju indeksa, Datarecovery laboratorij nudi hitnu dijagnostiku i spašavanje podataka. |
Što učiniti ako su Vaši podaci ugroženi?
Ako ste primijetili gubitak podataka, nečitljive datoteke ili neočekivano ponašanje sustava pohrane, svaki trenutak čekanja povećava rizik od trajnog gubitka.

Datarecovery (InfoLAB) pruža laboratorijsko spašavanje podataka za sve vrste uređaja: tvrde diskove, SSD-ove, RAID polja i NAS sustave. Laboratorij radi u clean-room uvjetima, nudi hitnu dijagnostiku i jedini je u regiji s ISO 9001:2015 certifikatom koji potvrđuje kvalitetu procesa. Osnovan 1993. godine, s više od 25 godina iskustva, Datarecovery je pouzdan partner za korporativne i privatne klijente diljem srednje Europe.
Zaustavite uređaj, ne pokrećite dodatne alate i odmah se obratite laboratoriju putem stranice spašavanja podataka.
Korisni izvori za daljnje čitanje
Za inženjere i IT odlučitelje koji žele dublje razumjeti tehničke detalje i implementacijske izazove deduplikacije:
- Data deduplication overview (Microsoft): službena dokumentacija s tehničkim detaljima implementacije u Windows Server okruženju i benchmarci ušteda po tipu podataka
- File-level vs block-level deduplication: usporedba razina deduplikacije s objašnjenjem utjecaja na učinkovitost i primjenu
- What is data deduplication and why use it (Medium): pristupačno objašnjenje prednosti u backup i DR scenarijima
- Dedupe: let’s look under the hood (StarWind): tehnički pregled internih mehanizama s naglaskom na rizike master blokova
- What is data deduplication (Reltio): objašnjenje rizika hash kolizija i integriteta podataka
- Deduplication and storage savings (Scality): analiza performansnih kompromisa i preporuke za sustave s visokim opterećenjem
- Što je deduplikacija? (PcHardwarePro): implementacijski izazovi i savjeti za testiranje na hrvatskom jeziku
