Autor: Ing. Michal Dobrotka, MBA
Ilustračná fotografia: Biswarup Ganguly, CC BY 3.0. Zmenšená verzia; fotografia nezobrazuje používateľa našej služby.
Skenované PDF treba anonymizovať v obraze aj v prípadnej textovej vrstve. To, že sa meno nedá vyhľadať klávesovou skratkou, ešte neznamená, že na stránke nie je. Môže byť vytlačené v obrázku, dopísané rukou alebo nesprávne rozpoznané pomocou OCR. Bezpečný postup preto začína kontrolou kvality skenu a končí otvorením nového exportu.
Čo je OCR a čo pri anonymizácii dokáže
OCR je optické rozpoznávanie znakov: z obrázka vytvára strojovo čitateľný text. Pomáha vyhľadať opakujúce sa mená, telefónne čísla či adresy. Nález však závisí od čitateľnosti vstupu. Dokumentácia Tesseractu upozorňuje na vplyv rozlíšenia, šumu, natočenia stránky a rozloženia textu.
Rozlišujte tri situácie: čistý sken bez textu, sken s OCR vrstvou a kombinovaný dokument, v ktorom sú niektoré strany digitálne a iné naskenované. Jeden úspešný pokus o označenie textu na prvej strane vám nepovie, ako sú vytvorené ostatné strany.
Pripravte čitateľný vstup
Ak máte papierový originál, skontrolujte, či sa pri skenovaní nezrezali okraje a či sú strany rovné. Pri bežnom tlačenom texte býva rozumným východiskom sken okolo 300 DPI; nejde však o záruku presného rozpoznania. Dodatočné zväčšenie rozmazanej fotografie nevráti stratené detaily. Drobné písmo a nekvalitná predloha môžu vyžadovať nový sken.
- Skontrolujte tiene pri chrbte zviazaného dokumentu.
- Prejdite svetlé kópie, pečiatky a text vytlačený cez linky tabuľky.
- Overte správnu orientáciu každej strany.
- Porovnajte počet strán s originálom vrátane zadných strán a príloh.
Ak nástroj hlási poškodený alebo heslom chránený súbor, najprv si zabezpečte použiteľný podklad oprávneným spôsobom. Chybové hlásenie ani prázdny zoznam nálezov nie sú potvrdením, že dokument neobsahuje osobné údaje.
Kontrolujte obraz a text vedľa seba
Najčastejšie zradia zámenné znaky: číslica nula a písmeno O, jednotka a malé l alebo chýbajúca diakritika. Telefón môže byť rozdelený medzerami, meno zalomené do dvoch riadkov a adresa vložená do pečiatky. Vyhľadanie presného reťazca preto používajte iba ako jednu z kontrol.
Pri vizuálnom prechode si označte aj miesta, ktoré automatika nenašla. Oblasť má pokrývať celý údaj vrátane diakritiky a spodných častí písmen. Na okrajoch strán kontrolujte, či maska nezostala posunutá po otočení alebo zmene mierky zobrazenia.
Modelový príklad: dvojstranová žiadosť s prílohou
Na prvej strane je meno vytlačené z počítača. Na druhej je podpis a ručne dopísaný kontakt. Príloha obsahuje rovnaké meno v nekvalitnej pečiatke. OCR nájde iba prvý výskyt. Ak pracovník potvrdí všetky automatické návrhy a hneď publikuje, zvyšné dve miesta zostanú odhalené.
Správny pracovný postup doplní ručné označenia, skontroluje všetky tri strany a vytvorí nový súbor. Príklad ukazuje rozdiel medzi úspešným rozpoznaním jedného výskytu a úplnou kontrolou dokumentu. Počet návrhov nie je mierou bezpečnosti výsledku.
Ako overiť export zo skenovaného PDF
- Otvorte uložený export, nie náhľad pôvodného dokumentu.
- Zväčšite každé odstránené miesto a hľadajte zvyšky písmen či podpisu.
- Vyhľadajte pôvodné citlivé výrazy a vyskúšajte kopírovanie.
- Ak výsledok obsahuje novú OCR vrstvu, overte, že nevychádza z nezačierneného originálu.
- Skontrolujte prílohy, vlastnosti súboru a úplnosť strán.
Prázdny výsledok vyhľadávania má pri obrazovom dokumente obmedzenú výpovednú hodnotu. Dôležité je overiť aj technický spôsob exportu: citlivé obrazové dáta sa musia odstrániť, nie iba zakryť ďalším objektom. Pri zavádzaní nástroja to otestujte na umelom dokumente s vopred známymi údajmi.
Časté otázky
Je sken bez OCR bezpečnejší?
Nie sám osebe. Čitateľný text na obrázku môže človek prečítať a ďalší program znovu rozpoznať. Chýbajúca textová vrstva nie je anonymizácia.
Musím ručne prejsť celý dokument?
Áno. Automatika môže pomôcť s hľadaním, no pre finálnu kontrolu nestačí prezrieť iba označené miesta. Osobitnú pozornosť venujte podpisom, pečiatkam a prílohám.
Prečítajte si aj prečo čierny obdĺžnik nestačí a kontrolu anonymizovaného exportu. Výsledok pred zverejnením vždy osobne skontrolujte.
Zdroje
- Tesseract: Improving the quality of the output – faktory ovplyvňujúce OCR.
- Adobe Acrobat: Redact sensitive content – trvalé odstránenie obsahu PDF.
Zdroje overené 7. septembra 2026.