OCR (optyczne rozpoznawanie znaków) – co to jest?
OCR (ang. Optical Character Recognition, optyczne rozpoznawanie znaków) to technologia, która zamienia tekst znajdujący się na obrazie, takim jak skan, zdjęcie czy plik PDF w formie obrazu, na tekst cyfrowy, który komputer potrafi odczytać. Dla człowieka zeskanowana faktura wygląda jak dokument z tekstem, ale dla systemu to tylko zbiór pikseli. OCR odczytuje z niego litery i cyfry, dzięki czemu treść można przeszukiwać, kopiować, edytować i automatycznie przetwarzać.
W praktyce OCR usuwa potrzebę ręcznego przepisywania danych z dokumentów papierowych i skanów. Informacje, które trzeba było wpisać ręcznie, trafiają do systemu automatycznie.
Jak działa OCR?
Rozpoznawanie tekstu przebiega w kilku krokach. Najpierw program przygotowuje obraz: prostuje przekrzywione strony, usuwa zabrudzenia, poprawia kontrast i wyostrza tekst. Następnie ustala układ dokumentu, czyli gdzie znajdują się bloki tekstu, tabele i obrazy, a na koniec rozpoznaje poszczególne znaki i składa je w wyrazy. Dawniej robiono to przez porównywanie kształtów liter ze wzorcami, a obecnie stosuje się głównie sieci neuronowe, które lepiej radzą sobie z różnymi czcionkami i gorszą jakością obrazu. W ostatniej fazie wynik jest poprawiany na podstawie słowników i reguł, np. wykrywających, że w numerze konta nie powinno być liter.
Efektem jest zwykle tekst wraz z informacją o jego położeniu na stronie. Często tworzy się też dokument PDF z warstwą tekstową, który wygląda jak oryginał, ale pozwala wyszukiwać i zaznaczać słowa.
Zastosowania OCR w firmie
OCR przydaje się wszędzie tam, gdzie do firmy trafiają dokumenty w formie papierowej lub jako skany. Najczęściej wykorzystuje się go do:
- odczytywania danych z faktur, takich jak numer, data, kwota, NIP i nazwa kontrahenta,
- rejestrowania korespondencji przychodzącej i automatycznego opisywania dokumentów,
- digitalizacji archiwów, aby dokumenty dało się wyszukiwać po treści,
- przetwarzania umów i innych dokumentów, w których trzeba znaleźć określone informacje,
- odczytu dokumentów tożsamości i formularzy wypełnionych na papierze.
W systemach obiegu dokumentów OCR jest zwykle pierwszym krokiem procesu: odczytane dane trafiają do formularza, a dokument jest kierowany do akceptacji bez ręcznego wpisywania.
Od czego zależy jakość rozpoznawania znaków?
Skuteczność OCR zależy przede wszystkim od jakości źródła. Ostry, dobrze oświetlony skan o odpowiedniej rozdzielczości daje znacznie lepszy wynik niż rozmyte zdjęcie zrobione telefonem. Znaczenie mają też czcionka, układ dokumentu i język, w przypadku polskiego szczególnie znaki diakrytyczne. Pismo odręczne jest trudniejsze do rozpoznania niż druk. Ponieważ nawet dobre rozwiązanie może się pomylić, przy ważnych danych, takich jak kwoty czy numery kont, warto zapewnić kontrolę wyniku przez człowieka lub automatyczną walidację.
OCR a pojęcia pokrewne
Skanowanie dokumentów tworzy jedynie obraz kartki. Dopiero OCR odczytuje z niego tekst, więc oba kroki uzupełniają się, ale nie są tym samym. ICR (Intelligent Character Recognition) to rozwinięcie OCR przystosowane do rozpoznawania pisma odręcznego.
AI OCR, czyli inteligentne przetwarzanie dokumentów, idzie o krok dalej: nie tylko odczytuje tekst, ale też rozumie, co on oznacza. Rozpoznaje, że dana liczba to kwota brutto, a ciąg znaków to numer faktury, nawet gdy dokumenty różnią się układem. Dzięki temu można przetwarzać dokumenty o zmiennej strukturze bez tworzenia osobnego wzorca dla każdego kontrahenta.