Sztuczna inteligencja · Automatyzacja dokumentów

Automatyzacja przetwarzania dokumentów z AI

Automatyzacja dokumentów z AI zamienia polisy, faktury, umowy i wnioski w dane, które od razu trafiają do systemów firmy. Łączymy OCR, klasyfikację i ekstrakcję danych modelem językowym z walidacją reguł i kontrolą człowieka tam, gdzie pewność jest za niska - a dokumenty przetwarzamy na modelach w UE, bez zewnętrznych dostawców AI.

01Zastosowania

Automatyzacja dokumentów z AI: co da się zautomatyzować

Automatyczne przetwarzanie dokumentów z AI to odczyt dokumentu (OCR), rozpoznanie jego rodzaju, wydobycie potrzebnych danych i ich sprawdzenie, zanim trafią do systemu firmy. W przeciwieństwie do klasycznego OCR na szablonach model językowy rozumie dokument - radzi sobie z różnymi układami, wieloma stronami i tabelami.

Największy efekt daje tam, gdzie zespół codziennie przepisuje dane z dokumentów, które różnią się układem, ale niosą podobne informacje.

Typowe dokumenty, od których firmy zaczynają:

  • polisy i dokumenty ubezpieczeniowe - strony umowy, przedmiot i suma ubezpieczenia, okres, składka, pojazdy we flocie,
  • faktury i dokumenty kosztowe - kontrahent, pozycje, kwoty, terminy,
  • umowy - strony, terminy, kary umowne, klauzule do przeglądu,
  • wnioski i formularze - od klientów, kandydatów, kontrahentów,
  • protokoły i dokumenty przewozowe - dane z hali, magazynu i transportu.

02Przepływ

Ekstrakcja danych z dokumentów: od skanu do systemu

Przepływ automatycznego przetwarzania dokumentów Dokument - skan, PDF albo zdjęcie - przechodzi przez OCR, a model rozpoznaje jego rodzaj. Następnie model językowy wydobywa dane do ustalonych pól. Walidacja sprawdza reguły i pewność każdego pola: pewne dane trafiają przez integrację do systemu firmy, a niepewne do weryfikacji przez człowieka, który je poprawia lub zatwierdza. Dokument skan, PDF OCR tekst i układ Klasyfikacja rodzaj dokumentu Ekstrakcja model językowy Walidacja reguły i pewność System firmy ERP, system polis Weryfikacja człowiek zatwierdza pewneniepewne
Ilustracja: dane pewne idą do systemu automatycznie, niepewne - do człowieka.
  1. OCR

    Odczyt tekstu i układu - także tabel i wielu stron, ze skanów, PDF i zdjęć.

  2. Klasyfikacja

    Rozpoznanie rodzaju dokumentu i wybór zestawu pól do wydobycia.

  3. Ekstrakcja

    Model językowy wydobywa dane do pól i normalizuje je do formatu systemu docelowego.

  4. Walidacja

    Reguły biznesowe, słowniki, sumy kontrolne i pewność każdego pola.

  5. Integracja

    Dane zatwierdzone automatycznie lub przez człowieka trafiają do systemu firmy.

03Dokładność

Dokładność i kontrola człowieka

Pewność na poziomie pola

Każde wydobyte pole ma ocenę pewności. Progi ustalamy na podstawie zmierzonej dokładności - inne dla numeru polisy, inne dla opisu ryzyka.

Człowiek w pętli

Dokumenty i pola poniżej progu trafiają do weryfikacji w wygodnym widoku: dokument obok danych, poprawka jednym kliknięciem.

Uczenie na poprawkach

Poprawki weryfikatorów zasilają zbiór testowy - po każdej zmianie modelu wiemy, czy dokładność rośnie, a nie zgadujemy.

Mierzymy dokładność osobno dla każdego pola i rodzaju dokumentu, a nie jedną średnią dla całego systemu - średnia 95% nie pomoże, jeśli najważniejsze pole jest odczytywane poprawnie w połowie przypadków. Każda operacja zostawia ślad w dzienniku: kto zatwierdził, co poprawił i kiedy dane trafiły do systemu. Metody oceny modeli opisujemy szerzej na stronie lokalnych modeli językowych.

04Realizacja

Broker-Innovix: ekstrakcja danych z polis ubezpieczeniowych

Dla klienta z branży ubezpieczeniowej (brokerzy, multiagencje) zbudowaliśmy system produkcyjny, w którym dedykowany model językowy - zbudowany pod konkretny proces biznesowy - odczytuje polisy w formacie PDF i zamienia je na ustrukturyzowane dane.

  • typy polis: OC/AC/NNW, majątkowe, OC ZOZ, flotowe i ryzyka specjalne,
  • normalizacja danych z polis wielopojazdowych i flotowych,
  • infrastruktura: dedykowane GPU w chmurze prywatnej w UE, bez zewnętrznych modeli AI,
  • bezpieczeństwo: pięciowarstwowa ochrona, szyfrowanie AES i dziennik audytowy.

Więcej o oprogramowaniu dla tej branży: oprogramowanie dla finansów i ubezpieczeń.

InsurTech · Document AI

Broker-Innovix: ekstrakcja danych z polis ubezpieczeniowych

System produkcyjny u klienta z branży ubezpieczeniowej. Dedykowany model językowy ekstrahuje dane z polis PDF, bez transferu do zewnętrznych dostawców AI.

  • Polisy OC/AC/NNW, majątkowe, OC ZOZ, flotowe i ryzyka specjalne
  • Normalizacja danych z polis wielopojazdowych i flotowych
  • Dedykowane GPU w chmurze prywatnej w UE
  • Document AI
  • Model językowy
  • Chmura prywatna UE

Zrealizowany

05Ochrona danych

Dokumenty pełne danych osobowych - jak je chronimy

Dokumenty, które firmy chcą automatyzować, zawierają zwykle dane osobowe - klientów, pracowników, kontrahentów - a czasem dane szczególnej kategorii, np. o zdrowiu. Dlatego:

  • dokumenty przetwarzamy na modelach w UE albo w Twojej infrastrukturze, bez zewnętrznych dostawców AI,
  • w systemie zostaje tylko to, co potrzebne - okres przechowywania ustalamy z Twoim inspektorem ochrony danych,
  • dostęp do dokumentów i widoku weryfikacji mają tylko uprawnione osoby, a każdy dostęp jest zapisany w dzienniku.

Gdy w projekcie przetwarzamy dane w Twoim imieniu, podpisujemy umowę powierzenia. Przetwarzanie przez podmiot przetwarzający odbywa się na podstawie umowy, która określa przedmiot, czas trwania, charakter i cel przetwarzania, rodzaj danych, kategorie osób oraz obowiązki i prawa administratora (art. 28 ust. 3 RODO).

Automatyczne przetwarzanie dużych wolumenów dokumentów z danymi osobowymi z użyciem nowych technologii to sytuacja, w której warto ocenić obowiązek przeprowadzenia oceny skutków dla ochrony danych.

Najczęściej zadawane pytania

Czy AI poradzi sobie ze skanami słabej jakości?

Do pewnego stopnia - OCR i model językowy dobrze radzą sobie z typowymi skanami i zdjęciami dokumentów, ale jakość wejścia wpływa na pewność wyniku. Dlatego mierzymy pewność dla każdego pola, a dokumenty, z którymi system sobie nie radzi, trafiają do weryfikacji przez człowieka zamiast do systemu z błędem.

Jaką dokładność można osiągnąć?

Zależy od rodzaju dokumentów i pól. Dokładność mierzymy osobno dla każdego pola na zbiorze testowym z Twoich dokumentów - jeszcze w prototypie, przed decyzją o wdrożeniu. Na tej podstawie ustalamy progi, powyżej których dane trafiają do systemu automatycznie, a poniżej - do weryfikacji.

Czy dokumenty trafią do zewnętrznego dostawcy AI?

Nie. Modele uruchamiamy na dedykowanych GPU w chmurze prywatnej w UE, w Twojej infrastrukturze albo na Twoim koncie chmurowym w regionie UE. Tak działa też Broker-Innovix - bez transferu dokumentów do zewnętrznych dostawców AI. Więcej o modelach: lokalne modele językowe.

Jak dane z dokumentów trafiają do naszych systemów?

Przez integrację z systemem docelowym - ERP, systemem polisowym, obiegiem dokumentów - zwykle przez API albo kolejkę zdarzeń, z kontrolą duplikatów i dziennikiem przesłanych danych. Wzorce opisujemy na stronie integracja systemów informatycznych.

Od czego zacząć automatyzację dokumentów?

Od jednego rodzaju dokumentu o dużym wolumenie i powtarzalnej strukturze - na przykład polis jednego typu albo faktur kosztowych. Na próbce kilkudziesięciu lub kilkuset dokumentów budujemy prototyp i mierzymy dokładność, a potem dodajemy kolejne typy.

Źródła

  1. Rozporządzenie Parlamentu Europejskiego i Rady (UE) 2016/679 (ogólne rozporządzenie o ochronie danych, RODO), Dz.Urz. UE L 119 z 4.05.2016, ze sprostowaniami: L 127 z 23.05.2018, L 74 z 4.03.2021 - tekst skonsolidowany ()
  2. Komunikat Prezesa Urzędu Ochrony Danych Osobowych z dnia 17 czerwca 2019 r. w sprawie wykazu rodzajów operacji przetwarzania danych osobowych wymagających oceny skutków przetwarzania dla ich ochrony (M.P. 2019 poz. 666) ()

Stan prawny na: Aktualizacja:

Powiązane usługi

Porozmawiajmy o Twoim projekcie lub audycie

Opisz krótko, czego potrzebujesz - wrócimy z propozycją kolejnych kroków.

lub zadzwoń pod numer +48 575 621 877