Intelligence artificielle · Automatisation documentaire

Traitement intelligent des documents et automatisation documentaire par l'IA

Le traitement intelligent des documents transforme polices, factures, contrats et demandes en données qui alimentent directement les systèmes de l'entreprise. Nous combinons l'OCR, la classification et l'extraction de données par un modèle de langage avec une validation par règles et un contrôle humain lorsque la confiance est trop faible - et nous traitons les documents sur des modèles hébergés dans l'UE, sans fournisseur externe d'IA.

01Cas d'usage

Traitement intelligent des documents : ce que l'on peut automatiser

Le traitement automatique des documents par l'IA consiste à lire le document (OCR), à en reconnaître le type, à en extraire les données utiles et à les vérifier avant qu'elles n'entrent dans le système de l'entreprise. Contrairement à l'OCR classique à base de gabarits, le modèle de langage comprend le document : il gère des mises en page variées, les documents de plusieurs pages et les tableaux.

Le gain est le plus net là où une équipe ressaisit chaque jour des données issues de documents dont la mise en page varie, mais qui contiennent des informations similaires.

Les documents par lesquels les entreprises commencent généralement :

  • polices et documents d'assurance - parties au contrat, objet et capital assuré, période, prime, véhicules de la flotte,
  • factures et pièces de dépenses - fournisseur, lignes, montants, échéances,
  • contrats - parties, délais, pénalités contractuelles, clauses à examiner,
  • demandes et formulaires - de clients, de candidats, de partenaires,
  • procès-verbaux et documents de transport - données de l'atelier, de l'entrepôt et du transport.

02Flux

Extraction de données par l'IA : du scan au système

Flux du traitement automatique des documents Le document - scan, PDF ou photo - passe par l'OCR, puis le modèle en reconnaît le type. Le modèle de langage extrait ensuite les données vers des champs définis. La validation contrôle les règles et le niveau de confiance de chaque champ : les données fiables rejoignent le système de l'entreprise via l'intégration, les données incertaines sont soumises à une personne qui les corrige ou les valide. Document scan, PDF OCR texte, structure Classification type de document Extraction modèle de langage Validation règles et confiance Système métier ERP, gestion des polices Vérification un humain valide fiablesincertaines
Illustration : les données fiables partent automatiquement vers le système, les données incertaines vers un humain.
  1. OCR

    Lecture du texte et de la mise en page - y compris les tableaux et les documents de plusieurs pages, à partir de scans, de PDF et de photos.

  2. Classification

    Reconnaissance du type de document et choix des champs à extraire.

  3. Extraction

    Le modèle de langage extrait les données vers les champs et les normalise au format du système cible.

  4. Validation

    Règles métier, référentiels, sommes de contrôle et niveau de confiance de chaque champ.

  5. Intégration

    Les données validées automatiquement ou par une personne rejoignent le système de l'entreprise.

03Précision

Précision et contrôle humain

Confiance au niveau du champ

Chaque champ extrait reçoit un score de confiance. Nous fixons les seuils à partir de la précision mesurée - différents pour le numéro de police et pour la description du risque.

L'humain dans la boucle

Les documents et les champs sous le seuil sont soumis à vérification dans une vue pratique : le document à côté des données, correction en un clic.

Apprentissage par les corrections

Les corrections des vérificateurs enrichissent le jeu de test : après chaque modification du modèle, nous savons si la précision progresse, au lieu de le supposer.

Nous mesurons la précision séparément pour chaque champ et chaque type de document, plutôt que de calculer une moyenne unique pour tout le système : une moyenne de 95 % ne sert à rien si le champ le plus important n'est lu correctement qu'une fois sur deux. Chaque opération laisse une trace dans le journal : qui a validé, ce qui a été corrigé et quand les données sont entrées dans le système. Nous présentons plus en détail les méthodes d'évaluation des modèles sur notre page LLM local.

04Réalisation

Broker-Innovix : extraction de données de polices d'assurance

Pour un client du secteur de l'assurance (courtiers, intermédiaires multi-assureurs), nous avons développé un système déployé en production dans lequel un modèle de langage dédié - conçu pour un processus métier précis - lit des polices au format PDF et les transforme en données structurées.

  • types de polices : automobile (OC/AC/NNW), dommages aux biens, responsabilité civile des établissements de santé (OC ZOZ), flottes et risques spéciaux,
  • normalisation des données des polices multivéhicules et de flotte,
  • infrastructure : GPU dédiés dans un cloud privé dans l'UE, sans modèles d'IA externes,
  • sécurité : cinq couches de protection, chiffrement AES et journal d'audit.

Pour en savoir plus sur nos logiciels pour ce secteur : logiciels pour la finance et l'assurance.

InsurTech · IA documentaire

Broker-Innovix : extraction de données de polices d'assurance

Un système en production chez un client du secteur de l'assurance. Un modèle de langage dédié extrait les données des polices PDF, sans transfert vers des fournisseurs d'IA externes.

  • Polices auto (OC/AC/NNW), dommages aux biens, RC des établissements de santé, flottes et risques spéciaux
  • Normalisation des données des polices multivéhicules et de flotte
  • GPU dédiés dans un cloud privé situé dans l'UE
  • IA documentaire
  • Modèle de langage
  • Cloud privé UE

Réalisé

05Protection des données

Des documents remplis de données personnelles : comment nous les protégeons

Les documents que les entreprises souhaitent automatiser contiennent généralement des données à caractère personnel - de clients, de salariés, de partenaires -, et parfois des données de catégorie particulière, par exemple des données de santé. C'est pourquoi :

  • nous traitons les documents sur des modèles hébergés dans l'UE ou dans votre infrastructure, sans fournisseur externe d'IA,
  • le système ne conserve que ce qui est nécessaire - la durée de conservation est fixée avec votre délégué à la protection des données,
  • seules les personnes autorisées ont accès aux documents et à la vue de vérification, et chaque accès est consigné dans un journal.

Lorsque, dans un projet, nous traitons des données pour votre compte, nous signons un contrat de sous-traitance. Le traitement par un sous-traitant est régi par un contrat qui définit l'objet et la durée du traitement, sa nature et sa finalité, le type de données, les catégories de personnes concernées ainsi que les obligations et les droits du responsable du traitement (art. 28, par. 3, du RGPD).

Le traitement automatisé de grands volumes de documents contenant des données personnelles au moyen de nouvelles technologies est typiquement le cas où il convient de vérifier si une analyse d'impact relative à la protection des données (AIPD) est obligatoire.

Questions fréquentes

L'IA s'en sort-elle avec des scans de mauvaise qualité ?

Jusqu'à un certain point : l'OCR et le modèle de langage gèrent bien les scans et les photos de documents courants, mais la qualité de l'entrée influe sur le niveau de confiance du résultat. C'est pourquoi nous mesurons la confiance pour chaque champ, et les documents que le système ne parvient pas à traiter sont soumis à une vérification humaine au lieu d'entrer dans le système avec une erreur.

Quelle précision peut-on atteindre ?

Cela dépend du type de documents et de champs. Nous mesurons la précision champ par champ sur un jeu de test constitué de vos documents - dès le prototype, avant la décision de déployer. Sur cette base, nous fixons les seuils au-dessus desquels les données entrent automatiquement dans le système et en dessous desquels elles partent en vérification.

Les documents seront-ils transmis à un fournisseur externe d'IA ?

Non. Nous exécutons les modèles sur des GPU dédiés dans un cloud privé dans l'UE, dans votre infrastructure ou sur votre compte cloud dans une région UE. C'est aussi le cas de Broker-Innovix : aucun document n'est transféré à des fournisseurs externes d'IA. En savoir plus sur les modèles : LLM local.

Comment les données extraites arrivent-elles dans nos systèmes ?

Par une intégration avec le système cible - ERP, système de gestion des polices, gestion documentaire -, généralement via une API ou une file d'événements, avec contrôle des doublons et journal des données transmises. Nous décrivons les modèles d'intégration sur notre page intégration de systèmes.

Par où commencer l'automatisation documentaire ?

Par un type de document à fort volume et à structure répétitive - par exemple des polices d'un même type ou des factures fournisseurs. Sur un échantillon de quelques dizaines à quelques centaines de documents, nous construisons un prototype et mesurons la précision, puis nous ajoutons d'autres types. Nous échangeons avec vous en anglais ou en polonais.

Sources

  1. Règlement (UE) 2016/679 du Parlement européen et du Conseil (règlement général sur la protection des données, RGPD), JO L 119 du 4.5.2016, rectifié par le JO L 127 du 23.5.2018 - version consolidée ()
  2. Communiqué du président de l'autorité polonaise de protection des données (UODO) du 17 juin 2019 relatif à la liste des types d'opérations de traitement de données à caractère personnel nécessitant une analyse d'impact relative à la protection des données (M.P. 2019, pos. 666) (en polonais) ()

État du droit au Mis à jour le

Services associés

Parlons de votre projet ou de votre audit

Décrivez brièvement votre besoin - nous reviendrons vers vous avec une proposition de prochaines étapes. Nous échangeons avec vous en anglais ou en polonais.

ou appelez le +48 575 621 877