Qu'est-ce que le déliassage ?

Séparer une pile de pages en documents individuels est l'étape la plus discrète de la chaîne documentaire, et celle qui décide de la qualité de tout le reste.

Par l'équipe HolofinDernière mise à jour : 23 septembre 2026
Réponse courte

Le déliassage consiste à découper un lot de pages numérisées, ou un PDF composite, en documents individuels autonomes. Il répond à une seule question : où commence et où finit chaque document ? Il précède la classification et l'extraction, et une erreur commise à ce stade rend fausses toutes les étapes suivantes.

Personne ne dépose un seul document. Un dossier de crédit arrive sous la forme d'un PDF de 84 pages : trois bulletins de salaire, un avis d'imposition, une pièce d'identité photographiée en deux fois, six mois de relevés bancaires, et une facture d'électricité glissée au milieu de l'ensemble.

Avant de pouvoir lire quoi que ce soit, il faut savoir où chaque pièce commence et où elle finit. C'est le déliassage.

Définition

Le mot vient de la liasse : l'ensemble des feuillets transmis d'un seul bloc. Déliasser, c'est ramener ce bloc à ses composants : le bulletin de salaire de deux pages d'un côté, l'avis d'imposition de quatre pages de l'autre.

Le terme est né dans les centres de numérisation, où il désignait le geste physique de dégrafer et de trier une pile de papier avant de la passer au scanner. Il désigne aujourd'hui l'opération logicielle équivalente, que le lot soit un scan ou un fichier natif. En anglais, on parle de document segmentation ou de document splitting.

Déliassage correct

Fichier déposéDocuments détectéspage 1page 2page 3page 4page 5page 6page 7page 8page 9Bulletin de salairepages 1 à 2Avis d'impositionpages 3 à 6RIBpage 7Relevé bancairepages 8 à 9
Déliasser, c'est retrouver ces quatre frontières dans un fichier qui n'en signale aucune. Les pages ne changent pas : c'est leur regroupement qui est l'information produite.

Déliassage, classification, extraction : trois étapes distinctes

Ces trois opérations sont souvent confondues sous le terme générique de capture documentaire. Elles ne répondent pourtant pas à la même question, et leur ordre n'est pas négociable.

Déliassage (segmentation).
Où commence et où finit chaque document ?
Classification (RAD).
De quel type de document s'agit-il ?
Extraction (LAD, OCR).
Quelles valeurs contient-il ?

La classification attribue une nature à chaque pièce isolée : bulletin de salaire, RIB, avis d'imposition. L'extraction en tire ensuite les champs structurés : salaire net, revenu fiscal de référence, IBAN.

L'enchaînement est strictement séquentiel. Une erreur de déliassage rend les deux étapes suivantes fausses par construction : on classe une chimère, et on en extrait des données qui n'ont jamais existé dans aucun document réel.

Les quatre méthodes classiques, et ce qui les casse

Le déliassage est un problème ancien. Les solutions inventées à l'époque des salles de numérisation sont toujours en production aujourd'hui.

Les pages intercalaires

Un opérateur insère une feuille de séparation, souvent colorée, entre deux documents avant de passer le lot au scanner. Simple, fiable, et entièrement dépendant d'un geste humain effectué en amont.

Les codes-barres

Variante industrialisée de l'intercalaire : un code-barres imprimé porte l'identifiant du document ou du dossier. Cela fonctionne remarquablement bien, à condition de maîtriser l'impression des documents entrants. C'est le cas d'un formulaire que vous avez vous-même envoyé au client. Ce n'est jamais le cas d'un bulletin de salaire émis par son employeur.

Le nombre de pages fixe

Toutes les trois pages, nouveau document. Utile pour des flux parfaitement standardisés, inexploitable dès qu'une pièce comporte une annexe, une page recto-verso ou une mention reportée en fin de liasse.

Les règles sur le contenu

Plus ambitieux : on océrise tout, puis on déclenche une coupure sur un mot-clé comme BULLETIN DE PAIE ou AVIS D'IMPÔT. Cela tient jusqu'au jour où l'émetteur change sa mise en page, où le mot-clé apparaît aussi dans une mention légale de bas de page, ou où le scan est trop dégradé pour que l'OCR le lise.

Le point commun de ces quatre méthodes : elles déplacent le travail en amont. Toutes supposent un lot préparé, un opérateur formé, une chaîne que vous contrôlez de bout en bout.

Or le point d'entrée a changé. Le client photographie ses documents avec son téléphone, les dépose sur un portail, les envoie par e-mail en six pièces jointes dont deux sont des PDF déjà fusionnés. Il n'y a plus personne pour intercaler une feuille de séparation.

Pourquoi une erreur de déliassage coûte plus cher qu'une erreur d'OCR

Une erreur d'OCR est locale et visible : un montant mal lu reste un montant, au bon endroit, dans le bon document. Un contrôle de cohérence a de bonnes chances de l'attraper. Une erreur de déliassage, elle, est silencieuse, et elle se propage.

Les conséquences se cumulent. L'extraction porte sur le mauvais document : les pages 12 à 15 rattachées au bulletin précédent donnent le revenu d'un autre mois, ou d'une autre personne du foyer. Le contrôle de complétude devient faux : le système compte onze documents là où il y en a quatorze, déclare complet un dossier qui ne l'est pas, ou réclame au client une pièce qu'il a déjà fournie. Et les contrôles croisés s'effondrent, puisque comparer le nom porté par le relevé bancaire avec celui de la pièce d'identité n'a aucun sens si les frontières entre les deux sont fausses.

Une frontière manquée

Fichier déposéDocuments détectéspage 1page 2page 3page 4page 5page 6page 7page 8page 9frontière manquéeBulletin de salairepages 1 à 6deux documents fusionnésRIBpage 7Relevé bancairepages 8 à 9
Une seule frontière manquée, et l'avis d'imposition n'existe plus : le contrôle de complétude le déclare absent, et le revenu est extrait d'une page qui appartient à un autre document. L'OCR, lui, n'a fait aucune erreur.

Un OCR à 99,5 % appliqué à un document mal découpé produit une donnée fausse avec une confiance élevée. C'est le pire résultat possible : faux, et crédible.

Le déliassage par l'IA : de la règle au raisonnement

L'approche moderne ne cherche plus de marqueur. Elle lit la page comme le ferait un opérateur expérimenté, en combinant vision par ordinateur et modèles de langage : mise en page, en-tête et pied de page, identité de l'émetteur, pagination « page 2/4 », continuité d'un tableau interrompu, changement de police ou de trame de fond.

La question posée n'est plus « y a-t-il un code-barres ? » mais « cette page est-elle la suite de la précédente, ou le début d'autre chose ? ».

  • Aucune préparation en amont. Ni intercalaire, ni code-barres, ni consigne de dépôt imposée au client.
  • Les pages de continuation sont gérées. Un bulletin de salaire sur deux pages reste un seul document, même sans en-tête répété.
  • Les documents imbriqués sont détectés. Une attestation agrafée au milieu d'un relevé est isolée correctement.
  • Les conditions réelles de dépôt sont absorbées. Photos prises de travers, pages blanches, scans à 150 dpi, pages pivotées, recto-verso inversés.
  • Déliassage et classification en un seul passage. Le modèle qui décide de la frontière sait déjà de quel type de document il s'agit.

Comment évaluer une solution de déliassage

Six critères séparent une démonstration réussie d'une mise en production qui tient.

  1. Une mesure au document, pas à la page. Un taux de 99 % par page flatte le résultat : sur des documents de cinq pages, il laisse environ un document sur vingt mal découpé. La seule métrique honnête est le pourcentage de documents dont les deux frontières sont exactes.
  2. Un score de confiance par frontière. Les coupures douteuses doivent être signalées individuellement, pour qu'un humain n'arbitre que celles-là.
  3. La gestion explicite du multi-pages. Demandez à voir le comportement sur un document de sept pages sans en-tête répété.
  4. Une traçabilité page vers document. Vous devez pouvoir justifier, pièce par pièce, pourquoi telle page appartient à tel document. C'est ce qui rend une décision défendable lors d'un contrôle.
  5. Une évaluation sur vos pires dossiers. Le déliassage se juge sur la queue de distribution, pas sur un échantillon propre choisi pour la démonstration.
  6. Un hébergement et une conformité compatibles. Traitement dans l'Union européenne, conformité RGPD, et une politique de rétention explicite.

Le déliassage n'est pas une fin en soi

Bien découper une liasse ne produit pas de valeur en soi. Cela produit la seule chose sur laquelle le reste peut s'appuyer : un dossier dont chaque pièce est identifiée.

C'est à partir de là que les questions utiles deviennent solubles. Le dossier est-il complet pour chacun des co-emprunteurs ? Les documents s'accordent-ils entre eux ? Une pièce a-t-elle été retouchée ? Existe-t-il un doublon déposé sous un autre nom ? Toutes supposent de savoir, sans ambiguïté, où commence et où finit chaque document.

Questions fréquentes

Quelle est la différence entre déliassage et classification ?

Le déliassage détermine les frontières entre documents à l'intérieur d'un lot : où commence et où finit chaque pièce. La classification détermine ensuite la nature de chaque document ainsi isolé (bulletin de salaire, avis d'imposition, relevé bancaire). Le déliassage vient toujours en premier, car on ne peut pas classer correctement un document dont on ignore l'étendue.

Faut-il encore utiliser des pages de séparation ?

Les intercalaires restent pertinents pour des flux papier entièrement maîtrisés, avec un centre de numérisation dédié et des opérateurs formés. Ils sont inapplicables dès que le document est déposé par le client lui-même depuis un portail, un e-mail ou un téléphone, ce qui est devenu le cas majoritaire.

Le déliassage concerne-t-il aussi les fichiers nativement numériques ?

Oui, et de plus en plus. Un PDF reçu par e-mail contient fréquemment plusieurs documents fusionnés sans qu'aucun scanner ne soit intervenu : un client qui assemble ses trois derniers bulletins de salaire en un seul fichier crée une liasse numérique. Le problème de frontières est identique.

Comment mesurer la qualité d'un déliassage ?

En comparant, sur un échantillon annoté manuellement, les frontières produites aux frontières réelles, puis en comptant les documents parfaitement délimités plutôt que les pages correctement attribuées. Un taux mesuré à la page flatte le résultat : sur des documents de cinq pages, 99 % de pages bien rattachées laisse encore environ un document sur vingt mal découpé.

Le déliassage fonctionne-t-il sur des photos prises au téléphone ?

C'est précisément le cas d'usage qui met en échec les méthodes à base de marqueurs. Une approche par vision par ordinateur s'appuie sur la mise en page, l'identité de l'émetteur, la pagination et la continuité du contenu, des signaux qui survivent à un cadrage approximatif, à une rotation ou à un éclairage inégal.

Le déliassage chez Holofin

Holofin déliasse, classe, extrait et vérifie des dossiers documentaires complets. La segmentation ne s'appuie sur aucun intercalaire ni code-barres : le modèle lit la page et décide si elle prolonge la précédente ou en ouvre une nouvelle. Chaque valeur extraite reste liée à sa position dans le document d'origine, ce qui rend le découpage vérifiable pièce par pièce.

Holofin est hébergé en Europe (infrastructure OVHcloud, France) et conforme au RGPD.

Holofin