Déterminer d'abord le type de relevé
Vérifiez si le PDF est textuel ou scanné. Le texte est extrait directement ; les scans nécessitent l'OCR.
Notes de terrain
Ces méthodes suivent les problèmes courants des relevés réels, dans l'ordre de traitement.
Vérifiez si le PDF est textuel ou scanné. Le texte est extrait directement ; les scans nécessitent l'OCR.
La plupart des relevés ont des lignes. Le système détecte les tableaux, nettoie les cellules vides et supprime les en-têtes répétés.
Date | Description | Debit | Credit | Balance 2026-07-03 | ACME PAYROLL | | 4,500.00| 14,500.00 2026-07-05 | OFFICE RENT | 2,400.00| | 12,100.00
Certains relevés n'utilisent que la position. Le parseur découpe les lignes et utilise les coordonnées pour trouver les colonnes.
2026-07-11 SUPPLIER PAYMENT 3,150.00 15,750.00 2026-07-15 ATM WITHDRAWAL 500.00 15,250.00 2026-07-18 REFUND - TAX 220.50 15,470.50
Les scans contiennent des images. L'OCR doit s'exécuter en premier.
Le texte vient de PDF. Les exports évitent les formules et utilisent UTF-8 BOM.
Les causes courantes sont les scans, les pages image ou les outils de sécurité. Solutions : OCR ou régénérer le PDF.