<link rel="stylesheet" href="/assets/fonts/jetbrains-mono/jetbrains-mono.css" />
All posts

PDF accessibles : ce qu'il faut vraiment (ce que j'ai appris en construisant un OCR)

Quand j'ai construit la visionneuse et l'outil OCR du laboratoire de ce site, je pensais que le principal problème des PDF était la compatibilité entre logiciels. Je me trompais : le problème le plus fréquent, c'est que énormément de PDF ne contiennent aucun texte. Ce sont des photos de pages. Elles s'affichent parfaitement, mais pour la fonction « Rechercher », pour un moteur de recherche et surtout pour les personnes qui utilisent un lecteur d'écran, elles sont vides.

Depuis, je regarde les PDF autrement. Dans cet article, je rassemble ce qui rend vraiment un PDF accessible et les vérifications pratiques que j'utilise.

La vérification qui m'a ouvert les yeux

Dans mon OCR, pour chaque page, la première étape consiste à demander au PDF sa couche de texte. Si elle existe, je l'utilise telle quelle : c'est instantané et précis. Seules les pages sans texte sont converties en image et envoyées à la reconnaissance optique :

const content = await page.getTextContent();
if (content.items.length === 0) {
  // No text layer: this page is just a picture.
  // Search, copy-paste and screen readers get nothing.
  queueForOcr(page);
}

Cette vérification, pensée pour gagner du temps, est aussi le test d'accessibilité le plus simple qui soit. Dans la visionneuse, je l'ai rendue visible : quand un document n'a pas de texte extractible, un message suggère l'OCR. Sans lui, l'utilisateur cherche un mot, obtient zéro résultat et croit que la recherche est cassée ; j'en ai parlé dans cet article.

Ce qu'il faut à un PDF pour être accessible

Le texte réel n'est que la première exigence. La norme de référence est PDF/UA (ISO 14289), cohérente avec les règles WCAG. En pratique, un PDF accessible possède :

  • Du vrai texte, pas des images de texte.
  • Des balises de structure : titres, paragraphes, listes et tableaux marqués comme tels, pour qu'un lecteur d'écran sache ce qu'il lit.
  • Un ordre de lecture correct : dans une mise en page à deux colonnes sans balises, le texte peut être lu ligne par ligne en traversant les colonnes.
  • Un texte alternatif pour les images porteuses d'information, comme les graphiques et les schémas.
  • La langue du document définie, pour que la synthèse vocale prononce correctement.
  • Un titre dans les métadonnées, pas seulement le nom du fichier.
  • Des champs de formulaire étiquetés, si le PDF est remplissable.

Depuis juin 2025, avec l'European Accessibility Act, l'accessibilité est obligatoire pour de nombreux services numériques destinés aux consommateurs, et les documents fournis par ces services, comme les contrats et factures en PDF, font partie de l'expérience.

Les vérifications pratiques que je fais (en cinq minutes)

  1. J'essaie de sélectionner le texte et de chercher un mot avec Ctrl+F. Si rien ne se passe, le PDF est une image.
  2. J'ouvre les propriétés du document dans Acrobat Reader : « PDF balisé » doit indiquer « Oui », et le titre et la langue doivent être renseignés.
  3. J'utilise la lecture à voix haute du lecteur PDF sur une page à deux colonnes : s'il saute d'une colonne à l'autre, l'ordre de lecture est faux.
  4. Je copie un tableau et je le colle dans un tableur : s'il arrive en un seul bloc de texte, la structure est absente.
  5. Pour un contrôle complet, j'utilise PAC (PDF Accessibility Checker), gratuit, qui vérifie les exigences PDF/UA une par une.

Un cas typique : le formulaire numérisé

Le cas que je rencontre le plus souvent est le formulaire imprimé, rempli à la main puis numérisé. Du point de vue de l'accessibilité, c'est le pire possible : pas de texte, pas de structure, pas de champs. L'OCR le rend consultable et copiable, ce qui est déjà un énorme progrès, mais cela n'en fait pas un PDF accessible : il manque toujours les balises, l'ordre de lecture et les étiquettes. Mon outil OCR, par exemple, extrait le texte mais ne reconstruit pas la structure : c'est la première étape, pas la dernière.

La vraie solution se trouve en amont : publier le document original, pas sa numérisation.

Créer des PDF accessibles dès le départ

  • Dans Word ou LibreOffice, utilisez les styles (Titre 1, Titre 2, vraies listes) plutôt que du texte agrandi et en gras : ils deviennent les balises du PDF.
  • Ajoutez un texte alternatif aux images avant d'exporter.
  • Exportez avec les balises activées : dans Word, c'est l'option « Balises de structure de document pour l'accessibilité » lors de l'enregistrement en PDF.
  • Évitez d'« imprimer » en PDF via une imprimante virtuelle ou à partir d'une image : la structure se perd souvent.
  • Définissez le titre et la langue dans les propriétés du fichier.

En résumé

Un PDF accessible n'est pas un PDF « spécial » : c'est un PDF bien fait, avec du vrai texte, une structure, un ordre de lecture, des textes alternatifs et une langue. En construisant mon OCR, j'ai compris que le test le plus révélateur est aussi le plus banal : essayer de chercher un mot. Si vous ne le trouvez pas, un lecteur d'écran ne le trouvera pas non plus. Pour les documents que vous n'avez qu'en version numérisée, l'OCR est la première étape pour les rendre au moins lisibles ; pour tous les autres, l'accessibilité se décide au moment où vous les créez.

💬 Notes des lecteurs

0 notes

Écrire une note

Partagez votre avis, une suggestion ou un compliment

Dernières notes

Aucune note pour le moment. Soyez le premier à commenter !