Quando ho costruito il viewer e lo strumento OCR del laboratorio di questo sito, pensavo che il problema principale dei PDF fosse la compatibilità tra programmi. Mi sbagliavo: il problema più frequente è che moltissimi PDF non contengono testo. Sono fotografie di pagine. Si vedono benissimo, ma per la funzione "Trova", per un motore di ricerca e soprattutto per chi usa uno screen reader sono vuoti.
Da lì ho iniziato a guardare i PDF con occhi diversi. In questo articolo raccolgo cosa rende davvero accessibile un PDF e i controlli pratici che uso io.
Il controllo che mi ha aperto gli occhi
Nel mio OCR, per ogni pagina il primo passo è chiedere al PDF il suo livello di testo. Se c'è, lo uso così com'è: è istantaneo e preciso. Solo le pagine senza testo vengono trasformate in immagine e passate al riconoscimento ottico:
const content = await page.getTextContent();
if (content.items.length === 0) {
// No text layer: this page is just a picture.
// Search, copy-paste and screen readers get nothing.
queueForOcr(page);
}
Quel controllo, nato per risparmiare tempo, è anche il test di accessibilità più semplice che esista. Nel viewer l'ho reso visibile: quando un documento non ha testo estraibile compare un avviso che suggerisce l'OCR. Senza quell'avviso l'utente cerca una parola, ottiene zero risultati e pensa che la ricerca sia rotta; ne ho parlato in questo articolo.
Cosa serve a un PDF per essere accessibile
Il testo reale è solo il primo requisito. Lo standard di riferimento è PDF/UA (ISO 14289), coerente con le linee guida WCAG. In pratica, un PDF accessibile ha:
- Testo vero, non immagini di testo.
- Tag di struttura: titoli, paragrafi, elenchi e tabelle marcati come tali, così uno screen reader sa cosa sta leggendo.
- Un ordine di lettura corretto: in un layout a due colonne, senza tag, il testo può essere letto riga per riga attraversando le colonne.
- Testo alternativo per le immagini che contengono informazioni, come grafici e schemi.
- La lingua del documento impostata, così la sintesi vocale pronuncia correttamente.
- Un titolo nei metadati, non solo il nome del file.
- Campi dei moduli con etichette, se il PDF è compilabile.
Dal giugno 2025, con l'European Accessibility Act, l'accessibilità è un obbligo per molti servizi digitali rivolti ai consumatori, e i documenti che quei servizi forniscono, come contratti e fatture in PDF, fanno parte dell'esperienza.
I controlli pratici che faccio (in cinque minuti)
- Provo a selezionare il testo e a cercare una parola con Ctrl+F. Se non succede niente, il PDF è un'immagine.
- Apro le proprietà del documento in Acrobat Reader: alla voce "PDF con tag" deve esserci "Sì", e titolo e lingua devono essere compilati.
- Uso la lettura ad alta voce del lettore PDF su una pagina a due colonne: se salta da una colonna all'altra, l'ordine di lettura è sbagliato.
- Copio una tabella e la incollo in un foglio di calcolo: se arriva come un unico blocco di testo, la struttura non c'è.
- Per un controllo completo uso PAC (PDF Accessibility Checker), gratuito, che verifica i requisiti PDF/UA uno per uno.
Un caso tipico: il modulo scansionato
Il caso che vedo più spesso è il modulo stampato, compilato a penna e riscansionato. Dal punto di vista dell'accessibilità è il peggiore possibile: nessun testo, nessuna struttura, nessun campo. L'OCR lo rende ricercabile e copiabile, ed è già un enorme passo avanti, ma non lo rende un PDF accessibile: mancano ancora tag, ordine di lettura ed etichette. Il mio strumento OCR, per esempio, estrae il testo, non ricostruisce la struttura: è il primo passo, non l'ultimo.
La vera soluzione sta a monte: pubblicare il documento originale, non la sua scansione.
Come creare PDF accessibili fin dall'inizio
- In Word o LibreOffice usa gli stili (Titolo 1, Titolo 2, elenchi veri) invece di testo ingrandito e in grassetto: diventano i tag del PDF.
- Aggiungi il testo alternativo alle immagini prima di esportare.
- Esporta con i tag attivi: in Word è l'opzione "Tag della struttura del documento per l'accessibilità" nel salvataggio in PDF.
- Evita di "stampare" in PDF tramite una stampante virtuale o da un'immagine: spesso la struttura si perde.
- Imposta titolo e lingua nelle proprietà del file.
In sintesi
Un PDF accessibile non è un PDF "speciale": è un PDF fatto bene, con testo vero, struttura, ordine di lettura, testo alternativo e lingua. Costruendo il mio OCR ho capito che il test più rivelatore è anche il più banale: provare a cercare una parola. Se non la trovi tu, non la troverà nemmeno uno screen reader. Per i documenti che hai solo in scansione, l'OCR è il primo passo per renderli almeno leggibili; per tutti gli altri, l'accessibilità si decide nel momento in cui li crei.