<link rel="stylesheet" href="/assets/fonts/jetbrains-mono/jetbrains-mono.css" />
All posts

Barrierefreie PDFs: Was wirklich nötig ist (was ich beim Bau eines OCR-Tools gelernt habe)

Als ich den Viewer und das OCR-Tool im Labor dieser Website gebaut habe, dachte ich, das Hauptproblem von PDFs sei die Kompatibilität zwischen Programmen. Falsch gedacht: Das häufigste Problem ist, dass sehr viele PDFs überhaupt keinen Text enthalten. Es sind Fotos von Seiten. Sie sehen einwandfrei aus, aber für die Suchfunktion, für Suchmaschinen und vor allem für Menschen mit Screenreader sind sie leer.

Seitdem betrachte ich PDFs anders. In diesem Artikel fasse ich zusammen, was ein PDF wirklich barrierefrei macht, und welche praktischen Prüfungen ich nutze.

Die Prüfung, die mir die Augen geöffnet hat

In meinem OCR-Tool frage ich für jede Seite zuerst die Textebene des PDFs ab. Ist sie vorhanden, verwende ich sie direkt: Das geht sofort und ist präzise. Nur Seiten ohne Text werden in ein Bild umgewandelt und an die Texterkennung übergeben:

const content = await page.getTextContent();
if (content.items.length === 0) {
  // No text layer: this page is just a picture.
  // Search, copy-paste and screen readers get nothing.
  queueForOcr(page);
}

Diese Prüfung, eigentlich gedacht, um Zeit zu sparen, ist zugleich der einfachste Barrierefreiheitstest überhaupt. Im Viewer habe ich sie sichtbar gemacht: Hat ein Dokument keinen extrahierbaren Text, erscheint ein Hinweis, der OCR vorschlägt. Ohne ihn sucht der Nutzer nach einem Wort, bekommt null Treffer und hält die Suche für kaputt; mehr dazu in diesem Artikel.

Was ein PDF braucht, um barrierefrei zu sein

Echter Text ist nur die erste Anforderung. Der maßgebliche Standard ist PDF/UA (ISO 14289), abgestimmt auf die WCAG-Richtlinien. In der Praxis hat ein barrierefreies PDF:

  • Echten Text, keine Bilder von Text.
  • Struktur-Tags: Überschriften, Absätze, Listen und Tabellen sind als solche ausgezeichnet, damit ein Screenreader weiß, was er liest.
  • Eine korrekte Lesereihenfolge: Bei einem zweispaltigen Layout ohne Tags wird der Text womöglich Zeile für Zeile quer über die Spalten gelesen.
  • Alternativtext für Bilder mit Informationsgehalt, etwa Diagramme und Grafiken.
  • Eine festgelegte Dokumentsprache, damit die Sprachausgabe richtig ausspricht.
  • Einen Titel in den Metadaten, nicht nur den Dateinamen.
  • Beschriftete Formularfelder, wenn das PDF ausfüllbar ist.

Seit Juni 2025 ist Barrierefreiheit durch den European Accessibility Act für viele digitale Dienste für Verbraucher Pflicht – und die Dokumente, die diese Dienste bereitstellen, etwa Verträge und Rechnungen als PDF, gehören zur Nutzererfahrung dazu.

Die praktischen Prüfungen, die ich mache (in fünf Minuten)

  1. Ich versuche, Text zu markieren und mit Strg+F ein Wort zu suchen. Passiert nichts, ist das PDF ein Bild.
  2. Ich öffne die Dokumenteigenschaften im Acrobat Reader: Bei „PDF mit Tags“ muss „Ja“ stehen, Titel und Sprache müssen ausgefüllt sein.
  3. Ich nutze die Vorlesefunktion des PDF-Readers auf einer zweispaltigen Seite: Springt sie zwischen den Spalten, ist die Lesereihenfolge falsch.
  4. Ich kopiere eine Tabelle und füge sie in eine Tabellenkalkulation ein: Kommt sie als ein einziger Textblock an, fehlt die Struktur.
  5. Für eine vollständige Prüfung nutze ich PAC (PDF Accessibility Checker), kostenlos, der die PDF/UA-Anforderungen einzeln prüft.

Ein typischer Fall: das eingescannte Formular

Der Fall, den ich am häufigsten sehe, ist das ausgedruckte, von Hand ausgefüllte und wieder eingescannte Formular. Aus Sicht der Barrierefreiheit das Schlechteste, was es gibt: kein Text, keine Struktur, keine Felder. OCR macht es durchsuchbar und kopierbar – schon ein großer Fortschritt –, aber es macht daraus kein barrierefreies PDF: Tags, Lesereihenfolge und Beschriftungen fehlen weiterhin. Mein OCR-Tool zum Beispiel extrahiert den Text, rekonstruiert aber nicht die Struktur: Es ist der erste Schritt, nicht der letzte.

Die eigentliche Lösung liegt davor: das Originaldokument veröffentlichen, nicht seinen Scan.

Barrierefreie PDFs von Anfang an erstellen

  • Nutze in Word oder LibreOffice Formatvorlagen (Überschrift 1, Überschrift 2, echte Listen) statt vergrößertem Fettdruck: Daraus werden die Tags des PDFs.
  • Füge Bildern vor dem Export Alternativtext hinzu.
  • Exportiere mit aktivierten Tags: In Word ist das die Option „Dokumentstrukturtags für Barrierefreiheit“ beim Speichern als PDF.
  • Vermeide es, über einen virtuellen Drucker oder aus einem Bild in PDF zu „drucken“: Die Struktur geht dabei oft verloren.
  • Lege Titel und Sprache in den Dateieigenschaften fest.

Fazit

Ein barrierefreies PDF ist kein „besonderes“ PDF: Es ist ein gut gemachtes PDF, mit echtem Text, Struktur, Lesereihenfolge, Alternativtext und Sprache. Beim Bau meines OCR-Tools habe ich gelernt, dass der aufschlussreichste Test zugleich der banalste ist: nach einem Wort suchen. Findest du es nicht, findet es auch kein Screenreader. Für Dokumente, die nur als Scan vorliegen, ist OCR der erste Schritt, um sie wenigstens lesbar zu machen; bei allen anderen entscheidet sich die Barrierefreiheit in dem Moment, in dem du sie erstellst.

💬 Leser-Notizen

0 Notizen

Notiz schreiben

Teile deine Meinung, einen Vorschlag oder ein Kompliment

Neueste Notizen

Noch keine Notizen. Sei der Erste, der kommentiert!