<link rel="stylesheet" href="/assets/fonts/jetbrains-mono/jetbrains-mono.css" />
All posts

PDF accesibles: qué hace falta de verdad (lo que aprendí construyendo un OCR)

Cuando construí el visor y la herramienta de OCR del laboratorio de esta web, pensaba que el principal problema de los PDF era la compatibilidad entre programas. Me equivocaba: el problema más frecuente es que muchísimos PDF no contienen texto. Son fotos de páginas. Se ven perfectamente, pero para la función "Buscar", para un buscador y sobre todo para quien usa un lector de pantalla, están vacíos.

A partir de ahí empecé a mirar los PDF de otra manera. En este artículo reúno lo que hace realmente accesible un PDF y las comprobaciones prácticas que uso.

La comprobación que me abrió los ojos

En mi OCR, para cada página el primer paso es pedirle al PDF su capa de texto. Si existe, la uso tal cual: es instantánea y precisa. Solo las páginas sin texto se convierten en imagen y pasan al reconocimiento óptico:

const content = await page.getTextContent();
if (content.items.length === 0) {
  // No text layer: this page is just a picture.
  // Search, copy-paste and screen readers get nothing.
  queueForOcr(page);
}

Esa comprobación, pensada para ahorrar tiempo, es también la prueba de accesibilidad más sencilla que existe. En el visor la hice visible: cuando un documento no tiene texto extraíble, aparece un aviso que sugiere el OCR. Sin él, el usuario busca una palabra, obtiene cero resultados y piensa que la búsqueda está rota; lo conté en este artículo.

Qué necesita un PDF para ser accesible

El texto real es solo el primer requisito. La norma de referencia es PDF/UA (ISO 14289), coherente con las pautas WCAG. En la práctica, un PDF accesible tiene:

  • Texto real, no imágenes de texto.
  • Etiquetas de estructura: títulos, párrafos, listas y tablas marcados como tales, para que un lector de pantalla sepa qué está leyendo.
  • Un orden de lectura correcto: en un diseño a dos columnas sin etiquetas, el texto puede leerse línea a línea atravesando las columnas.
  • Texto alternativo para las imágenes que contienen información, como gráficos y esquemas.
  • El idioma del documento definido, para que la síntesis de voz pronuncie correctamente.
  • Un título en los metadatos, no solo el nombre del archivo.
  • Campos de formulario con etiquetas, si el PDF es rellenable.

Desde junio de 2025, con el European Accessibility Act, la accesibilidad es obligatoria para muchos servicios digitales dirigidos a consumidores, y los documentos que esos servicios proporcionan, como contratos y facturas en PDF, forman parte de la experiencia.

Las comprobaciones prácticas que hago (en cinco minutos)

  1. Intento seleccionar el texto y buscar una palabra con Ctrl+F. Si no pasa nada, el PDF es una imagen.
  2. Abro las propiedades del documento en Acrobat Reader: en "PDF etiquetado" debe aparecer "Sí", y el título y el idioma deben estar rellenados.
  3. Uso la lectura en voz alta del lector de PDF en una página a dos columnas: si salta de una columna a otra, el orden de lectura es incorrecto.
  4. Copio una tabla y la pego en una hoja de cálculo: si llega como un único bloque de texto, no hay estructura.
  5. Para una comprobación completa uso PAC (PDF Accessibility Checker), gratuito, que verifica los requisitos PDF/UA uno por uno.

Un caso típico: el formulario escaneado

El caso que veo más a menudo es el formulario impreso, rellenado a mano y vuelto a escanear. Desde el punto de vista de la accesibilidad es el peor posible: sin texto, sin estructura, sin campos. El OCR lo hace buscable y copiable, lo que ya es un gran paso adelante, pero no lo convierte en un PDF accesible: siguen faltando las etiquetas, el orden de lectura y los rótulos. Mi herramienta de OCR, por ejemplo, extrae el texto pero no reconstruye la estructura: es el primer paso, no el último.

La verdadera solución está en el origen: publicar el documento original, no su escaneo.

Cómo crear PDF accesibles desde el principio

  • En Word o LibreOffice usa estilos (Título 1, Título 2, listas reales) en lugar de texto ampliado y en negrita: se convierten en las etiquetas del PDF.
  • Añade texto alternativo a las imágenes antes de exportar.
  • Exporta con las etiquetas activadas: en Word es la opción "Etiquetas de la estructura del documento para accesibilidad" al guardar como PDF.
  • Evita "imprimir" a PDF mediante una impresora virtual o desde una imagen: a menudo se pierde la estructura.
  • Define el título y el idioma en las propiedades del archivo.

En resumen

Un PDF accesible no es un PDF "especial": es un PDF bien hecho, con texto real, estructura, orden de lectura, texto alternativo e idioma. Construyendo mi OCR entendí que la prueba más reveladora es también la más trivial: intentar buscar una palabra. Si tú no la encuentras, tampoco la encontrará un lector de pantalla. Para los documentos que solo tienes escaneados, el OCR es el primer paso para hacerlos al menos legibles; para todos los demás, la accesibilidad se decide en el momento en que los creas.

💬 Notas de los lectores

0 notas

Escribe una nota

Comparte tu opinión, una sugerencia o un cumplido

Últimas notas

Aún no hay notas. ¡Sé el primero en comentar!