<link rel="stylesheet" href="/assets/fonts/jetbrains-mono/jetbrains-mono.css" />
All posts

PDF acessíveis: o que é mesmo preciso (o que aprendi a construir um OCR)

Quando construí o visualizador e a ferramenta de OCR do laboratório deste site, pensava que o principal problema dos PDF era a compatibilidade entre programas. Enganava-me: o problema mais frequente é que muitíssimos PDF não contêm texto. São fotografias de páginas. Veem-se perfeitamente, mas para a função "Procurar", para um motor de pesquisa e sobretudo para quem usa um leitor de ecrã, estão vazios.

A partir daí comecei a olhar para os PDF de outra forma. Neste artigo reúno o que torna um PDF realmente acessível e as verificações práticas que uso.

A verificação que me abriu os olhos

No meu OCR, para cada página o primeiro passo é pedir ao PDF a sua camada de texto. Se existir, uso-a tal como está: é instantânea e precisa. Só as páginas sem texto são transformadas em imagem e enviadas para o reconhecimento ótico:

const content = await page.getTextContent();
if (content.items.length === 0) {
  // No text layer: this page is just a picture.
  // Search, copy-paste and screen readers get nothing.
  queueForOcr(page);
}

Essa verificação, criada para poupar tempo, é também o teste de acessibilidade mais simples que existe. No visualizador tornei-a visível: quando um documento não tem texto extraível, aparece um aviso a sugerir o OCR. Sem ele, o utilizador procura uma palavra, obtém zero resultados e pensa que a pesquisa está avariada; falei disso neste artigo.

O que um PDF precisa para ser acessível

O texto real é só o primeiro requisito. A norma de referência é a PDF/UA (ISO 14289), coerente com as diretrizes WCAG. Na prática, um PDF acessível tem:

  • Texto verdadeiro, não imagens de texto.
  • Etiquetas de estrutura: títulos, parágrafos, listas e tabelas marcados como tal, para que um leitor de ecrã saiba o que está a ler.
  • Uma ordem de leitura correta: num layout de duas colunas sem etiquetas, o texto pode ser lido linha a linha atravessando as colunas.
  • Texto alternativo para as imagens com informação, como gráficos e esquemas.
  • O idioma do documento definido, para que a síntese de voz pronuncie corretamente.
  • Um título nos metadados, não apenas o nome do ficheiro.
  • Campos de formulário com rótulos, se o PDF for preenchível.

Desde junho de 2025, com o European Accessibility Act, a acessibilidade é obrigatória para muitos serviços digitais destinados aos consumidores, e os documentos que esses serviços fornecem, como contratos e faturas em PDF, fazem parte da experiência.

As verificações práticas que faço (em cinco minutos)

  1. Tento selecionar o texto e procurar uma palavra com Ctrl+F. Se nada acontecer, o PDF é uma imagem.
  2. Abro as propriedades do documento no Acrobat Reader: em "PDF marcado" deve aparecer "Sim", e o título e o idioma devem estar preenchidos.
  3. Uso a leitura em voz alta do leitor de PDF numa página de duas colunas: se saltar de uma coluna para a outra, a ordem de leitura está errada.
  4. Copio uma tabela e colo-a numa folha de cálculo: se chegar como um único bloco de texto, a estrutura não existe.
  5. Para uma verificação completa uso o PAC (PDF Accessibility Checker), gratuito, que verifica os requisitos PDF/UA um a um.

Um caso típico: o formulário digitalizado

O caso que vejo mais vezes é o formulário impresso, preenchido à mão e digitalizado de novo. Do ponto de vista da acessibilidade é o pior possível: sem texto, sem estrutura, sem campos. O OCR torna-o pesquisável e copiável, o que já é um enorme passo em frente, mas não o transforma num PDF acessível: continuam a faltar as etiquetas, a ordem de leitura e os rótulos. A minha ferramenta de OCR, por exemplo, extrai o texto mas não reconstrói a estrutura: é o primeiro passo, não o último.

A verdadeira solução está na origem: publicar o documento original, não a sua digitalização.

Como criar PDF acessíveis desde o início

  • No Word ou no LibreOffice usa estilos (Título 1, Título 2, listas verdadeiras) em vez de texto ampliado e a negrito: tornam-se as etiquetas do PDF.
  • Acrescenta texto alternativo às imagens antes de exportar.
  • Exporta com as etiquetas ativas: no Word é a opção "Etiquetas da estrutura do documento para acessibilidade" ao guardar em PDF.
  • Evita "imprimir" para PDF através de uma impressora virtual ou a partir de uma imagem: muitas vezes a estrutura perde-se.
  • Define o título e o idioma nas propriedades do ficheiro.

Em resumo

Um PDF acessível não é um PDF "especial": é um PDF bem feito, com texto verdadeiro, estrutura, ordem de leitura, texto alternativo e idioma. Ao construir o meu OCR percebi que o teste mais revelador é também o mais banal: tentar procurar uma palavra. Se tu não a encontras, um leitor de ecrã também não. Para os documentos que só tens digitalizados, o OCR é o primeiro passo para os tornar pelo menos legíveis; para todos os outros, a acessibilidade decide-se no momento em que os crias.

💬 Notas dos leitores

0 notas

Escreva uma nota

Partilhe a sua opinião, uma sugestão ou um elogio

Notas recentes

Ainda não há notas. Seja o primeiro a comentar!