Recebe um PDF, abre-o, tenta procurar uma palavra: zero resultados. Tenta selecionar uma linha com o rato: não seleciona. O documento está ali, lê-se perfeitamente com os olhos, mas para o computador é uma fotografia. É a situação em que é preciso o OCR — o reconhecimento ótico de caracteres — e o momento em que a maioria das pessoas descobre que o resultado depende muito mais da imagem de partida do que do software.
O que o OCR faz realmente (e porque não "lê")
Um motor de OCR não compreende o texto: reconstrói-o. O processo passa por fases mecânicas — localizar as zonas de texto, endireitar a imagem, isolar as linhas, depois as palavras, depois os caracteres — e só no fim compara cada forma com os modelos de letra que conhece, escolhendo o mais provável.
Isto explica os erros típicos, que à primeira vista parecem absurdos: rn lido como m, 0 confundido com O, 1 com l. Não são erros de compreensão, são erros de semelhança visual. Uma pessoa corrige-os automaticamente graças ao contexto; o motor de OCR, que raciocina sobre a forma antes do sentido, não.
A qualidade da imagem conta mais do que o software
É a parte contraintuitiva: mudar de motor de OCR melhora pouco, melhorar a digitalização melhora imenso. Os fatores que pesam mesmo, por ordem de impacto:
| Fator | Problema | Solução |
|---|---|---|
| Resolução | Abaixo de 200 PPP os caracteres pequenos empastam | Digitalizar a 300 PPP, o padrão de facto |
| Contraste | Papel amarelecido ou foto em penumbra: letras e fundo confundem-se | Preto e branco ou aumento de contraste antes do processamento |
| Inclinação | Linhas tortas: o motor segmenta-as mal | Endireitar a imagem, mesmo que só uns graus |
| Sombras e curvatura | Foto de um livro aberto: o texto deforma-se para a dobra | Fotografar com luz difusa e a página achatada |
Uma foto tirada à pressa com o telemóvel, torta e com a sombra da mão por cima, dá resultados medíocres com qualquer motor. Vale a pena repetir a captura: o scanner por câmara aplica endireitamento, recorte e filtros de contraste antes mesmo de o ficheiro chegar ao reconhecimento, e é quase sempre a diferença entre um texto utilizável e outro para reescrever à mão.
A pontuação de fiabilidade: o dado mais útil e mais ignorado
Cada página processada recebe um valor de confiança, ou seja, quanto o motor considera fiável a sua própria leitura. É a informação mais valiosa de todo o processo e quase ninguém repara nela.
A regra prática: acima de 90% o texto é geralmente fiável e basta relê-lo; entre 70% e 90% há erros dispersos a corrigir; abaixo de 70% compensa repetir a captura em vez de perder tempo a corrigir. Uma pontuação baixa numa única página em vinte indica quase sempre um problema físico dessa página — uma dobra, uma sombra, uma nódoa — e não um limite do sistema.
Como extrair o texto, passo a passo
- Abra o OCR online gratuito — sem registo.
- Carregue os ficheiros: imagens
PNG,JPG,WEBP,BMP,TIFFou PDF, incluindo digitalizados. Até 15 MB por ficheiro e 30 ficheiros de cada vez. - Selecione a língua certa antes de iniciar. É o passo que mais influencia a precisão: estão disponíveis português, inglês, italiano, espanhol, francês, alemão e albanês.
- Inicie o reconhecimento e verifique a pontuação de fiabilidade página a página.
- Copie o texto ou envie-o para o workspace para o passar a outra ferramenta — normalmente um resumo ou uma tradução — sem voltar a carregar nada.
Onde o OCR falha de forma sistemática
- A língua errada estraga tudo. Um texto português processado como inglês perde acentos e cedilhas de forma sistemática, porque o motor procura formas que em português não existem.
- As tabelas tornam-se texto linear. As células são lidas umas a seguir às outras: os valores estão lá, a relação linha-coluna não.
- As colunas múltiplas misturam-se. Em jornais e revistas o texto pode ser reconstruído atravessando as colunas em vez de as seguir.
- O itálico e os tipos decorativos têm taxas de erro muito superiores às de um tipo de letra regular.
- A escrita à mão é outra tecnologia. O OCR clássico reconhece caracteres impressos; o manuscrito exige modelos diferentes e continua pouco fiável.
Perguntas frequentes
Que formatos posso carregar?
Imagens em PNG, JPG, WEBP, BMP e TIFF, além de PDF, incluindo digitalizados sem texto selecionável. O limite é de 15 MB por ficheiro, até 30 ficheiros por processamento.
Que línguas reconhece?
Sete: português, inglês, italiano, espanhol, francês, alemão e albanês. A língua deve ser escolhida antes do processamento, porque orienta o motor no reconhecimento de caracteres acentuados e combinações típicas dessa língua.
Como sei se um PDF precisa de OCR?
Tente selecionar uma palavra com o rato ou procurar um termo com Ctrl+F. Se a seleção não funcionar e a procura não encontrar nada mesmo em palavras visivelmente presentes, o PDF contém imagens e precisa de OCR.
Posso usar o OCR numa foto tirada com o telemóvel?
Sim, e é um dos usos mais comuns. O resultado melhora bastante se a página estiver enquadrada direita, bem iluminada e sem sombras: passar primeiro pelo scanner, que endireita e aumenta o contraste, dá quase sempre um texto mais limpo.
Em resumo
O OCR transforma uma imagem de texto em texto verdadeiro, e é o pré-requisito de quase tudo o resto: procurar dentro de um documento, traduzi-lo, resumi-lo, convertê-lo. A precisão depende sobretudo de três coisas, por esta ordem: qualidade da captura, língua corretamente selecionada e verificação da pontuação de fiabilidade antes de confiar no resultado. O OCR gratuito online aceita imagens e PDF até 15 MB em sete línguas; se o documento ainda estiver em papel convém começar pelo scanner, e daí o texto pode seguir para as restantes ferramentas PDF e IA.