Recibes un PDF, lo abres, intentas buscar una palabra: cero resultados. Pruebas a seleccionar una línea con el ratón: no se selecciona. El documento está ahí, se lee perfectamente con los ojos, pero para el ordenador es una fotografía. Es la situación en la que hace falta el OCR —el reconocimiento óptico de caracteres— y el momento en que la mayoría descubre que el resultado depende mucho más de la imagen de partida que del software.
Qué hace realmente el OCR (y por qué no "lee")
Un motor OCR no entiende el texto: lo reconstruye. El proceso pasa por fases mecánicas —localizar las zonas de texto, enderezar la imagen, aislar las líneas, luego las palabras, luego los caracteres— y solo al final compara cada forma con los modelos de letra que conoce, eligiendo el más probable.
Eso explica los errores típicos, que a primera vista parecen absurdos: rn leído como m, 0 confundido con O, 1 con l. No son errores de comprensión, son errores de semejanza visual. Una persona los corrige automáticamente gracias al contexto; el motor OCR, que razona sobre la forma antes que sobre el sentido, no.
La calidad de la imagen importa más que el software
Esta es la parte contraintuitiva: cambiar de motor OCR mejora poco, mejorar el escaneo mejora muchísimo. Los factores que pesan de verdad, por orden de impacto:
| Factor | Problema | Remedio |
|---|---|---|
| Resolución | Por debajo de 200 PPP los caracteres pequeños se empastan | Escanear a 300 PPP, el estándar de facto |
| Contraste | Papel amarillento o foto en penumbra: letras y fondo se confunden | Blanco y negro o aumento de contraste antes de procesar |
| Inclinación | Líneas torcidas: el motor las segmenta mal | Enderezar la imagen, aunque sea unos pocos grados |
| Sombras y curvatura | Foto de un libro abierto: el texto se deforma hacia el lomo | Fotografiar con luz difusa y la página aplanada |
Una foto hecha deprisa con el móvil, torcida y con la sombra de la mano encima, da resultados mediocres con cualquier motor. Merece la pena repetir la captura: el escáner desde la cámara aplica enderezado, recorte y filtros de contraste antes incluso de que el archivo llegue al reconocimiento, y esa suele ser la diferencia entre un texto utilizable y otro que habrá que reescribir a mano.
La puntuación de fiabilidad: el dato más útil y más ignorado
Cada página procesada recibe un valor de confianza, es decir, cuánto considera el motor que su propia lectura es fiable. Es la información más valiosa de todo el proceso y casi nadie la mira.
La regla práctica: por encima del 90% el texto suele ser fiable y basta con releerlo; entre el 70% y el 90% hay errores dispersos que corregir; por debajo del 70% conviene repetir la captura en lugar de perder tiempo corrigiendo. Una puntuación baja en una sola página de veinte indica casi siempre un problema físico de esa página —un pliegue, una sombra, una mancha— y no un límite del sistema.
Cómo extraer el texto, paso a paso
- Abre el OCR en línea gratuito: sin registro.
- Sube los archivos: imágenes
PNG,JPG,WEBP,BMP,TIFFo PDF, también escaneados. Hasta 15 MB por archivo y 30 archivos por vez. - Selecciona el idioma correcto antes de empezar. Es el paso que más influye en la precisión: están disponibles español, inglés, italiano, francés, alemán, portugués y albanés.
- Lanza el reconocimiento y revisa la puntuación de fiabilidad página por página.
- Copia el texto o envíalo al workspace para pasarlo a otra herramienta —normalmente un resumen o una traducción— sin volver a subir nada.
Dónde falla el OCR de forma sistemática
- El idioma equivocado lo estropea todo. Un texto español procesado como inglés pierde tildes y eñes de forma sistemática, porque el motor busca formas que en español no existen.
- Las tablas se convierten en texto lineal. Las celdas se leen una tras otra: los valores están, la relación fila-columna no.
- Las columnas múltiples se mezclan. En periódicos y revistas el texto puede reconstruirse atravesando las columnas en lugar de seguirlas.
- La cursiva y las tipografías decorativas tienen tasas de error mucho más altas que una tipografía regular.
- La escritura a mano es otra tecnología. El OCR clásico reconoce caracteres impresos; el manuscrito requiere modelos distintos y sigue siendo poco fiable.
Preguntas frecuentes
¿Qué formatos puedo subir?
Imágenes en PNG, JPG, WEBP, BMP y TIFF, además de PDF, incluidos los escaneados que no contienen texto seleccionable. El límite es de 15 MB por archivo, hasta 30 archivos por procesamiento.
¿Qué idiomas reconoce?
Siete: español, inglés, italiano, francés, alemán, portugués y albanés. El idioma debe elegirse antes de procesar, porque guía al motor en el reconocimiento de caracteres acentuados y combinaciones típicas de esa lengua.
¿Cómo sé si un PDF necesita OCR?
Intenta seleccionar una palabra con el ratón o buscar un término con Ctrl+F. Si la selección no funciona y la búsqueda no encuentra nada incluso con palabras visiblemente presentes, el PDF contiene imágenes y hace falta OCR.
¿Puedo usar el OCR con una foto hecha con el móvil?
Sí, y es uno de los usos más habituales. El resultado mejora bastante si la página está encuadrada recta, bien iluminada y sin sombras: pasar primero por el escáner, que endereza y aumenta el contraste, casi siempre da un texto más limpio.
En resumen
El OCR convierte una imagen de texto en texto real, y es el requisito previo de casi todo lo demás: buscar dentro de un documento, traducirlo, resumirlo, convertirlo. La precisión depende sobre todo de tres cosas, en este orden: calidad de la captura, idioma seleccionado correctamente y revisión de la puntuación de fiabilidad antes de fiarse del resultado. El OCR gratuito en línea acepta imágenes y PDF de hasta 15 MB en siete idiomas; si el documento sigue en papel conviene empezar por el escáner, y desde ahí el texto puede seguir hacia las demás herramientas PDF e IA.