OCR en documentos borrosos o manchados: cómo recuperar la información
Un escaneado ilegible no tiene por qué ser un documento perdido. Te explicamos cómo limpiar imágenes y ajustar el OCR para rescatar la información, incluso con originales en mal estado.
Si el OCR no reconoce un documento escaneado por estar borroso o manchado, no lo tires: con ajustes básicos en la imagen y en la herramienta de lectura, puedes recuperar hasta el 90% del texto. El truco está en preparar el archivo antes de pasarlo por el OCR.
1. Limpia la imagen antes de procesarla
El OCR falla cuando no distingue bien los caracteres. Si el escaneado tiene manchas, sombras o está desenfocado, prueba estos pasos:
- Aumenta el contraste: Usa herramientas gratuitas como GIMP o Photoshop Express para ajustar niveles. Sube el contraste al máximo y baja el brillo hasta que el texto destaque sobre el fondo. En documentos muy sucios, prueba el modo "blanco y negro" (no escala de grises).
- Elimina ruido: Filtros como "desenfocar" o "reducción de ruido" (en GIMP: Filtros > Mejorar > Reducir ruido) suavizan manchas sin borrar el texto. Si hay líneas o sellos que estorban, usa la herramienta "clonar" para taparlos con el color del fondo.
- Recorta márgenes: Elimina bordes blancos o zonas dañadas que no contengan texto. Cuanto más limpio sea el área de lectura, menos errores cometerá el OCR.
Ejemplo real: en una factura escaneada con manchas de café, recortar los bordes y aplicar un filtro de contraste recuperó el 85% del texto que el OCR inicial no detectaba.
2. Ajusta la resolución y el formato del escaneado
El OCR necesita imágenes nítidas. Si el documento original está arrugado o la resolución es baja, estos ajustes ayudan:
- Resolución mínima: Escanea a 300 ppp (puntos por pulgada). Menos de eso, y el texto se pixela. Si el original es muy pequeño (como un recibo), sube a 400 ppp.
- Formato sin compresión: Guarda el archivo en TIFF o PNG (sin pérdida de calidad). Evita JPEG, que comprime la imagen y añade artefactos que confunden al OCR.
- Escaneo en color: Aunque el documento sea en blanco y negro, escanea en color para capturar mejor los matices. Luego, conviértelo a escala de grises o blanco y negro en el postprocesado.
Detalle técnico: un escaneado a 200 ppp de un contrato en papel fino puede perder hasta un 30% de los caracteres en el OCR, mientras que a 300 ppp la tasa de error baja al 5%.
3. Elige el OCR adecuado y configúralo
No todos los OCR son iguales. Algunas herramientas permiten ajustar parámetros para documentos difíciles:
- Herramientas con preprocesado integrado: Adobe Acrobat Pro o ABBYY FineReader incluyen opciones para «documentos de baja calidad». Actívalas antes de procesar.
- Idioma y diccionario: Configura el OCR en el idioma del documento (ej.: español con diccionario de términos legales o técnicos). Esto reduce errores en palabras poco comunes.
- Modo «texto impreso» vs. «texto manuscrito»: Si el documento tiene anotaciones a mano, usa el modo mixto (en ABBYY: Herramientas > Opciones > Reconocimiento > Modo mixto).
Prueba práctica: en un albarán con sellos superpuestos, ABBYY FineReader con el modo «documento dañado» recuperó el 95% del texto, frente al 60% de un OCR genérico.
Si el documento es crítico (como un contrato o una factura fiscal), digitalízalo dos veces: una en color a 300 ppp y otra en blanco y negro a 400 ppp. Combina los resultados del OCR de ambas versiones para minimizar errores.
4. Cuando el OCR falla: alternativas manuales
Si después de todo el OCR sigue sin reconocer partes del texto, prueba esto:
- Divide la imagen: Recorta el documento en secciones más pequeñas (ej.: por párrafos) y procesa cada una por separado. A veces, el OCR se bloquea con páginas muy densas.
- Usa herramientas de IA especializadas: Plataformas como Google Cloud Vision o Amazon Textract tienen modelos entrenados para documentos complejos. Sube la imagen y compara resultados con tu OCR habitual.
- Revisión humana + IA: Si el texto es breve (como una matrícula o un número de serie), usa una herramienta de RAG para que la IA complete los huecos con contexto. Por ejemplo, si falta un dígito en una factura, el sistema puede inferirlo si tiene acceso al histórico de proveedores.
Ejemplo: en una pyme industrial, un manual técnico escaneado con páginas amarillentas se procesó con Amazon Textract, que reconoció símbolos y fórmulas que el OCR tradicional ignoraba. Más sobre IA para manuales técnicos aquí.
Si el problema es recurrente (como en asesorías o inmobiliarias con archivos antiguos), valora digitalizar los documentos con un escáner profesional y luego aplicar estas técnicas. Cómo la IA puede ayudarte a gestionar esos archivos.
¿Quieres saber cómo encaja en tu empresa?
Te hacemos un diagnóstico gratuito: revisamos tu caso y te decimos qué se puede automatizar y cuánto tiempo ahorrarías. Sin compromiso.
Solicitar diagnóstico gratuito →