Baidu liberó Unlimited-OCR, un modelo de reconocimiento óptico de caracteres pensado para extraer texto de documentos complejos: imágenes de alta resolución, tablas densas y archivos PDF de varias páginas. El modelo está disponible públicamente en Hugging Face, la plataforma donde los desarrolladores comparten y descargan modelos de código abierto.
El OCR (reconocimiento óptico de caracteres, por sus siglas en inglés) es la tecnología que convierte una imagen con texto —una foto, un escaneo, una página de PDF— en texto editable que una computadora puede procesar. No es nuevo, pero los documentos reales siguen siendo un reto: columnas cruzadas, tablas, notas al pie y contenido que se reparte entre varias páginas suelen romper los sistemas tradicionales.
Dos modos según la exigencia del documento
La propuesta de Baidu apunta justamente a esos casos difíciles. El modelo ofrece dos formas de trabajar. Una es un modo de alto detalle, apodado Gundam, que divide la imagen en mosaicos (una técnica conocida como tiling) para procesar por partes las páginas muy densas o de gran tamaño sin perder resolución. La otra es un modo Base, más rápido y ligero, adecuado cuando el documento es sencillo y prima la velocidad.
Esa distinción importa en la práctica. El modo por mosaicos permite leer con precisión diagramas y tablas apretadas, pero consume más cómputo; el modo Base sacrifica algo de detalle a cambio de procesar más rápido y con menos recursos. Elegir entre uno y otro es, en el fondo, un balance entre exactitud y costo de hardware.
Un flujo completo, de la imagen al texto estructurado
El interés del anuncio no está solo en el modelo, sino en el flujo de trabajo que lo rodea. Un tutorial publicado por el medio especializado MarkTechPost detalla cómo montar una tubería (o pipeline) de principio a fin: configurar el entorno con GPU, cargar el modelo, procesar imágenes y PDF de varias páginas, y manejar el contenido que se extiende de una hoja a la siguiente. El objetivo declarado es que el proceso sea reproducible, es decir, que otra persona pueda repetirlo y obtener los mismos resultados.
Para quien trabaja con volúmenes grandes de papeleo —facturas, contratos, expedientes médicos, formularios de gobierno— ese tipo de automatización resuelve un cuello de botella habitual. Digitalizar un archivo escaneado y dejarlo listo para buscar, indexar o alimentar a otro sistema suele ser un trabajo manual tedioso.
China y la ola de modelos abiertos
El lanzamiento se suma a una tendencia clara: las tecnológicas chinas vienen publicando modelos abiertos con capacidades cada vez más finas en visión y documentos. En las últimas semanas, Alibaba mostró avances en generación de imágenes con texto legible mediante su familia Qwen-Image, y la irrupción de laboratorios como DeepSeek reordenó las expectativas sobre lo que puede lograr un desarrollo fuera de Estados Unidos.
Que Unlimited-OCR esté disponible en abierto reduce la barrera de entrada para empresas y desarrolladores que hasta ahora dependían de servicios de OCR de pago. La contraparte es el requisito de hardware: los modos de mayor precisión piden GPU con capacidad suficiente, lo que sigue dejando fuera a quien solo cuenta con una computadora modesta.
El siguiente paso será ver cómo se comporta con documentos en distintos idiomas y con caligrafías o escaneos de mala calidad, donde el OCR todavía tropieza. Ahí se medirá si la promesa de leer casi cualquier documento resiste el contacto con el papeleo del mundo real.
