Saltar al contenido
Inteligencia Artificial

Marker 2 supera a MinerU y Docling en precisión y velocidad

25 julio, 2026Marcela Osorio11 min de lectura2 comentarios
Keyword Marker 211 min de lecturaActualizado hace 3 días

La nueva versión de Marker mejora la conversión de documentos con tres modos de procesamiento, soporte para CPU y una arquitectura capaz de alcanzar 2,9 páginas por segundo en una GPU B200. El benchmark también expone las fortalezas y límites de MinerU, Docling y LiteParse.

Marker 2 supera a MinerU y Docling en precisión y velocidad

Datalab presentó Marker 2, una reescritura integral de su sistema abierto para convertir documentos PDF, imágenes, presentaciones, planillas, páginas HTML y libros electrónicos en Markdown, JSON, HTML o fragmentos estructurados. En las pruebas de olmOCR-bench, la herramienta alcanzó una puntuación general de 76% y un rendimiento sostenido de 2,9 páginas por segundo en una GPU B200, por encima de MinerU y Docling en la combinación de precisión y velocidad.

Datalab presentó Marker 2 como una nueva generación de su sistema abierto para procesar documentos complejos. La herramienta puede recibir archivos PDF, imágenes, presentaciones PPTX, documentos DOCX, planillas XLSX, páginas HTML y libros electrónicos EPUB, y transformarlos en Markdown, JSON, HTML o fragmentos listos para ser utilizados por otras aplicaciones. La renovación no se limita a una actualización menor: el equipo reconstruyó buena parte de la arquitectura para combinar reconocimiento óptico de caracteres, análisis visual de la estructura y procesamiento paralelo.

Según Fuente original, la información se basa en Datalab Marker v2 vs MinerU, Docling, and Liteparse: Benchmark Breakdown.

El resultado más destacado aparece en olmOCR-bench, una evaluación desarrollada por Ai2 que analiza documentos con texto digital, escaneos antiguos, tablas, ecuaciones, encabezados, pies de página y orden de lectura. En ese entorno, Marker 2 obtuvo 76% en su modalidad equilibrada y alcanzó 83,5% sobre documentos PDF que ya contienen una capa de texto. También sostuvo un ritmo de 2,9 páginas por segundo en una única GPU B200.

La comparación publicada por Datalab ubica a Marker 2 por delante de MinerU y Docling en la relación entre calidad y velocidad. Sin embargo, los resultados deben leerse con prudencia: las cifras provienen de ejecuciones propias de Datalab sobre un único equipo y un conjunto de documentos específico. La información original puede consultarse en el análisis comparativo publicado por MarkTechPost.

Qué cambia en la arquitectura de Marker 2

La versión anterior de Marker seguía un enfoque más uniforme. En cambio, Marker 2 ofrece tres rutas de conversión diseñadas para distintos compromisos entre exactitud, consumo de recursos y velocidad. El modo equilibrado apunta a los casos en los que la fidelidad del documento es prioritaria; el modo rápido reduce el costo de procesamiento; y la alternativa sin reconocimiento óptico de caracteres permite aprovechar la capa de texto existente en determinados PDF.

La selección del modo también tiene en cuenta el dispositivo. Por defecto, el sistema utiliza la modalidad equilibrada cuando detecta una GPU y la rápida en CPU o en equipos compatibles con MPS. El usuario puede modificar este comportamiento mediante el parámetro correspondiente. Esta decisión resulta relevante para equipos que procesan documentos en servidores con aceleradores, estaciones de trabajo locales o entornos de desarrollo sin infraestructura gráfica especializada.

Uno de los componentes centrales es Surya OCR 2, acompañado por un modelo de análisis de diseño de aproximadamente 20 millones de parámetros. Ese modelo identifica columnas, tablas, títulos y otros elementos de la página sin exigir una infraestructura comparable a la de los modelos visuales de gran tamaño. Datalab también reconstruyó pdftext, el componente encargado de extraer información textual de los PDF, y afirma que la nueva versión es tres veces más rápida que la anterior.

Paralelismo sin multiplicar la memoria de cada proceso

La mejora de rendimiento no depende únicamente de un modelo más rápido. Marker 2 distribuye numerosos trabajadores de CPU alrededor de un único servidor de inferencia de Surya. El proceso principal administra el nivel de concurrencia del modelo visual y permite que el rendimiento crezca en función de la capacidad del servidor, en lugar de exigir una copia completa de los recursos gráficos para cada trabajador.

Según las mediciones de Datalab, el modo equilibrado pasa de aproximadamente 0,3 páginas por segundo en una ejecución individual a cerca de 2,9 páginas por segundo cuando se utiliza concurrencia sostenida en la misma infraestructura. Para una empresa que procesa grandes volúmenes de contratos, expedientes, manuales o informes, esta diferencia puede modificar el costo operativo y el tiempo necesario para poner la información a disposición de un buscador interno o un sistema de inteligencia artificial.

Marker 2 frente a MinerU: mayor velocidad con una diferencia de precisión moderada

MinerU es el competidor más cercano desde el punto de vista técnico porque su modalidad de proceso también combina la lectura de la capa textual del PDF con reconocimiento óptico selectivo. En el benchmark, Marker 2 en modo equilibrado obtuvo 76%, mientras que el proceso de MinerU alcanzó 72,7%. En documentos digitales nativos, la distancia se reduce prácticamente al empate: 83,5% para Marker frente a 83,3% para MinerU.

La separación más clara aparece en la velocidad. Marker 2 sostuvo 2,9 páginas por segundo, contra 0,54 páginas por segundo de MinerU en el mismo tipo de prueba. La diferencia equivale a unas 5,4 veces más rendimiento para Marker, con una puntuación general superior. El modo rápido de Marker llegó a 7,4 páginas por segundo, aunque su puntuación cayó 6,1 puntos por debajo de MinerU.

Esta comparación muestra que no existe una modalidad universalmente mejor. Un equipo que prioriza el procesamiento masivo podría elegir el modo rápido, mientras que otro que necesita conservar con mayor precisión tablas, jerarquías y elementos visuales puede preferir el modo equilibrado. MinerU también dispone de una modalidad basada en un modelo visual de página completa que, según Datalab, obtiene una puntuación superior a su propio proceso estándar. Esa alternativa no fue incluida en la tabla principal y debería evaluarse por separado.

Docling conserva ventajas de gobernanza y amplitud de formatos

Docling registra una diferencia más amplia frente a Marker 2 en las cifras de olmOCR-bench. El sistema de IBM Research obtuvo 50,3% en la puntuación general y 64% en documentos digitales nativos, mientras que Marker alcanzó 76% y 83,5%, respectivamente. En velocidad, Docling llegó a 2,1 páginas por segundo, por debajo de los 2,9 de Marker en la modalidad equilibrada.

La lectura de estos resultados no debería reducirse a una tabla de posiciones. Docling cuenta con licencia MIT y forma parte del ecosistema de la Fundación LF AI & Data, factores que pueden ser relevantes para organizaciones que evalúan gobernanza, participación comunitaria y previsibilidad del proyecto. Además, su alcance de entrada no se limita a documentos tradicionales: también contempla formatos como correos electrónicos y audio.

Para una compañía, la elección puede depender de requisitos que el benchmark no mide directamente. La facilidad de integración, la política de mantenimiento, la compatibilidad con los formatos internos, la documentación, la experiencia del equipo y las condiciones de distribución pueden pesar tanto como una diferencia porcentual en precisión. Marker 2 aparece mejor posicionado en esta prueba concreta, pero Docling puede resultar más conveniente en arquitecturas que necesitan una cobertura de formatos amplia y una base institucional definida.

LiteParse prioriza velocidad extrema cuando no hace falta reconstruir el diseño

LiteParse, desarrollado por el equipo de LlamaIndex, ocupa una posición diferente. Se trata de un analizador de documentos escrito en Rust que prioriza una extracción muy veloz del contenido. En la prueba de CPU sin reconocimiento óptico, reportó 1.721 páginas por segundo, una cifra muy superior a la de Marker en el mismo tipo de entorno.

El costo de esa velocidad aparece en la comprensión de la estructura. LiteParse obtuvo 22,4% en la puntuación general y 20,4% cuando se desactivó el reconocimiento óptico, frente a 43,6% de Marker en CPU. La diferencia se vuelve importante en documentos con columnas, tablas, encabezados, diagramas o un orden de lectura que no coincide con la secuencia lineal del texto.

Marker utiliza su modelo de diseño de 20 millones de parámetros incluso en el modo rápido sin GPU. Por eso puede recuperar parte de la organización visual que se perdería con una extracción textual simple. LiteParse, al no incorporar un modelo de análisis de disposición equivalente, resulta más apropiado cuando el objetivo es obtener texto plano a máxima velocidad y no preservar la composición semántica de la página.

El tipo de documento determina qué modo conviene elegir

Las cifras generales esconden diferencias relevantes entre categorías. El caso más sensible es el de las matemáticas. En el modo rápido, Marker lee las ecuaciones desde la capa textual del PDF en lugar de procesarlas mediante reconocimiento visual, por lo que el rendimiento en documentos de arXiv cae de 83,9% a 23,4%. Con el reconocimiento desactivado, la categoría matemática llega a cero por diseño.

Los escaneos antiguos también representan una dificultad persistente. En las tres modalidades de Marker, esa categoría se mantiene como la más débil y alcanza como máximo 43,2%. Esto indica que un resultado general elevado no garantiza una reconstrucción confiable para archivos históricos, fotocopias de baja calidad o documentos con manchas, inclinación, tipografías deterioradas y pérdida de contraste.

En la práctica, una organización debería separar su corpus antes de decidir. Los PDF digitales con tablas y encabezados pueden procesarse de manera eficiente con el modo equilibrado. Los lotes homogéneos con texto simple podrían pasar por el modo rápido. Las colecciones escaneadas, los informes científicos con fórmulas y los documentos jurídicos con estructura sensible requieren una validación específica, y en ciertos casos un modelo visual de página completa puede superar a cualquier proceso basado principalmente en la capa textual.

Los modelos visuales siguen siendo la referencia para máxima exactitud

Datalab diferencia expresamente a Marker 2 de los sistemas basados en modelos visuales de lenguaje. En la evaluación mencionada, el servicio alojado Chandra 2 obtuvo 85,8%, mientras que Gemini Flash 3.5 mediante una interfaz de programación alcanzó 76,4%. La comparación pertenece a otra categoría de herramientas porque los modelos visuales suelen analizar la página completa y pueden interpretar relaciones complejas entre texto, imágenes, tablas y fórmulas.

La ventaja de Marker es que busca un equilibrio entre precisión, control local, costo previsible y rendimiento sostenido. No requiere necesariamente una llamada de pago por cada página ni obliga a enviar todo el contenido a un proveedor externo. Para datos confidenciales, repositorios internos o procesos con grandes volúmenes, esa diferencia puede ser determinante. Aun así, cuando la prioridad absoluta es interpretar escaneos difíciles o preservar ecuaciones complejas, los modelos visuales continúan teniendo una posición superior en las cifras citadas.

Qué deben comprobar los equipos antes de migrar

La actualización incorpora cambios que pueden afectar el despliegue. Marker 2 requiere Python 3.10 o una versión posterior. El proyecto abandonó Poetry y pasó a utilizar uv, con hatchling como sistema de construcción, aunque la instalación habitual mediante pip install marker-pdf se mantiene. También se eliminaron el conversor de extracción estructurada y sus extractores; Datalab orienta a los usuarios hacia su API alojada o hacia flujos que utilizan un modelo de lenguaje.

Antes de actualizar una instalación productiva, es recomendable revisar dependencias, imágenes de contenedor, procesos de ejecución y formatos de salida. También hay que comprobar cómo se comportan las tablas, las listas, los encabezados, las notas al pie y las ecuaciones dentro del flujo posterior. Una conversión aparentemente correcta puede generar problemas si el contenido se utiliza después para búsqueda semántica, generación aumentada por recuperación, catalogación documental o publicación automática.

El repositorio de Marker incluye un arnés abierto con ejecutores para Marker, MinerU, Docling y LiteParse. La posibilidad de repetir las mediciones facilita una comparación más realista. La prueba debería utilizar una muestra representativa del archivo propio, con documentos fáciles y casos extremos, y evaluar no solo la puntuación sino también el tiempo total, el uso de memoria, la tasa de errores y la necesidad de revisión humana.

Marker 2 puede mejorar la visibilidad de repositorios y buscadores internos

La calidad de la conversión repercute directamente en la forma en que los sistemas de búsqueda, las bases de conocimiento y las aplicaciones de inteligencia artificial interpretan un documento. Si una tabla se transforma en texto desordenado, si se mezclan dos columnas o si un encabezado queda separado de su contenido, los motores pueden recuperar información incompleta y los modelos pueden generar respuestas equivocadas.

Para negocios digitales, esto tiene una consecuencia concreta: los documentos convertidos alimentan páginas de ayuda, catálogos, fichas técnicas, centros de recursos y asistentes de atención. Marker 2 puede ser útil cuando se necesita procesar esos materiales en infraestructura propia y conservar una estructura relativamente rica en Markdown, HTML o JSON. Una mejor extracción no garantiza por sí sola mejores posiciones orgánicas, pero sí puede elevar la calidad de los contenidos publicados, los datos estructurados y las respuestas de los sistemas internos.

En proyectos de WordPress, comercio electrónico o documentación técnica, la decisión debería vincularse con el proceso completo. El parser elegido debe entregar salidas consistentes, permitir controles de calidad y evitar que se publiquen automáticamente fragmentos con errores de lectura. También resulta importante definir reglas para títulos, tablas, enlaces, imágenes y metadatos antes de conectar la conversión con un gestor de contenidos o una plataforma de búsqueda.

El benchmark de Datalab presenta a Marker 2 como una opción especialmente competitiva para equipos que necesitan combinar precisión, procesamiento local y alto rendimiento. MinerU continúa siendo una alternativa sólida, Docling ofrece atributos relevantes de gobernanza y formatos, y LiteParse puede ser imbatible cuando solo se necesita extraer texto a gran velocidad. La elección más segura surgirá de probar los cuatro sistemas con los documentos reales que cada organización debe procesar.

FAQ

Preguntas frecuentes

¿Qué es Marker 2?

Marker 2 es una herramienta de código abierto de Datalab para convertir PDF, imágenes, presentaciones, documentos, planillas, HTML y EPUB en Markdown, JSON, HTML o fragmentos estructurados.

¿Marker 2 es más rápido que MinerU?

En las pruebas de Datalab sobre olmOCR-bench, Marker 2 en modo equilibrado sostuvo 2,9 páginas por segundo frente a 0,54 de MinerU en su proceso estándar. La diferencia puede variar según los documentos y el hardware utilizado.

¿Qué sistema obtuvo la mejor puntuación del benchmark?

Entre Marker 2, MinerU, Docling y LiteParse, Marker 2 obtuvo la puntuación general más alta en la tabla citada, con 76%. Los modelos visuales de lenguaje evaluados por separado alcanzaron cifras superiores.

Marcela Osorio

Editor digital

Marcela Osorio es una autora argentina especializada en Inteligencia Artificial, Marketing Digital y Tendencias Digitales. Con una mirada crítica y actual, explora las intersecciones entre la tecnología y el mundo del marketing, aportando insights valiosos para profesionales del sector. Su trabajo se enfoca en desmitificar conceptos complejos y ofrecer herramientas prácticas para adaptarse a un entorno digital en constante evolución. Desde Argentina, Marcela contribuye a la conversación sobre el futuro digital con pasión y compromiso.

410 notas
Ver biografía y artículos →
Lecturas relacionadas

Seguimiento del tema

Esta cobertura puede ampliarse con nuevas fuentes, consultas de búsqueda y artículos relacionados dentro del mismo eje editorial.

2 comentarios

  1. Está buenísimo que comparen precisión y velocidad, porque en marketing muchas veces necesitamos procesar cientos de PDFs para extraer datos, no solo mostrar un benchmark. Igual me gustaría ver cómo se comporta Marker 2 con documentos escaneados, tablas complicadas y archivos en español. Ahí suele aparecer la diferencia entre una demo y una herramienta realmente útil.

  2. Para SEO, la precisión al extraer tablas, títulos y estructura puede valer más que unas décimas de velocidad, sobre todo si después se usa ese contenido para generar fichas o artículos. Me interesa ver cómo se comporta Marker 2 con PDFs escaneados y documentos en español, porque ahí suelen aparecer los problemas que no muestran los benchmarks.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *