← Catálogo

pdf-inspector

Desarrollo

Descripción

pdf-inspector es una librería escrita en Rust, creada por Firecrawl, para inspeccionar, clasificar y extraer texto de archivos PDF a gran velocidad. Su gran ventaja es que detecta de forma inteligente si un PDF está basado en texto o es un documento escaneado, lo que permite tomar decisiones de enrutamiento inteligentes y evitar el uso de servicios de OCR caros cuando no son necesarios.

La herramienta procesa PDFs basados en texto localmente en menos de 200 ms, saltándose el OCR para aproximadamente el 54% de los documentos que no lo requieren. El documento se carga una sola vez y se comparte entre las fases de detección y extracción, evitando lecturas redundantes.

Funciones principales

  • Clasificación inteligente: detecta PDFs de tipo TextBased, Scanned, ImageBased o Mixed en unos 10-50 ms, con puntuación de confianza y enrutamiento OCR por página.
  • Extracción de texto: con reconocimiento de posición, información de fuentes, coordenadas X/Y y orden de lectura multicolumna automático.
  • Conversión a Markdown: encabezados, listas, bloques de código, tablas, formato negrita/cursiva, enlaces de URL y saltos de página.
  • Detección de tablas: modo dual mediante rectángulos y heurística por alineación de texto.
  • Soporte de fuentes CID: decodificación ToUnicode CMap y detección de problemas de codificación.
  • WebAssembly en navegador: ejecuta el mismo parser Rust localmente sin llamadas al servidor.

Incluye enlaces para Python, Node.js y WebAssembly en navegador, además de herramientas de línea de comandos (pdf2md y detect-pdf). Es ligera, sin modelos de IA ni servicios externos, y encaja especialmente bien en PDFs de texto nativo como informes, artículos de investigación, documentos financieros, facturas y textos legales.

Tecnologías y temas

  • Enrutamiento OCR

    Detecta cuándo hace falta OCR por página

  • Extracción de texto

    Extracción con reconocimiento de posición

  • Markdown

    Conversión de PDF a Markdown limpio

  • PDF

    Inspección y clasificación de documentos PDF

  • Rust

    Librería nativa de alto rendimiento