CyberScraper 2077

Desarrollo

Olvídate de los selectores: describe los datos y deja que el LLM te los estructure.

Descripción

Frente a los scrapers que se caen en cuanto cambia un selector CSS, aquí el HTML lo interpreta un modelo de lenguaje. Conectas OpenAI, Gemini, Ollama o un proxy LiteLLM, describes qué campos quieres y el contenido sale ya estructurado, sin XPath eterno.

Se usa desde una interfaz Streamlit. El rastreo va con Playwright, operaciones asíncronas y caché LRU (por contenido y por consulta) para no repetir llamadas a la API. Incluye modo sigiloso, enrutado por la red Tor para sitios .onion y la opción de reutilizar tu navegador local cuando hace falta sortear detecciones de bot.

Formatos y matices prácticos

  • Exportación a JSON, CSV, HTML, SQL o Excel, y subida del CSV a Google Sheets en un clic.
  • Navegación entre páginas (beta) y bypass de captcha nativo añadiendo -captcha al final de la URL; esa vía no funciona en Docker.
  • Python 3.10 o superior; en Windows el mantenimiento se centra en la imagen Docker.

El código está en GitHub con licencia MIT. El README recomienda OpenAI y Gemini para seguir instrucciones; con LLM locales la velocidad depende del equipo y puede hacer falta ajustar el prompt.

Tecnologías y temas

  • Exportación

    JSON, CSV, HTML, SQL, Excel y envío directo a Google Sheets.

  • Playwright

    Navegación real, modo sigiloso y uso del navegador local para reducir bloqueos.

  • Scraping con LLM

    Parsea la página con OpenAI, Gemini, Ollama o LiteLLM en lugar de selectores fijos.

  • Streamlit

    Interfaz en el navegador, pensada para el puerto 8501 o para el contenedor Docker.

  • Tor y .onion

    Enrutado automático por Tor para extraer datos de sitios onion.