loader
¿Cuánto sabe internet sobre tu empresa? El riesgo del web scraping

Publicar información en internet es parte de la operación cotidiana de prácticamente cualquier organización. Sitios web corporativos, catálogos, perfiles profesionales, redes sociales, comunicados y documentos públicos permiten a clientes, proveedores y otros actores conocer mejor a una empresa pero esa misma información puede ser recopilada automáticamente.

El web scraping permite extraer grandes cantidades de datos de internet mediante herramientas automatizadas. Para una empresa, puede ser una herramienta útil para analizar mercados, monitorear precios o investigar tendencias. Para un atacante, en cambio, puede convertirse en una forma rápida de construir una base de información sobre una organización y las personas que trabajan en ella.

La diferencia no está necesariamente en la tecnología utilizada, sino en qué información se recopila, cómo se obtiene y qué se hace posteriormente con ella. Y ahí aparece uno de los principales desafíos: muchas veces, el primer paso de un ataque no consiste en vulnerar un sistema, sino en recopilar información que la propia organización ya dejó expuesta.

Internet está lleno de información que puede ser recopilada automáticamente

Cuando una persona navega por un sitio web, normalmente lo hace página por página. Un programa automatizado puede recorrer cientos o miles de páginas en mucho menos tiempo. Ese es, en términos simples, el principio detrás del scraping.

Un scraper puede estar diseñado para identificar determinados elementos dentro de una página y almacenarlos posteriormente en una base de datos. Dependiendo de su objetivo, puede recopilar desde precios y características de productos hasta nombres, correos electrónicos, publicaciones o información sobre una empresa.

No todo scraping tiene la misma finalidad

Es importante evitar una asociación automática entre scraping y ciberdelincuencia. Existen múltiples usos legítimos para esta técnica. De hecho, la extracción automatizada de información puede formar parte de procesos de análisis de datos, investigación, inteligencia competitiva y monitoreo.

Podemos imaginar, por ejemplo, una empresa que necesita conocer la evolución de los precios publicados por distintos competidores. Revisar manualmente esa información todos los días sería poco práctico. Una herramienta automatizada puede realizar esa tarea y entregar los datos necesarios para su análisis.

También puede utilizarse para identificar cambios en catálogos, monitorear publicaciones públicas o recopilar información estadística. En estos casos, el scraping puede aportar eficiencia pero la misma capacidad puede utilizarse con objetivos completamente diferentes.

Un atacante podría recorrer automáticamente el sitio de una empresa buscando información sobre sus trabajadores, direcciones de correo electrónico, números telefónicos, cargos, tecnologías utilizadas o documentos publicados. A partir de ahí, la información puede combinarse con otras fuentes y utilizarse para preparar ataques mucho más convincentes.

El verdadero riesgo aparece cuando los datos se conectan

Un nombre publicado en una página corporativa puede parecer poco relevante, lo mismo ocurre con un cargo, una dirección de correo electrónico o una fotografía. El problema cambia cuando todos esos datos pueden recopilarse automáticamente y relacionarse entre sí.

Imaginemos que un atacante obtiene:

  • El nombre del responsable de finanzas.
  • Su cargo dentro de la organización.
  • Su correo corporativo.
  • El nombre del software utilizado por la empresa.
  • Información sobre un proveedor.
  • Una publicación reciente sobre un proceso de facturación.

Cada dato, por separado, puede parecer inofensivo pero juntos pueden entregar el contexto necesario para construir un correo de phishing altamente personalizado.

Esta es una de las razones por las que el scraping resulta especialmente interesante desde la perspectiva de la ciberseguridad: permite transformar información dispersa en inteligencia utilizable.

Del dato público al ataque dirigido

Los ataques de ingeniería social funcionan mejor cuando el atacante conoce a su víctima. Un mensaje genérico que solicita actualizar una contraseña puede generar sospechas. En cambio, un correo que menciona correctamente el cargo de una persona, el nombre de un proveedor con el que trabaja y un proceso que efectivamente existe dentro de la empresa puede resultar mucho más convincente. El scraping puede ayudar a construir ese contexto.

La información recopilada podría utilizarse para:

  • Preparar campañas de spearphishing.
  • Crear perfiles de trabajadores.
  • Identificar personas con acceso privilegiado.
  • Detectar relaciones entre empleados y proveedores.
  • Reconocer tecnologías utilizadas por una organización.
  • Identificar información útil para campañas de fraude.
  • Localizar documentos o recursos que no deberían estar expuestos.

Por eso, proteger una organización no consiste únicamente en asegurar sus servidores y dispositivos. También es necesario comprender qué información está disponible públicamente y qué podría hacer un atacante con ella.

¿Cuánto tráfico puede generar un scraper?

Otra diferencia importante entre una persona y un scraper está en la escala. Un usuario puede visitar algunas páginas durante una sesión, un programa automatizado puede realizar una cantidad mucho mayor de solicitudes en poco tiempo.

Esta actividad puede convertirse en un problema para el sitio que está siendo consultado. Si un scraper realiza solicitudes de manera excesiva, puede consumir ancho de banda, recursos de procesamiento y capacidad del servidor. En casos extremos, el rendimiento del sitio puede verse afectado.

El escenario también puede ser difícil de identificar cuando el tráfico se distribuye entre múltiples direcciones IP o intenta imitar el comportamiento de usuarios legítimos. Por esta razón, detectar scraping no consiste simplemente en buscar una dirección IP y bloquearla.

¿Cómo saber si un sitio está siendo scrapeado?

No existe una señal única que permita identificar todos los casos. Sin embargo, determinados patrones pueden resultar sospechosos:

Volúmenes de solicitudes inusualmente altos.
Un número de peticiones muy superior al comportamiento normal puede indicar automatización.

Velocidad de navegación poco realista.
Un programa puede consultar páginas a una velocidad difícil de alcanzar para una persona.

Patrones repetitivos.
Acceder sistemáticamente a cientos de páginas siguiendo una estructura idéntica puede revelar actividad automatizada.

Agentes de usuario anómalos.
Las solicitudes HTTP contienen información que puede ayudar a identificar el software que realiza la conexión.

Consumo inesperado de recursos.
Un aumento de ancho de banda o carga del servidor puede ser una señal de extracción automatizada.

El análisis de logs y del comportamiento del tráfico permite construir una imagen más precisa de lo que está ocurriendo.

Público no significa “sin restricciones”

Uno de los errores más habituales es asumir que cualquier información disponible en internet puede utilizarse libremente. Esto no necesariamente es así.

Una página puede ser accesible sin contraseña y, aun así, contener material sujeto a derechos de autor, datos personales o condiciones de utilización específicas. Además, existen obligaciones que pueden depender de la jurisdicción y del propósito para el cual se procesan los datos.

En Chile, la protección de datos personales está experimentando una transformación importante. La Ley 21.719 establece un nuevo marco regulatorio y su entrada en vigencia está prevista para el 1 de diciembre de 2026. La normativa incorpora, entre otros elementos, principios relacionados con la licitud, finalidad y proporcionalidad del tratamiento de datos personales.

Esto vuelve todavía más importante evaluar cuidadosamente qué información se recopila, con qué propósito y bajo qué fundamento se realiza su tratamiento. La accesibilidad técnica de un dato no determina por sí sola la legitimidad de su utilización.

¿Qué ocurre con el contenido de terceros?

El problema tampoco se limita a los datos personales. Los sitios web contienen fotografías, artículos, diseños, descripciones de productos, bases de datos y otros materiales que pueden estar protegidos por derechos de propiedad intelectual. Copiar automáticamente ese contenido y reutilizarlo puede generar problemas que van más allá de la ciberseguridad.

Un ejemplo sencillo sería un sitio que copia sistemáticamente los artículos de otro medio y los publica como propios. Otro podría ser un competidor que extrae automáticamente un catálogo completo, incluyendo descripciones e imágenes, para incorporarlo a su propia plataforma. La automatización no elimina las obligaciones relacionadas con el contenido que se está copiando.

Content scraping: cuando lo que se busca es el contenido

Dentro del concepto general de web scraping existe el content scraping, orientado específicamente a copiar materiales publicados en sitios web.

Puede incluir:

  • Artículos.
  • Fotografías.
  • Descripciones.
  • Catálogos.
  • Precios.
  • Listados.
  • Publicaciones.

El objetivo puede ser comercial, informativo o directamente malicioso.

Por ejemplo, un bot podría recopilar diariamente los precios de un competidor. Otro podría copiar artículos completos para republicarlos automáticamente. Y otro podría recopilar nombres y correos electrónicos para construir una base destinada a campañas de phishing.

Todos son ejemplos de extracción automatizada, pero sus implicancias legales y de seguridad pueden ser completamente diferentes.

Protegerse no significa desaparecer de internet

Una organización difícilmente puede evitar que toda su información pública sea recopilada.

Además, eliminar información de internet no siempre es deseable. Las empresas necesitan mantener sitios web, publicar información de contacto y comunicarse con sus clientes.

El objetivo debe ser reducir la información innecesaria y controlar mejor aquello que realmente necesita estar expuesto.

Algunas medidas pueden ayudar.

Revisar qué información se publica

Antes de publicar un dato, conviene preguntarse si realmente es necesario.

Por ejemplo, si una función puede ser atendida mediante un correo genérico como contacto@empresa.cl, quizá no sea necesario exponer públicamente el correo personal de un trabajador.

Lo mismo aplica para teléfonos personales, extensiones internas, documentos administrativos u otra información que pueda ser aprovechada posteriormente.

Monitorear el tráfico

El análisis de las solicitudes realizadas contra el sitio puede ayudar a identificar patrones automatizados.

La detección temprana permite aplicar controles antes de que un scraper consiga extraer grandes volúmenes de información.

Aplicar rate limiting

Limitar la cantidad de solicitudes que un cliente puede realizar durante un período determinado puede reducir significativamente la capacidad de extracción automatizada.

No es una solución definitiva, pero constituye una capa importante de protección.

Utilizar un WAF y controles contra bots

Un Web Application Firewall (WAF) puede contribuir a identificar y bloquear determinados patrones de tráfico sospechoso.

Las soluciones especializadas en gestión de bots pueden agregar capacidades de análisis de comportamiento para diferenciar mejor entre usuarios legítimos y automatizaciones maliciosas.

Utilizar CAPTCHA donde tenga sentido

Los CAPTCHA pueden dificultar determinadas actividades automatizadas, especialmente en puntos sensibles.

Sin embargo, no deberían convertirse en una barrera indiscriminada para todos los visitantes del sitio.

Configurar correctamente robots.txt

El archivo robots.txt permite indicar a determinados rastreadores qué áreas de un sitio deberían o no ser recorridas.

Es útil para establecer reglas de comportamiento para bots legítimos, como los utilizados por motores de búsqueda.

Pero hay una consideración importante:

robots.txt no es un mecanismo de seguridad.

Un scraper malicioso no está obligado a respetar sus instrucciones.

Por eso, nunca debería utilizarse como única medida de protección para información sensible.

¿Y los honeypots?

Los honeypots son recursos diseñados para atraer o identificar actividad sospechosa.

En determinados escenarios pueden utilizarse para detectar comportamientos automatizados y estudiar cómo operan determinados actores.

Su valor está principalmente en la visibilidad que proporcionan: permiten obtener información sobre patrones, herramientas y comportamientos que pueden contribuir a mejorar las defensas de la infraestructura real.

Sin embargo, deben formar parte de una estrategia más amplia y diseñarse cuidadosamente para evitar generar nuevos riesgos.

La protección también depende de las personas

Existe una dimensión del scraping que puede pasar inadvertida: la información que los propios trabajadores publican.

Cargos, proyectos, tecnologías, fotografías de instalaciones, proveedores, viajes de trabajo o detalles sobre procesos internos pueden aparecer en sitios corporativos y redes sociales.

Un atacante no necesariamente necesita vulnerar una base de datos para obtenerlos.

Por eso, la concientización en ciberseguridad también debe abordar la información que se publica y comparte.

La pregunta no debería ser únicamente:

“¿Este dato es público?”

También conviene preguntarse:

“¿Qué podría hacer alguien si recopila este dato junto con otros cien?”

La escala es lo que cambia las reglas

El web scraping existe desde hace años. Lo que está cambiando es la escala con la que pueden realizarse determinadas tareas automatizadas.

Las plataformas de automatización, las herramientas de inteligencia artificial y la capacidad actual de procesamiento permiten recopilar, clasificar y analizar cantidades enormes de información.

Esto puede ser muy útil para las empresas.

Pero también reduce el costo que tiene para un atacante investigar una organización.

Una persona podría tardar horas recopilando manualmente información de distintos sitios. Un sistema automatizado puede hacerlo de forma mucho más rápida y repetir el proceso periódicamente.

La consecuencia es que la exposición de información pública debe considerarse como un elemento más dentro de la superficie de ataque de una organización.

¿Qué debería preguntarse una empresa antes de hacer scraping?

Antes de implementar una herramienta de extracción automatizada, es recomendable evaluar al menos cinco aspectos:

  1. ¿Qué información necesitamos realmente?
    Recolectar más datos de los necesarios aumenta los riesgos y responsabilidades.
  2. ¿Existen datos personales?
    Si los hay, es necesario evaluar el marco jurídico aplicable y la legitimidad del tratamiento.
  3. ¿Podemos utilizar ese contenido?
    La información disponible públicamente puede estar sujeta a derechos o condiciones de uso.
  4. ¿Cómo afectará nuestra actividad al sitio consultado?
    El volumen y frecuencia de solicitudes deben mantenerse dentro de parámetros razonables.
  5. ¿Cómo protegeremos los datos una vez recopilados?
    La responsabilidad no termina con la extracción. También deben protegerse el almacenamiento, procesamiento, acceso y eventual eliminación de la información.

Una mirada de seguridad para un problema que también es legal

El web scraping se encuentra en una zona donde confluyen tecnología, privacidad, propiedad intelectual y ciberseguridad.

Desde el punto de vista técnico, una organización debe preguntarse cómo detectar y limitar actividades automatizadas no deseadas.

Desde el punto de vista legal, debe determinar si la recopilación y el tratamiento de la información son legítimos.

Y desde el punto de vista de seguridad, debe considerar qué podría ocurrir si esa información cae en manos de un atacante.

Ninguna de estas perspectivas funciona de manera aislada.

Conclusión: la información pública también necesita gestión

El web scraping no es malo por naturaleza. Puede ser una herramienta extremadamente útil para investigar mercados, analizar tendencias y transformar información disponible en conocimiento para tomar decisiones.

El problema comienza cuando la automatización se utiliza para recopilar información sin considerar sus implicancias, copiar contenido sin autorización, extraer datos personales de manera indebida o preparar ataques contra personas y organizaciones.

Para las empresas, la lección es doble.

Por una parte, si utilizan scraping, deben hacerlo con una estrategia que considere finalidad, proporcionalidad, cumplimiento y seguridad.

Por otra, deben asumir que parte de la información que publican puede ser recopilada automáticamente y utilizada fuera de su control.

Reducir la exposición innecesaria, monitorear el comportamiento del tráfico, implementar controles contra bots y educar a los trabajadores son pasos que pueden disminuir este riesgo.

Porque en internet, hacer pública una información no significa perder toda responsabilidad sobre ella, ni tampoco significa que no pueda convertirse en una pieza de información valiosa para un atacante.

En Lockbits ayudamos a las organizaciones a identificar y reducir los riesgos asociados a la exposición de información, combinando soluciones tecnológicas con estrategias de ciberseguridad adaptadas a sus necesidades.

¿Quieres conocer cómo proteger la información de tu organización?

Conversemos en https://lockbits.cl/contacto/

Comparte

Facebook
Twitter
WhatsApp

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

NEWSLETTER

Buscar
Categorías
Archivos

Máxima seguridad digital para empresas