Desde hace dos décadas, el crecimiento exponencial de la información digital hace necesario el uso de técnicas y herramientas que permitan recuperar masivamente datos de la web. Las Humanidades Digitales también requieren en ciertos proyectos de estas aplicaciones, basadas en la minería de texto, para obtener información con la que llevar a cabo sus investigaciones.
El webscraping (o scraping, raspar) es una técnica usada para extraer contenido de sitios web, que permite construir datasets o conjuntos de datos desde la web. El procedimiento es sencillo, se captura la información en HTML enviada a nuestro navegador y se procesa, realizando operaciones de filtrado, conversión de formatos y etiquetado, para obtener datos estructurados que puedan ser almacenados y posteriormente analizados en estudios de investigación. De esta manera, los datos adquieren un carácter multivalente al pasar de una amplia dispersión en la web a formatos más sencillos para usos instrumentales. Así, por ejemplo, es posible extraer datos de estadísticas de organismos oficiales o de redes sociales para el estudio de fenómenos sociales o culturales.
Entre las aplicaciones más populares para la extracción de datos se encuentran:
Por otro lado, se pueden utilizar códigos de programación o sistemas basados en lenguajes que permiten diseñar todo el proceso, ajustándose lo más posible al proyecto y las webs que se quieren procesar, que requieren conocimientos de programación para diseñar y poner a funcionar el proceso de extracción. Entre las herramientas más conocidas en este modelo están:
Por último, dentro de este apartado es importante señalar, sobre todo por su aplicación en las Humanidades Digitales, el concepto de Expresiones Regulares (regex) para la extracción de datos textuales. Las expresiones regulares son una serie de códigos que se utilizan para localizar patrones de texto. A través de una serie de operadores y códigos se puede recuperar segmentos específicos.