Extração

A extração lê as páginas de cada site de um cluster e retira as partes que correspondem a uma expressão. Um cluster de sites vira uma tabela de telefones, perfis em redes sociais, endereços, nomes de plugins: tudo o que o padrão capturar.

O que é lido

Tudo o que o PublicWWW indexou desses sites, incluindo as páginas internas, e não apenas a página inicial em que a busca encontrou a correspondência. Um contato que só aparece na página “sobre” também é encontrado.

Modelos prontos e padrões próprios

Há modelos prontos para o que as pessoas mais pedem, como endereços de e-mail e números de telefone, e qualquer expressão regular pode ser usada no lugar deles. A expressão funciona do mesmo jeito que snipexp: em uma busca: o grupo de captura é o que vai para a coluna, e uma expressão sem grupo de captura produz resultados vazios.

|/wp-content/plugins/([\w\d\-\.\_]+)/|

Teste primeiro em um cluster pequeno. A expressão pode ser testada, ajustada e testada de novo com um limite de quantos registros extrair, então um padrão errado quase não custa nada; veja em limites por que isso importa.

Como obter o resultado

A tabela extraída é baixada como arquivo e abre em qualquer planilha. Cada linha é um site e o que foi encontrado nele; um site sem nenhuma correspondência também aparece na lista, para que as lacunas fiquem visíveis em vez de sumirem silenciosamente.

Filtrando buscas com um cluster

Um cluster também funciona como filtro no sentido inverso. Envie sua própria lista de domínios, URLs ou endereços de e-mail e use-a para reduzir os resultados da busca aos sites dessa lista ou, por subtração, a todos menos eles.

Extração de telefones e e-mails mostra o processo completo, de duas buscas até uma planilha.

A seguir Limites