Извлечение

Извлечение читает страницы всех сайтов кластера и вытаскивает из них то, что совпадает с выражением. Кластер сайтов превращается в таблицу телефонов, аккаунтов в соцсетях, адресов, названий плагинов - всего, что захватит шаблон.

Что читается

Всё, что PublicWWW проиндексировал на этих сайтах, включая внутренние страницы, - а не только главную, на которой сработал поиск. Контакт, который есть лишь на странице «О компании», тоже найдётся.

Готовые шаблоны и свои выражения

Есть готовые шаблоны для самого востребованного - адресов почты и телефонных номеров, - а вместо них можно использовать любое регулярное выражение. Оно работает так же, как snipexp: в поиске: в колонку попадает содержимое захватывающей группы, а выражение без группы даёт пустые результаты.

|/wp-content/plugins/([\w\d\-\.\_]+)/|

Сначала проверьте выражение на небольшом кластере. Его можно запускать, править и запускать снова, ограничив число извлекаемых записей, так что неудачный шаблон почти ничего не стоит; почему это важно, см. в разделе ограничения.

Как получить результат

Таблица с извлечёнными данными скачивается файлом и открывается в любой программе для таблиц. Каждая строка - сайт и то, что на нём нашлось; сайт, на котором ничего не совпало, тоже есть в списке, так что пропуски видны, а не исчезают молча.

Фильтрация поиска кластером

Кластер работает и как фильтр в обратную сторону. Загрузите свой список доменов, URL или адресов почты и сузьте с его помощью результаты поиска до сайтов из этого списка - или, вычитанием, до всех, кроме них.

В примере извлечение телефонов и адресов почты весь путь пройден от двух поисков до таблицы.

Далее Ограничения