Извлечение
Извлечение читает страницы всех сайтов кластера и вытаскивает из них то, что совпадает с выражением. Кластер сайтов превращается в таблицу телефонов, аккаунтов в соцсетях, адресов, названий плагинов - всего, что захватит шаблон.
Что читается
Всё, что PublicWWW проиндексировал на этих сайтах, включая внутренние страницы, - а не только главную, на которой сработал поиск. Контакт, который есть лишь на странице «О компании», тоже найдётся.
Готовые шаблоны и свои выражения
Есть готовые шаблоны для самого востребованного - адресов почты и телефонных
номеров, - а вместо них можно использовать любое регулярное выражение. Оно
работает так же, как snipexp:
в поиске: в колонку попадает содержимое захватывающей группы, а
выражение без группы даёт пустые результаты.
|/wp-content/plugins/([\w\d\-\.\_]+)/|
Сначала проверьте выражение на небольшом кластере. Его можно запускать, править и запускать снова, ограничив число извлекаемых записей, так что неудачный шаблон почти ничего не стоит; почему это важно, см. в разделе ограничения.
Как получить результат
Таблица с извлечёнными данными скачивается файлом и открывается в любой программе для таблиц. Каждая строка - сайт и то, что на нём нашлось; сайт, на котором ничего не совпало, тоже есть в списке, так что пропуски видны, а не исчезают молча.
Фильтрация поиска кластером
Кластер работает и как фильтр в обратную сторону. Загрузите свой список доменов, URL или адресов почты и сузьте с его помощью результаты поиска до сайтов из этого списка - или, вычитанием, до всех, кроме них.
В примере извлечение телефонов и адресов почты весь путь пройден от двух поисков до таблицы.
Далее Ограничения