Регулярные выражения

snipexp: - единственный оператор, который не меняет, какие сайты найдены, а меняет то, что показывается для каждого из них. Так список сайтов превращается в список идентификаторов издателей, телефонных номеров или названий плагинов.

Вместо текста вокруг совпадения фрагментом становится то, что захватило ваше выражение.

Выражение - это шаблон PCRE вместе с разделителями (обычно |: в запросе этот символ встречается редко) и хотя бы одной захватывающей группой, потому что вы получаете именно то, что захватила группа. Флаги ставятся после закрывающего разделителя: например, i отключает учёт регистра. Без захватывающей группы фрагмент приходит пустым - это и есть обычная причина пустой колонки.

snipexp:|pubid=(ra\-[\w\d]+)|i

Телефоны пиццерий в Италии

"href=\"tel" site:it pizza snipexp:|\"tel\:([^\"]+)\"|

Идентификаторы издателей AddThis

"addthis_widget.js#pubid=ra" snipexp:|pubid=(ra\-[\w\d]+)|i

Названия плагинов WordPress

"/wp-content/plugins/" snipexp:|/plugins/([\w\d\-\.\_]+)/|

Идентификаторы партнёрских сайтов

"_pop.push([\"siteId" snipexp:|(siteId[\"\']\,\s*(\d+))|i

Именно фрагменты попадают в выгрузки csvsnippets и возвращаются API при snippets=1. Чтобы извлечь поле сразу со всего набора сайтов, существуют кластеры. Фрагменты расходуют отдельный суточный лимит - см. лимиты и ограничения частоты.

Далее Национальные домены