Как парсить данные в Screaming Frog SEO Spider

В Screaming Frog SEO Spider есть мощная функция, которая позволяет парсить произвольные данные с сканируемых страниц. Она называется «Пользовательское извлечение» (Custom Extraction).

С помощью этой функции вы можете извлечь практически любую информацию из HTML-кода страницы по заданному вами правилу (селектору). Это идеально подходит для сбора данных, таких как количество просмотров, цена товара, имя автора, дата публикации и т.д.

Вот пошаговая инструкция, как это сделать на примере сбора количества просмотров.

Найти селектор элемента

Сначала вам нужно определить, как найти нужный блок на странице. Для этого используются селекторы CSS Path или XPath.

Откройте в браузере (например, в Google Chrome) страницу, где отображается счетчик просмотров.

Наведите курсор на цифру с количеством просмотров, нажмите правую кнопку мыши и выберите «Просмотреть код» (Inspect).

В открывшейся панели инструментов разработчика вы увидите подсвеченный HTML-код этого элемента. Например, он может выглядеть так:

<div class="post-stats">
    <span class="views-icon"></span>
    <span class="views-count">1,234</span>
</div>

 

  1. Вам нужно получить уникальный селектор для элемента, содержащего текст (в нашем случае это <span class=»views-count»>1,234</span>).
    • Нажмите правой кнопкой мыши на этой строке в коде.
    • Выберите Copy > Copy selector (скопировать CSS-селектор) или Copy > Copy XPath (скопировать XPath).
    • CSS-селектор (чаще всего проще): в нашем примере это может быть .views-count.
    • XPath (более мощный): //span[@class=’views-count’].

Сохраните этот селектор, он понадобится в следующем шаге.

Настроить Custom Extraction

  1. Откройте Screaming Frog.
  2. Перейдите в меню Configuration > Custom > Extraction.
  3. В открывшемся окне вы увидите 10 «экстракторов», которые можно настроить. Нажмите «Add», чтобы добавить новый.
  4. Заполните поля:
    • Extractor Name: Дайте понятное имя, оно станет названием столбца в отчете. Например: Количество просмотров.
    • Selector: Выберите тип селектора, который вы скопировали на Шаге 1 (CSSPath или XPath).
    • Поле для селектора: Вставьте скопированный селектор. Например: .views-count.
    • Extract: Выберите, что именно извлекать из найденного элемента.
      • Extract Text: Самый частый выбор. Извлекает только текст внутри тега (например, 1,234).
      • Extract Inner HTML: Извлекает весь HTML-код внутри элемента.
      • Extract HTML Element: Извлекает сам элемент вместе с его тегами (например, <span class=»views-count»>1,234</span>).

    Для сбора количества просмотров вам нужен Extract Text.

  5. Нажмите «OK», чтобы сохранить настройки.

Запустить сканирование

  1. Введите URL вашего сайта в поле для сканирования.
  2. Нажмите «Start».

Результаты

Когда сканирование завершится (или даже во время него), вы можете увидеть собранные данные.

  1. Перейдите на вкладку «Custom Extraction» в основной панели вкладок (справа).
  2. В этой вкладке вы увидите таблицу, где для каждого URL будет отображаться извлеченная информация в столбце с названием, которое вы задали (Количество просмотров).
  3. Также эти данные будут доступны в основной вкладке «Internal», если прокрутить таблицу вправо до конца. Их можно экспортировать в Excel или CSV вместе со всеми остальными данными.

Если данные подгружаются через JavaScript

Иногда счетчики просмотров и другой подобный контент загружаются на страницу не сразу, а с помощью JavaScript после основной загрузки HTML. В этом случае стандартный режим сканирования Screaming Frog может их не увидеть.

Что делать?

  1. Перейдите в меню Configuration > Spider > Rendering.
  2. Измените режим сканирования с Text Only на JavaScript.
  3. Вам может понадобиться настроить AJAX Timeout (время ожидания), если данные подгружаются с задержкой. Обычно 5 секунд достаточно.
  4. Снова запустите сканирование.

Учтите: Сканирование в режиме JavaScript работает значительно медленнее и требует больше ресурсов компьютера. Используйте его, только если это действительно необходимо.

Таким образом, Screaming Frog является очень гибким инструментом не только для SEO-аудита, но и для сбора практически любых структурированных данных с сайта.

Оставьте комментарий