Защитните проверки от типа „Вие бот ли сте?“ могат неволно да доведат до отпадане на страници от резултатите на Google. Причината е, че търсачката понякога получава и индексира защитния екран вместо действителното съдържание на сайта.
В подкаста Search Off the Record Джон Мюлер от Google обяснява, че подобна ситуация може дори да накара търсачката да определи страницата като дубликат на съдържание от друг уебсайт.
Как възниква проблемът
Когато системата за сигурност разпознае даден посетител като подозрителен, тя може да покаже проверка „Вие бот ли сте?“ вместо реалната страница.
Ако същият екран бъде подаден и на Googlebot с нормален HTTP статус, например 200, Google може да го възприеме като действителното съдържание на адреса. В резултат оригиналната страница може да отпадне от индекса или да бъде заменена от защитния екран.
Тъй като еднакви или почти еднакви проверки се използват в множество сайтове, Google открива няколко дублиращи се страници. След това алгоритмите могат да изберат една от тях като канонична, а останалите да обозначат като дубликати.
В по-необичайни случаи Google може да посочи адрес от напълно различен сайт като основна версия на съдържанието.
Защо проблемът се открива трудно
При обикновено посещение сайтът вероятно ще се зарежда нормално. Защитната проверка се показва само при заявки, които CDN услугата, хостингът или системата за защита определят като подозрителни.
Това означава, че собственикът на сайта може да не вижда никакъв проблем, докато Googlebot получава съвсем различно съдържание.
Допълнително затруднение е, че заявката технически завършва успешно. Google достига до адреса и получава валиден отговор, но съдържанието в него е неправилно. Поради това стандартните проверки за недостъпни или повредени страници може да не отчетат грешка.
Как да проверите какво вижда Google
Първата стъпка е да прегледате отчета за индексиране на страниците в Google Search Console. Потърсете адреси, обозначени като дубликати или като страници с избрана от Google различна канонична версия.
Чрез инструмента за проверка на URL адрес можете да видите коя страница Google смята за канонична. Ако избраният адрес принадлежи на друг сайт, трябва да проверите какво съдържание е получил Googlebot при обхождането.
Следете и за необичайни случаи, при които страници с уникално съдържание внезапно са определени като дубликати. Това може да е знак, че защитният слой подава един и същ междинен екран на множество URL адреси.
Как да отстраните проблема
Свържете се с администратора на CDN услугата, защитната система или хостинг доставчика. Проверете дали защитата не показва CAPTCHA или проверка за бот на потвърдени заявки от Googlebot.
Не е достатъчно да се разреши достъп само според името на потребителския агент, защото то лесно може да бъде подправено. Необходимо е системата да разпознава потвърдените обхождащи роботи по надежден начин.
След корекцията проверете отново засегнатите адреси и поискайте повторно индексиране чрез инструмента за проверка на URL адрес в Search Console. Ако проблемът засяга по-голяма група страници, използвайте функцията за потвърждаване на корекцията в съответния отчет, когато е налична.
Google може да открие промяната и при следващото автоматично обхождане, но възстановяването на индексацията невинаги е незабавно.
Защо това е важно
Подобен проблем показва, че добрият HTTP статус не гарантира правилно индексиране. Страницата може да връща код 200 и да изглежда напълно достъпна, докато Google получава CAPTCHA, празно съдържание или защитен екран.
Затова при необясним спад в индексираните страници трябва да се проверява не само самият сайт, но и цялата инфраструктура пред него – CDN, защитна стена, антибот система и настройки на хостинга.