Решението дали да бъдат блокирани AI ботовете е преди всичко бизнес въпрос. След като една компания прецени, че не желае нейното съдържание да бъде обхождано, използвано за обучение или достъпвано от определени AI системи, идва техническият въпрос: кой е най-добрият начин за блокиране?
Основните подходи са два. AI ботовете могат да бъдат ограничени чрез файла robots.txt или директно на ниво сървърна инфраструктура. И двата метода имат предимства и недостатъци, но не осигуряват еднаква степен на защита.
Как се блокират AI ботове чрез robots.txt
Блокирането на AI ботове чрез robots.txt се извършва по същия начин, както ограничаването на всеки друг робот.
Всеки AI бот има собствено идентифициращо име. Сред примерите са GPTBot и OAI-SearchBot на OpenAI. За да бъде блокиран конкретен бот, в robots.txt трябва да се добави правило, което посочва неговото име.
За блокиране на GPTBot в целия сайт може да се използва:
User-agent: GPTBot
Disallow: /
Това правило указва на GPTBot да не обхожда нито една страница от сайта.
Възможно е да бъдат ограничени само определени секции. Ако продуктовите страници се намират в директорията /products/, правилото би изглеждало така:
User-agent: GPTBot
Disallow: /products/
По този начин останалата част от сайта остава достъпна за бота, а продуктовите страници се изключват от обхождането.
Как работи блокирането на ниво сървър
AI ботовете могат да бъдат блокирани през самия сървър, мрежата за доставка на съдържание, известна като CDN, или защитната стена за уеб приложения, известна като WAF.
При блокиране през сървъра входящата заявка се проверява въз основа на данни като IP адрес, HTTP заглавки и потребителски агент. След това се прилагат предварително зададени правила за разрешаване, отказване или пренасочване на заявката.
Например сървърът може да получи инструкция да отказва всички заявки от GPTBot. За разлика от robots.txt, в този случай ботът действително няма да получи достъп до съдържанието.
Блокиране на AI ботове чрез CDN
При CDN принципът е сходен, но заявката се спира на по-ранен етап. Мрежата прихваща заявката на бота, преди тя да достигне до основния сървър.
Това намалява използвания сървърен трафик, защото ботът изобщо не взаимодейства със сървъра. Някои CDN доставчици предлагат готови функции за подобно блокиране.
Cloudflare например позволява прилагане на предварително зададени ограничения според предназначението на бота. Той може да бъде разпознат като търсещ робот, AI агент или бот за обучение на модели. Възможно е и по-прецизно конфигуриране за всеки отделен бот.
Блокиране чрез WAF
WAF анализира заявките по-задълбочено от стандартните CDN механизми. Тази защитна система може да разглежда не само заглавките, но и поведението на заявките.
Това ѝ позволява да открива ботове, които се представят с чужд потребителски агент, за да избегнат ограниченията. В повечето технологични конфигурации WAF е най-надеждният начин за разпознаване на по-сложни AI ботове, които се опитват да останат незабелязани.
Защитната стена може да бъде част от използваната CDN услуга, както е при Cloudflare WAF, или да бъде самостоятелно решение като AWS WAF.
Предимства на блокирането чрез robots.txt
Robots.txt обикновено е най-достъпният начин за управление на ботовете от страна на SEO специалистите. Те често разполагат с директен достъп до файла или могат лесно да поискат промяна от екипа по разработката.
Сред основните предимства са:
- Методът се поддържа официално от някои от най-големите AI компании.
- Могат да бъдат блокирани само определени ботове.
- Ограниченията могат да се прилагат само към конкретни страници или директории.
- Не са необходими сложни промени по сървъра.
Сред AI ботовете и механизмите, за които се посочва поддръжка на правилата в robots.txt, са GPTBot и OAI-SearchBot на OpenAI, ClaudeBot, Claude-User и Claude-SearchBot на Anthropic, Google-Extended на Google и PerplexityBot на Perplexity.
Недостатъци на robots.txt
Най-същественият недостатък е, че спазването на robots.txt е доброволно и не се контролира централизирано.
Дори създателят на даден AI бот да твърди, че правилата се спазват, robots.txt не представлява техническа блокировка. Той по-скоро наподобява табела „Влизането забранено“ пред отключена врата. Няма физическа преграда, която да спре бота, ако той е програмиран да игнорира указанията.
Лесното редактиране също крие риск. Ако системата за управление на съдържанието позволява промяна на robots.txt, човек без достатъчно технически познания може по погрешка да блокира повече ботове от предвиденото.
Особено опасно е добавянето на следното правило:
User-agent: *
Disallow: /
То указва на всички ботове да не обхождат сайта. Подобна грешка може да има сериозни последици, включително за видимостта му в традиционните търсачки.
Robots.txt не се актуализира автоматично при появата на нови потребителски агенти. Всеки нов AI бот трябва да бъде добавян ръчно, ако собственикът на сайта иска да го ограничи.
Предимства на блокирането през сървър, CDN или WAF
Основното предимство на блокирането чрез CDN или WAF е, че заявките могат да бъдат спрени, преди да достигнат до основния сървър. Това намалява натоварването, използвания трафик и свързаните с тях разходи.
За разлика от robots.txt, сървърните ограничения не разчитат на доброволното съдействие на бота. Ако robots.txt е предупредителна табела, сървърът, CDN и WAF действат като заключена врата.
Тези решения засичат заявката и отказват достъп до съдържанието независимо дали ботът признава правилата на сайта.
Допълнително предимство е възможността за получаване на отчети за блокираните ботове. Така собствениците могат да установят кои системи се опитват да посещават сайта и колко често го правят.
Подобна информация може да бъде полезна за сайтове, които получават голям обем нежелан AI трафик. Данните биха могли да се използват и при разговори, включително от правен характер, със собствениците на съответните ботове.
Недостатъци на блокирането на ниво сървър
Основният недостатък е по-сложната поддръжка. Достъпът до сървърните файлове, CDN настройките и WAF обикновено е ограничен до специалисти с необходимите технически познания.
Това означава, че промените често трябва да преминат през разработчик, вместо да бъдат направени директно от SEO специалист. Процесът може да изисква допълнително време, ресурси и разходи, особено когато сървърът се управлява от външна агенция.
Съществува и възможност за фалшифициране на идентичността на бота. Макар WAF да е най-силното ниво на защита сред разгледаните решения, напреднали ботове все пак могат да заобиколят някои проверки.
Следователно няма напълно безпогрешен начин за блокиране на недобросъвестни AI ботове. Сървърните решения обаче остават ефективни в повечето случаи.
Robots.txt или блокиране на ниво сървър
Няма универсален отговор, който да е подходящ за всеки сайт. Изборът зависи от техническата инфраструктура, бюджета и начина, по който се управлява сайтът.
При възможност ботовете могат да бъдат ограничени на няколко нива:
- Сървърът може да блокира известни потребителски агенти и да открива прости поведенчески модели.
- CDN може да спира заявките, преди да достигнат до сървъра.
- WAF предлага най-добри възможности за откриване на ботове с фалшифицирана идентичност и по-сложни AI системи за извличане на съдържание.
Не всеки сайт обаче разполага с WAF или с лесен достъп до неговите настройки.
Robots.txt остава най-лесният начин собственикът на даден сайт да заяви, че определени ботове не трябва да обхождат съдържанието. Методът е ефективен срещу отговорни ботове, но може да бъде пренебрегнат. Затова той трябва да се разглежда като възпираща мярка, а не като гарантирана защита.
Кой подход е най-подходящ
Когато блокирането на определени AI ботове е критично за бизнеса, най-сигурният подход е ограничението да бъде приложено възможно най-рано в сървърната инфраструктура.
Препоръчителният ред е:
- Блокиране чрез WAF, когато такава система е налична.
- Блокиране чрез CDN, ако няма достъп до WAF.
- Блокиране директно през сървъра като следваща възможност.
Когато целта е да бъдат ограничени само един или два утвърдени AI бота, robots.txt може да бъде достатъчна възпираща мярка. Дори тогава е важно сървърните логове да се наблюдават, за да се провери дали ботовете действително спазват зададените ограничения.
- ТЕМИ: