Безплатно · Сканиране от страна на сървъра
Проверка на достъпа за AI ботове
Поставете домейн и вижте дали robots.txt разрешава GPTBot, ChatGPT-User, ClaudeBot, Perplexity, Googlebot, Bingbot и други ботове — с точни доказателства от правилата и готови за копиране корекции.
Накратко
- Проверете основните ботове на търсачки, AI ботове за отговори и user-agent за обучение на модели в едно сканиране.
- Вижте точното правило Allow или Disallow — и номера на реда — зад всяко решение за достъп.
- Генерирайте практични пресети за robots.txt, като държите достъпа за търсене отделно от достъпа за обучение.
Какво означава това
robots.txt, без фолклора
robots.txt е учтив файл с инструкции в основата на сайта. Ботовете го четат, преди да заявят страници, след което съпоставят своя user-agent с правилата Allow и Disallow. Печели най-дългото съвпадащо правило, а при равенство печели Allow. Тази проверка прави това решение видимо за ботовете, за които хората питат в момента.
Какво всъщност проверява този инструмент?
Той заявява публичния файл /robots.txt на сайта и прилага стандартните правила на robots.txt с най-дълго съвпадение за основните ботове за търсене, за отговори на живо и за обучение. Където е възможно, показва директивата и номера на реда, довели до всяко решение.
Гарантира ли разрешаването на бот видимост в AI?
Не. Означава само, че robots.txt не блокира достъпа. Дали даден AI продукт цитира, индексира или се обучава върху вашето съдържание, зависи от системите и правилата на съответния доставчик.
Защо да разделям ботовете за отговори на живо от ботовете за обучение?
Много собственици на сайтове искат публичните страници да са достъпни за търсачки и AI асистенти за отговори, но да ограничат широкото обхождане за обучение. Пресетът отразява тази обичайна политика: разрешете ботовете за извличане/цитиране на живо и блокирайте ботовете за обучение, ако това е предпочитанието ви.
Съхранява ли се проверяваният URL адрес?
Не. Сървърът заявява robots.txt, защото на много сайтове браузърите са блокирани от CORS. Проверката работи в паметта, отказва частни/вътрешни цели и не съхранява или логва подадените URL адреси.