В логах небольшого сайта строчки поисковых роботов идут ровным потоком, и однажды глаз цепляется за незнакомое имя: «Mozilla/5.0 (compatible; AhrefsBot/7.0; +http://ahrefs.com/robot/)». Дальше обычно следует вопрос — ahrefsbot, что за бот и почему его так много. Отвечаю сразу: это краулер сервиса Ahrefs, он собирает ссылки для платной базы данных о сайтах и для поисковика Yep. Позиции твоего сайта в Google и Яндексе он не меняет — ни в плюс, ни в минус. Единственное, чем он реально может насолить, — нагрузка на слабый хостинг.
Кстати, сам Ahrefs, ради которого этот робот и работает, российской картой не оплачивается.
Что за AhrefsBot в логах
Разберём строку по частям. `AhrefsBot/7.0` — имя и версия робота, именно это значение подставляется в директивы robots.txt. Ссылка `+http://ahrefs.com/robot/` ведёт на официальную страницу, где компания описывает своих ботов; наличие этой ссылки — нормальная практика честного краулера.
У Ahrefs роботов несколько, и путать их не надо. AhrefsBot ползает по всему открытому вебу без разбора. AhrefsSiteAudit ходит только по тем сайтам, которые кто-то добавил в инструмент технического аудита, и его строка выглядит иначе: `AhrefsSiteAudit/6.1`. У второго есть ещё и мобильная версия — там тот же токен спрятан внутри длинной строки с Android и Chrome.
Практический вывод из этого один. Если в логах у тебя AhrefsSiteAudit, значит, твой сайт кто-то добавил в проект Site Audit — либо ты сам, либо человек, у которого есть доступ к платному аккаунту и интерес к твоему проекту.
Зачем Ahrefs обходит твой сайт и где потом оседают собранные данные
Робот забирает со страницы код и вытаскивает из него ссылки. Каждая найденная ссылка — это новый адрес в очереди на обход и одновременно строчка в базе: «страница А ссылается на страницу Б».
Из этих строчек и собирается всё, за что платят подписку: отчёты о ссылочном профиле, оценки трафика, рейтинги доменов. По собственным цифрам компании в базе живёт 35 триллионов ссылок и 20,1 миллиарда страниц контента, а обновляется индекс каждые 15–30 минут. Про саму оплату у нас есть отдельный разбор — «Как оформить подписку Ahrefs из России в 2026 году: без зарубежной карты».
Со страницы забирается не только сам факт ссылки. В отчётах потом видно текст ссылки, стоит ли на ней атрибут nofollow, когда её впервые заметили и когда видели в последний раз. Из этих мелочей и складывается картина: кто на кого сослался, какими словами и не убрал ли ссылку через месяц.
Вторая точка назначения — поисковик Yep. Это отдельный проект Ahrefs: обычный поиск для людей, без слежки, работающий на том же самом индексе. То есть твоя страница может попасть в его выдачу просто потому, что робот её обошёл.
И третье, о чём часто забывают: данные о тебе видны чужим людям. Любой владелец платного аккаунта может вбить твой домен и посмотреть, кто на тебя ссылается и по каким запросам тебя находят. Разрешения на это никто не спрашивает — робот работает с открытым вебом.
Как часто приходит AhrefsBot и почему нагрузка на сервер скачет неровно
Общие цифры компания публикует, и они внушительные: пять миллионов страниц в минуту, десять миллионов новых адресов за сутки, триста миллионов обновлённых записей. В обучающем разделе Ahrefs называет цифру «более восьми миллиардов страниц за 24 часа» и добавляет, что среди краулеров вообще его бот идёт восьмым — после роботов Google и Bing, — а среди SEO-краулеров первым.
Устроено это так: у сервиса есть общий список известных адресов, а решение, когда идти по конкретному адресу, принимает планировщик. Новые адреса берутся из двух мест — из ссылок, найденных на уже обойдённых страницах, и из перенаправлений, на которые робот наткнулся по пути. Никакой карты сайта ему для этого не нужно, хотя она обход ускоряет.
Персонального расписания для твоего сайта в этих числах нет. Как часто робот придёт именно к тебе, решает планировщик: чем больше на сайте страниц и чем чаще они меняются, тем плотнее обход. Молодой блог из тридцати статей робот навещает редко, крупный каталог с миллионом адресов — почти непрерывно.
Отсюда и рваная нагрузка. Пока страниц мало, бот незаметен. Стоит открыть фильтры в интернет-магазине и наплодить десятки тысяч адресов — и робот радостно пойдёт обходить их все. Владельцы дешёвых тарифов на shared-хостинге ловят это первыми: сайт начинает подтормаживать в самое неожиданное время.
Настоящий бот или подделка: проверка по обратному DNS
Строку user-agent может подставить кто угодно. Под именем AhrefsBot по сайтам регулярно ходят парсеры контента и сканеры уязвимостей — просто потому, что этому имени принято доверять.
Официальный способ проверки один: обратный DNS. Берёшь IP-адрес из лога, делаешь reverse-запрос и смотришь на результат. У настоящего робота имя хоста всегда заканчивается на `ahrefs.com` или `ahrefs.net`. Заканчивается на что-то другое — перед тобой самозванец, и вежливость robots.txt на него не подействует.
На практике это делается одной командой в терминале — `host` или `nslookup` с адресом из лога. В ответе придёт имя хоста; если в нём есть `ahrefs`, всё в порядке. Владельцам сайтов на обычном хостинге проще посмотреть в панели управления: раздел со статистикой посещений почти всегда показывает и адрес, и определившееся имя.
Компания дополнительно публикует диапазоны своих адресов и отдельные IP через API, так что при желании можно свериться со списком целиком, а не проверять адреса поштучно.
Что делать с подделкой — уже вопрос не про Ahrefs, а про защиту сервера: такие визиты блокируют на уровне брандмауэра или через настройки хостинга, потому что директивы в текстовом файле для них пустой звук.
Как замедлить AhrefsBot через Crawl-Delay, не закрывая сайт целиком
Хорошая новость: оба робота Ahrefs, по заявлению компании, строго слушаются robots.txt и понимают директиву задержки для HTML-страниц. Это редкость — многие краулеры Crawl-Delay игнорируют.
Чтобы робот ходил реже, добавь в robots.txt блок:
User-agent: AhrefsBot
Crawl-Delay: 10
Число — это пауза в секундах между запросами. Десятка означает не больше шести обращений в минуту; для среднего сайта этого хватает, чтобы нагрузка перестала быть заметной. Ставить сотню смысла мало: робот просто растянет обход на недели, а результат для тебя не изменится.
Если мешает не сам факт визитов, а конкретный тяжёлый раздел — закрой его:
User-agent: AhrefsBot
Disallow: /search/
Disallow: /filter/
Так обычно поступают с внутренним поиском и фильтрами каталога: страниц там бесконечно много, ценности для ссылочной базы никакой, а серверу тяжело.
Полный запрет пишется одной строкой `Disallow: /` под тем же user-agent. Для AhrefsSiteAudit блок делается отдельно — имя робота другое, и общий запрет для AhrefsBot его не касается.
Тут есть тонкость, из-за которой люди путаются. Google свою поддержку Crawl-Delay свернул давно и директиву просто игнорирует, поэтому в русскоязычных руководствах её часто называют бесполезной. Для Ahrefs это неверно: его роботы задержку понимают, и разница между «раз в секунду» и «раз в десять секунд» на графике нагрузки видна.
Ещё пара вещей, на которых спотыкаются чаще всего. Директивы для разных роботов не смешиваются: блок под `User-agent: *` работает только для тех, у кого нет своего именного блока, и если ты завёл отдельный `User-agent: AhrefsBot`, общие правила для него перестают действовать целиком. Порядок блоков в файле значения не имеет, а вот лишняя пустая строка внутри блока разрывает его пополам, и вторая половина повисает в воздухе.
И самое обидное: файл должен реально открываться. Зайди на свой адрес вида `сайт.ру/robots.txt` в браузере и убедись, что там лежит текст, а не страница ошибки. Правки в панели управления, которые никуда не сохранились, — самая частая причина того, что «ничего не помогло».
Важная деталь про сроки: мгновенно ничего не произойдёт. Компания прямо предупреждает, что роботу нужно время, чтобы подхватить изменения, и делает он это перед следующим плановым обходом. Так что если ты правишь файл в панике из-за нагрузки прямо сейчас, эффекта в ближайшие часы можешь не увидеть.
Когда я первый раз копался в логах чужого проекта, меня удивило другое: доля Ahrefs в общем трафике роботов оказалась заметно меньше, чем ощущалось на глаз. Просто его имя незнакомое, поэтому в глаза бросается именно оно, а привычный Googlebot взгляд не цепляет.
Что спрашивают про AhrefsBot до правки robots.txt
### AhrefsBot вредит позициям в Google и Яндексе?
Нет. Это сторонний краулер, к алгоритмам поисковых систем он отношения не имеет и на ранжирование не влияет. Единственный способ навредить позициям через него — довести сервер до отказов, чтобы уже поисковые роботы получали ошибки вместо страниц.
### Закрою бота — исчезну ли я из чужих отчётов?
Не полностью. Ссылка живёт на странице донора, а не на твоей: пока чужой сайт открыт для обхода, ссылка на тебя будет найдена и записана. Пропадёт другое — свежие данные о содержимом твоих страниц. Со временем твой профиль в отчётах станет неполным и устаревшим, но ты из базы не испаришься.
### Чем AhrefsBot отличается от AhrefsSiteAudit?
Первый обходит весь открытый веб и наполняет общую базу. Второй запускается по конкретному сайту, добавленному в инструмент технического аудита, и работает по заданию владельца платного аккаунта. Разные имена в robots.txt, разные задачи, закрывать их надо отдельными блоками.
### Можно ли пустить бота только в часть сайта?
Да, и это чаще разумнее полного запрета. В блоке под `User-agent: AhrefsBot` сначала закрываешь всё директивой `Disallow: /`, а потом открываешь нужное через `Allow: /blog/`. Работает и обратная схема: сайт открыт целиком, закрыты отдельные ветки вроде корзины и личного кабинета. Роботы Ahrefs, по заявлению компании, robots.txt соблюдают строго, так что точечная настройка до них доходит целиком.
### Что будет с моими страницами в поиске Yep?
Они перестанут обновляться. Yep — собственный поисковик Ahrefs, и работает он на том же индексе: нет обхода — нет свежих данных о содержимом страниц. Аудитория у него пока скромная, так что потеря невелика. Но помнить стоит: закрывая краулер, ты закрываешься не только от аналитического сервиса, но и от поисковой системы, пусть и маленькой.
### Как быстро подействует Disallow?
Не сразу. Робот подхватывает новую версию файла перед очередным запланированным обходом, а не в момент сохранения. Если нужно остановить нагрузку немедленно, действовать придётся на уровне сервера, а не текстового файла.
### Ahrefs как-то компенсирует нагрузку на хостинг?
Нет, и никто из владельцев краулеров этого не делает. Взамен компания даёт бесплатный доступ к Ahrefs Webmaster Tools для подтверждённых сайтов — по сути обмен: твои страницы попадают в индекс, ты получаешь отчёты по своему домену.
Закрывать бота или оставить
Мой ответ — оставить, если сервер справляется. Закрытый AhrefsBot не даёт ни одного очка в поиске, зато лишает тебя возможности видеть собственный сайт в бесплатных инструментах Ahrefs и делает твой профиль слепым пятном для тех, кто мог бы на тебя сослаться.
А вот с чем спорить сложно: если хостинг за триста рублей ложится от обхода, вопрос уже не про SEO, а про то, что сайт живёт на слишком тонкой ветке. Crawl-Delay тут пластырь, а не лечение.
Если дело дойдёт до оплаты
Ahrefs из России картой российского банка не оплатить — про рабочие способы есть отдельный разбор.
Комментарии
Войдите, чтобы написать комментарий