Поисковая оптимизация сайта Поисковая оптимизация сайта сложный процесс направленный на хорошие позиции в результатах выдачи по поисковым запросам. Поискова http://hostpartner.com.ua/ 2018-11-23T21:06:45Z Joomla! 1.5 - Open Source Content Management подбор ключевых слов для оптимизации и раскрутки сайта 2011-04-05T12:01:56Z 2011-04-05T12:01:56Z http://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/podbor-klyuchevyh-slov-dlya-optimizatsii-i-raskrutki-sayta.html donikroman roman@hostpartner.com.ua <p>Вообще, сам процесс грамотного подбора ключевых слов для сайта, уже есть поисковая оптимизация сайта.<br /> Ключевые слова побираются по тематике сайта, для определения и создания семантического ядра сайта и создания точек входа. Точки входа, это внутренние страницы с менее частотными запросами, которые заточены под среднечастотный или низкочастотный трафик.</p> <p>Подбор ключевых слов для сайта, это подбор слов и&nbsp; комбинаций со словами и словосочетаниями (словоформами), по которым сайт будет находиться пользователями в сети.<br /> Прежде всего это должны быть слова по теме сайта.<br /> Например делаем сайт посвященный велосипедам.<br /> Основное ключевое слово &ndash; велосипед. Но оно кроме того что очень конкурентное, еще и ниочем, потому что это общее определение. Кто то ищет где купить велосипед, кто то ищет где продать. Кто то ищет картинку с велосипедом, кто то ищет устройство или чертежи. То есть запросов и посетителей может быть очень много, но все ли они нам нужны. Кроме того, если вы не знаете ничего о подборе слов, значит вы новичок в оптимизации и просто вряд ли вытянете в топ слишком высокочастотный запрос.<br /> Поэтому начинаем подбирать максимально точные вхождения из двух и более слов.<br /> Если наш сайт о продаже велосипедов, то начинаем перебирать варианты.<br /> Купить велосипед, купить велосипед недорого, недорогой велосипед, дешевый велосипед.<br /> То же самое можно проделать уже с классификаторами &ndash; купить горный велосипед, горный велосипед недорого и так далее. Меняем определяющее, к примеру шоссейный - купить шоссейный велосипед, шоссейный велосипед недорого далее сколько хватит фантазии. <br /> Чем точнее и длиннее запрос, тем реже его набирают и тем ниже конкуренция. А значит его легче вытащить в топ.<br /> На каждый класс или разновидность товара/ключа желательно подбирать любые возможные варианты.<br /> Если фантазии не хватает, можно воспользоваться сервисами статистики запросов в яндекс директе и гугл адвордсе. <br /> Но следует помнить, что первоначальная цель этих сервисов &ndash; заставить вас рекламировать свой сайт в их системах за деньги. Поэтому данные там не всегда точные и не всегда честные. Все как то с уклоном в одни ворота.<br /> Эти сервисы полезны тем, что они фиксирую все запросы, даже самые дурацкие, которые даже в голову не сразу придут. Но иногда вот такие запросы и дают не мало трафика.<br /> У яндекса справа в колонке есть еще запросы &ndash; что еще искали с запросом, то есть это смежные запросы. Эту колонку тоже стоит внимательно изучить, потому что попадаются интересные варианты, которые так же приводят посетителя.<br /> И вот когда у вас составлен список из всевозможных словосочетаний, отбирайте нужные вам и потихоньку на основании этого списка пишите текст (контент) на сайт.<br /> Самые частые запросы, размещайте на главную страницу, поменьше на разделы и категории, а совсем уж низкочастотные на самые последние страница 3 и больше уровня вложенности.</p> <p>Вообще, сам процесс грамотного подбора ключевых слов для сайта, уже есть поисковая оптимизация сайта.<br /> Ключевые слова побираются по тематике сайта, для определения и создания семантического ядра сайта и создания точек входа. Точки входа, это внутренние страницы с менее частотными запросами, которые заточены под среднечастотный или низкочастотный трафик.</p> <p>Подбор ключевых слов для сайта, это подбор слов и&nbsp; комбинаций со словами и словосочетаниями (словоформами), по которым сайт будет находиться пользователями в сети.<br /> Прежде всего это должны быть слова по теме сайта.<br /> Например делаем сайт посвященный велосипедам.<br /> Основное ключевое слово &ndash; велосипед. Но оно кроме того что очень конкурентное, еще и ниочем, потому что это общее определение. Кто то ищет где купить велосипед, кто то ищет где продать. Кто то ищет картинку с велосипедом, кто то ищет устройство или чертежи. То есть запросов и посетителей может быть очень много, но все ли они нам нужны. Кроме того, если вы не знаете ничего о подборе слов, значит вы новичок в оптимизации и просто вряд ли вытянете в топ слишком высокочастотный запрос.<br /> Поэтому начинаем подбирать максимально точные вхождения из двух и более слов.<br /> Если наш сайт о продаже велосипедов, то начинаем перебирать варианты.<br /> Купить велосипед, купить велосипед недорого, недорогой велосипед, дешевый велосипед.<br /> То же самое можно проделать уже с классификаторами &ndash; купить горный велосипед, горный велосипед недорого и так далее. Меняем определяющее, к примеру шоссейный - купить шоссейный велосипед, шоссейный велосипед недорого далее сколько хватит фантазии. <br /> Чем точнее и длиннее запрос, тем реже его набирают и тем ниже конкуренция. А значит его легче вытащить в топ.<br /> На каждый класс или разновидность товара/ключа желательно подбирать любые возможные варианты.<br /> Если фантазии не хватает, можно воспользоваться сервисами статистики запросов в яндекс директе и гугл адвордсе. <br /> Но следует помнить, что первоначальная цель этих сервисов &ndash; заставить вас рекламировать свой сайт в их системах за деньги. Поэтому данные там не всегда точные и не всегда честные. Все как то с уклоном в одни ворота.<br /> Эти сервисы полезны тем, что они фиксирую все запросы, даже самые дурацкие, которые даже в голову не сразу придут. Но иногда вот такие запросы и дают не мало трафика.<br /> У яндекса справа в колонке есть еще запросы &ndash; что еще искали с запросом, то есть это смежные запросы. Эту колонку тоже стоит внимательно изучить, потому что попадаются интересные варианты, которые так же приводят посетителя.<br /> И вот когда у вас составлен список из всевозможных словосочетаний, отбирайте нужные вам и потихоньку на основании этого списка пишите текст (контент) на сайт.<br /> Самые частые запросы, размещайте на главную страницу, поменьше на разделы и категории, а совсем уж низкочастотные на самые последние страница 3 и больше уровня вложенности.</p> правильный файл robots txt для яндекса и для google. Директива disallow - запрет индексации robots txt 2011-02-20T16:29:19Z 2011-02-20T16:29:19Z http://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/pravilnyy-fayl-robots-txt-dlya-yandeksa-i-dlya-google-direktiva-disallow-zapret-indeksatsii-robots-txt.html hostpartner info@hostpartner.com.ua <p><span style="color: #000000">В принципе это все собрано из хелпов которые вы должны были прочесть прежде чем делать свой первый сайт.<br /> Должны были по логике создателей этих хелпов и разрабов поисковых систем.<br /> Но в жизни все по другому и читать их мы начинаем тогда, когда реально какая то фигня происходит с сайтом. Причем как правило довольно серьезная.<br /> Здесь представлено три взгляда на файл robots.txt от трех самых актуальных для нас поисковиков<br /> <br /> </span><span style="color: #ff0000"><strong>гугл центр вебмастеров</strong></span></p> <p>В простейшем файле robots.txt используются два правила:<br /> User-agent: робот, к которому применяется следующее правило.<br /> Disallow: URL-адреса, которые необходимо заблокировать.</p> <p>Эти две строки рассматриваются как одна запись в этом файле. Можно включить любое необходимое число записей. В одну запись можно включить несколько строк Disallow и несколько User Agent.</p> <p>Каждый раздел файла robots.txt обрабатывается отдельно; содержание предыдущих разделов не учитывается. Рассмотрим пример.<br /> User-agent: *<br /> Disallow: /katalog1/</p> <p>User-Agent: Googlebot<br /> Disallow: /katalog2/</p> <p>В этом примере для поискового робота Googlebot будут запрещены только URL-адреса, включающие /katalog2/.<br /> Роботы user-agent и другие роботы</p> <p>User Agent - это специальный робот поисковой системы. В базе данных роботов Интернета перечислено множество основных роботов. Можно задать запись для применения к конкретному роботу (указав его название) или указать, что она должна применяться ко всем роботам (с помощью звездочки). Запись, которая применяется ко всем роботам, выглядит следующим образом:<br /> User-agent: *</p> <p>В Google используются несколько различных роботов (User Agent). Робот, используемый для поиска в Интернете, называется Googlebot. Другие наши роботы, например Googlebot-Mobile и Googlebot-Image, следуют правилам, заданным для робота Googlebot, однако для них можно указать отдельные правила. <br /> Блокирование роботов user-agent</p> <p>В строке Disallow перечисляются страницы, которые необходимо заблокировать. Можно указать конкретный URL или шаблон. Ввод должен начинаться с косой черты (/).<br /> Чтобы заблокировать весь сайт, используйте косую черту. <br /> Disallow: /<br /> Чтобы заблокировать каталог и все его содержание, введите после названия каталога косую черту. <br /> Disallow: /nenuzhnyj-katalog/ <br /> Чтобы заблокировать страницу, укажите эту страницу. <br /> Disallow: /lichnyj_file.html<br /> Чтобы удалить конкретное изображение из Картинок Google, добавьте следующие строки: <br /> User-agent: Googlebot-Image<br /> Disallow: /kartinki/sobaki.jpg <br /> Чтобы удалить все изображения с вашего сайта из Картинок Google, добавьте следующие строки: <br /> User-agent: Googlebot-Image<br /> Disallow: / <br /> Чтобы заблокировать все файлы определенного типа (например, GIF), используйте такую запись: <br /> User-agent: Googlebot<br /> Disallow: /*.gif$<br /> Чтобы предотвратить сканирование страниц вашего сайта, но сохранить отображение объявлений AdSense на этих страницах, запретите доступ всех роботов, кроме Mediapartners-Google. Это предотвращает появление страниц в результатах поиска, позволяя роботу Mediapartners-Google анализировать страницы, чтобы определить, какие объявления нужно показывать. Робот Mediapartners-Google имеет отдельный доступ к страницам, независимый от других агентов Google. Рассмотрим пример. <br /> User-agent: *<br /> Disallow: /</p> <p>User-agent: MediaPartners-Google<br /> Allow: /</p> <p>Помните, что в командах учитывается регистр. Например, команда Disallow: /junk_file.asp заблокирует файл http://www.example.com/junk_file.asp, но пропустит файл http://www.example.com/Junk_file.asp. Поисковый робот Googlebot игнорирует пробелы (в пустых строках) и неизвестные директивы в файле robots.txt.</p> <p>Googlebot поддерживает отправку файлов Sitemap через файл robots.txt. <br /> Соответствие шаблону</p> <p>Робот Googlebot (но не все поисковые системы) соблюдает некоторые типы соответствия шаблону.<br /> Чтобы сопоставлять последовательность символов, используйте звездочку (*).Например, чтобы заблокировать доступ ко всем вложенным каталогам, начинающимся с private, введите строки: <br /> User-agent: Googlebot<br /> Disallow: /lichnoe*/<br /> Чтобы заблокировать доступ ко всем URL-адресам, содержащим знак вопроса (?) (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат вопросительный знак), добавьте в файл robots.txt следующую запись: <br /> User-agent: Googlebot<br /> Disallow: /*?<br /> Чтобы задать соответствие конечных символов URL-адреса, используйте символ $. Например, чтобы заблокировать доступ к URL, оканчивающемуся на .xls, используйте следующие строки: <br /> User-agent: Googlebot <br /> Disallow: /*.xls$</p> <p>Это соответствие шаблону можно использовать вместе с командой Allow. Например, если знак ? обозначает идентификатор сеанса, можно исключить содержащие этот символ URL-адреса, чтобы робот Googlebot не сканировал повторяющиеся страницы. Но URL-адреса, заканчивающиеся на ?, могут являться версией страницы, которую необходимо включить в индекс. В таком случае можно создать в файле robots.txt следующую запись: <br /> User-agent: *<br /> Allow: /*?$<br /> Disallow: /*?</p> <p>Строка Disallow:/ *? блокирует доступ ко всем URL-адресам со знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, внутри которой встречается знак вопроса).</p> <p>Строка Allow: /*?$ разрешает доступ ко всем URL-адресам, оканчивающимся знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, заканчивающуюся на ?, после которого нет других символов).<br /> <br /> <span style="color: #ff0000"><strong>Яндекс вебмастер помощь </strong></span></p> <p><em><span style="color: #000000"><strong>Использование robots.txt</strong></span></em></p> <p><strong>Что такое файл robots.txt</strong></p> <p>Robots.txt &mdash; текстовый файл, расположенный на сайте, который предназначен для роботов поисковых систем. В этом файле веб-мастер может указать параметры индексирования своего сайта как для всех роботов сразу, так и для каждой поисковой системы по отдельности.</p> <p><br /> <span style="color: #000000"><strong>Как создать robots.txt</strong></span></p> <p>Воспользуйтесь любым текстовым редактором (например, Блокнотом или WordPad'ом), создайте файл с именем &quot;robots.txt&quot; и заполните его в соответствии с представленными ниже правилами. После этого необходимо загрузить файл в корневой каталог вашего сайта.</p> <p>Чтобы проверить правильность обработки вашего файла robots.txt, воспользуйтесь анализатором файла robots.txt.</p> <p><span style="color: #000000"><strong>Директива User-agent</strong></span></p> <p>Управлять доступом робота Яндекса к вашему сайту вы можете при помощи файла robots.txt, который должен быть размещен в корневой директории сайта. Робот Яндекса поддерживает стандарт описания http://www.robotstxt.org/wc/norobots.html с расширенными возможностями, описанными ниже.</p> <p>В роботе Яндекса используется сессионный принцип работы, на каждую сессию формируется определенный пул страниц, которые планирует закачать робот. Сессия начинается с закачки robots.txt сайта, если его нет, он не текстовый или на запрос робота возвращается HTTP-код отличный от '200', считается, что доступ роботу не ограничен. В самом robots.txt проверяется наличие записей, начинающихся с 'User-agent:', в них ищутся подстроки 'Yandex', либо '*' (регистр значения не имеет), причем, если обнаружено 'User-agent: Yandex', директивы для 'User-agent: *' не учитываются. Если записи 'User-agent: Yandex' и 'User-agent: *' отсутствуют, считается, что доступ роботу не ограничен.</p> <p><br /> <span style="color: #000000"><strong>Использование директив Disallow и Allow.</strong></span></p> <p>Чтобы запретить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Disallow'. Примеры: <br /> User-agent: Yandex<br /> Disallow: / # блокирует доступ ко всему сайту</p> <p>User-agent: Yandex<br /> Disallow: /cgi-bin # блокирует доступ к страницам <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; #начинающимся с '/cgi-bin'</p> <p>Примечание:</p> <p>Недопустимо наличие пустых переводов строки между директивами 'User-agent' и 'Disallow' ('Allow'), а также между самими 'Disallow' ('Allow') директивами.</p> <p>Кроме того, в соответствии со стандартом перед каждой директивой 'User-agent' рекомендуется вставлять пустой перевод строки.</p> <p>Символ '#' предназначен для описания комментариев. Все, что находится после этого символа и до первого перевода строки не учитывается.</p> <p>Чтобы разрешить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Allow'. Примеры: <br /> User-agent: Yandex<br /> Allow: /cgi-bin<br /> Disallow: /<br /> # запрещает скачивать все, кроме страниц <br /> # начинающихся с '/cgi-bin'<br /> &nbsp;<br /> <span style="color: #000000"><strong>Совместное использование директив. </strong></span></p> <p>Если для данной страницы сайта подходит несколько директив, то выбирается первая в порядке появления в выбранном User-agent блоке. Примеры, если: <br /> User-agent: Yandex<br /> Allow: /cgi-bin<br /> Disallow: /<br /> # запрещает скачивать все, кроме страниц <br /> # начинающихся с '/cgi-bin'<br /> User-agent: Yandex<br /> Disallow: /<br /> Allow: /cgi-bin<br /> # запрещает скачивать весь сайт</p> <p><span style="color: #000000"><strong>Директивы Allow-Disallow без параметров. </strong></span></p> <p>Отсутствие параметров у директивы трактуется следующим образом: <br /> User-agent: Yandex<br /> Disallow: # тоже что и Allow: /</p> <p>User-agent: Yandex<br /> Allow: # тоже что и Disallow: /<br /> наверх<br /> Использование спецсимволов &quot;*&quot; и &quot;$&quot;.</p> <p>При указании путей директив Allow-Disallow можно использовать спецсимволы '*' и '$', задавая, таким образом, определенные регулярные выражения. Спецсимвол '*' означает любую (в том числе пустую) последовательность символов. Примеры: <br /> User-agent: Yandex<br /> Disallow: /cgi-bin/*.aspx # запрещает '/cgi-bin/example.aspx'<br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # и '/cgi-bin/private/test.aspx'<br /> Disallow: /**$ # так же, как 'Disallow: /example' <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; #запрещает и /example.html и /example</p> <p><span style="color: #000000"><strong>Директива Sitemap.</strong></span></p> <p>Если вы используете описание структуры вашего сайта в формате sitemaps.xml, и хотите, чтобы робот private # запрещает не только '/private',<br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # но и '/cgi-bin/private'</p> <p>Спецсимвол '$'.</p> <p>По умолчанию к концу каждого правила, описанного в robots.txt, приписывается '*', например: <br /> User-agent: Yandex<br /> Disallow: /cgi-bin* # блокирует доступ к страницам <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # начинающимся с '/cgi-bin'<br /> Disallow: /cgi-bin # то же самое</p> <p>чтобы отменить '*' на конце правила, можно использовать спецсимвол '$', например: <br /> User-agent: Yandex<br /> Disallow: /example$ # запрещает '/example', <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # но не запрещает '/example.html'<br /> User-agent: Yandex<br /> Disallow: /example # запрещает и '/example', <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # и '/example.html'<br /> User-agent: Yandex<br /> Disallow: /example$ # запрещает только '/example'<br /> Disallow: /exampleузнал о ней, укажите путь к sitemaps.xml, в качестве параметра директивы 'Sitemap' (если файлов несколько, укажите все), примеры: <br /> User-agent: Yandex<br /> Allow: /<br /> Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br /> Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p> <p>или <br /> User-agent: Yandex<br /> Allow: /</p> <p>User-agent: *<br /> Disallow: /</p> <p>Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br /> Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p> <p>Робот запомнит пути к sitemaps.xml, обработает файлы и будет использовать результаты при последующем формировании сессий закачки.</p> <p><span style="color: #000000"><strong>Директива Host.</strong></span></p> <p>Если ваш сайт имеет зеркала, специальный робот зеркальщик определит их и сформирует группу зеркал вашего сайта. В поиске будет участвовать только главное зеркало. Вы можете указать его у всех зеркал при помощи robots.txt, используя директиву 'Host', определив в качестве ее параметра имя главного зеркала. Директива 'Host' не гарантирует выбор указанного главного зеркала, тем не менее, алгоритм при принятии решения учитывает ее с высоким приоритетом. Пример: <br /> #Если www.glavnoye-zerkalo.ru главное зеркало сайта, то&nbsp; <br /> #robots.txt для всех сайтов из группы зеркал выглядит так <br /> User-Agent: *<br /> Disallow: /forum<br /> Disallow: /cgi-bin<br /> Host: www.glavnoye-zerkalo.ru</p> <p>Важно: в целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву 'Host' необходимо добавлять в группе, начинающейся с записи 'User-Agent', непосредственно после директив 'Disallow'('Allow'). Аргументом директивы 'Host' является доменное имя с номером порта (80 по умолчанию), отделенным двоеточием. <br /> #Пример корректно составленного robots.txt, при обработке <br /> #которого директива Host учитывается<br /> User-Agent: *<br /> Disallow:<br /> Host: www.myhost.ru<br /> &nbsp;<br /> #Примеры некорректно составленных robots.txt, при обработке <br /> #которых директива Host может не учитываться<br /> #1.<br /> User-Agent: *<br /> Host: www.myhost.ru</p> <p>#2.<br /> Host: www.myhost.ru</p> <p>#3.<br /> User-Agent: *<br /> Host: www.myhost.ru<br /> Disallow:</p> <p>#4.<br /> Host: www.myhost.ru<br /> User-Agent: *<br /> Disallow:</p> <p>Важно: параметр директивы Host обязан состоять из одного корректного имени хоста (т.е. соответствующего RFC 952 и не являющегося IP-адресом) и допустимого номера порта. Некорректно составленные строчки 'Host:' игнорируются. <br /> # Примеры игнорируемых директив Host<br /> Host: www.myhost-.ru<br /> Host: www.-myhost.ru<br /> Host: www.myhost.ru:100000<br /> Host: www.my_host.ru<br /> Host: .my-host.ru:8000<br /> Host: my-host.ru.<br /> Host: my..host.ru<br /> Host: www.myhost.ru/<br /> Host: www.myhost.ru:8080/<br /> Host: http://www.myhost.ru<br /> Host: 213.180.194.129<br /> Host: www.firsthost.ru,www.secondhost.ru<br /> Host: www.firsthost.ru www.secondhost.ru</p> <p>Примеры использования директивы Host: <br /> # domen.myhost.ru является главным зеркалом <br /> # www.domen.myhost.ru, тогда корректное использование <br /> # директивы Host такое:<br /> User-Agent: *<br /> Disallow:<br /> Host: domen.myhost.ru</p> <p># domen.myhost.ru является главным зеркалом <br /> # www.domen.myhost.ru, тогда некорректное использование <br /> # директивы Host такое:<br /> User-Agent: *<br /> Disallow:<br /> Host: myhost.ru<br /> &nbsp;<br /> <span style="color: #000000"><strong>Директива Crawl-delay.</strong></span></p> <p>Если сервер сильно нагружен и не успевает отрабатывать запросы на закачку, воспользуйтесь директивой &quot;Crawl-delay&quot;. Она позволяет задать поисковому роботу минимальный период времени (в секундах) между концом закачки одной страницы и началом закачки следующей. В целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву &quot;Crawl-delay&quot; необходимо добавлять в группе, начинающейся с записи &quot;User-Agent&quot;, непосредственно после директив &quot;Disallow&quot; (&quot;Allow&quot;).</p> <p>Поисковый робот Яндекса поддерживает дробные значения Crawl-Delay, например, 0.5. Это не гарантирует, что поисковый робот будет заходить на ваш сайт каждые полсекунды, но дает роботу больше свободы и позволяет ускорить обход сайта.</p> <p>Примеры: <br /> User-agent: Yandex<br /> Crawl-delay: 2 # задает таймаут в 2 секунды</p> <p>User-agent: *<br /> Disallow: /search<br /> Crawl-delay: 4.5 # задает таймаут в 4.5 секунды<br /> Наверх</p> <p><span style="color: #000000"><strong>Директива Clean-param</strong></span></p> <p>Если адреса страниц вашего сайта содержат динамические параметры которые не влияют на их содержимое (например: идентификаторы сессий, пользователей, рефереров и т.п.), вы можете описать их при помощи директивы 'Clean-param'. Робот Яндекса, используя эту информацию, не будет многократно перезакачивать дублирующуюся информацию. Таким образом, увеличится эффективность обхода вашего сайта, снизится нагрузка на сервер.</p> <p>Например, на сайте есть страницы: <br /> www.site.ru/some_dir/get_book.pl?ref=site_1&amp;book_id=123<br /> www.site.ru/some_dir/get_book.pl?ref=site_2&amp;book_id=123<br /> www.site.ru/some_dir/get_book.pl?ref=site_3&amp;book_id=123</p> <p>параметр 'ref=' используется только для того, чтобы отследить с какого ресурса был сделан запрос и не меняет содержимое, по всем трем адресам будет показана одна и та же страница с книгой 'book_id=123'. Тогда, если в robots.txt указать: <br /> Clean-param: ref /some_dir/get_book.pl</p> <p>вот так: <br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: ref /some_dir/get_book.pl</p> <p>робот Яндекса сведет все адреса страницы к одному: <br /> www.site.ru/some_dir/get_book.pl?ref=site_1&amp;book_id=123,</p> <p>Если на сайте доступна страница без параметров:<br /> www.site.ru/some_dir/get_book.pl?book_id=123</p> <p>То все сведется именно к ней, когда она будет проиндексирована роботом. Другие страницы вашего сайта будут обходиться чаще, так как нет необходимости обновлять страницы: <br /> www.site.ru/some_dir/get_book.pl?ref=site_2&amp;book_id=123<br /> www.site.ru/some_dir/get_book.pl?ref=site_3&amp;book_id=123</p> <p>Синтаксис использования директивы: <br /> Clean-param: p0[&amp;p1&amp;p2&amp;..&amp;pn] [path]</p> <p>В первом поле через '&amp;' перечисляются параметры, которые нужно не учитывать. Во втором поле указывается префикс пути страниц, для которых нужно применить правило.</p> <p><strong>Примечание:</strong></p> <p>Префикс может содержать регулярное выражение в формате, аналогичном robots.txt, но с некоторыми ограничениями: можно использовать только символы A-Za-z0-9.-/*_. При этом * трактуется так же, как в robots.txt. В конец префикса всегда неявно дописывается '*', то есть: <br /> Clean-param: s /forum/showthread.php</p> <p>означает, что параметр s будет считаться незначащим для всех url-ов, начинающихся с /forum/showthread.php. Второе поле указывать необязательно, в этом случае правило будет применяться для всех страниц сайта. Регистр учитывается. Действует ограничение на длину правила &mdash; 500 символов. Например: <br /> Clean-param: abc /forum/showthread.php<br /> Clean-param: sid&amp;sort /forumt/*.php<br /> Clean-param: someTrash&amp;otherTrash</p> <p>Дополнительные примеры: <br /> #для адресов вида:<br /> www.site1.ru/forum/showthread.php?s=681498b9648949605&amp;t=8243<br /> www.site1.ru/forum/showthread.php?s=1e71c4427317a117a&amp;t=8243<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: s /forum/showthread.php<br /> #для адресов&nbsp; вида:<br /> www.site2.ru/index.php?page=1&amp;sort=3a&amp;sid=2564126ebdec301c607e5df<br /> www.site2.ru/index.php?page=1&amp;sort=3a&amp;sid=974017dcd170d6c4a5d76ae<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: sid /index.php<br /> #если таких параметров несколько:<br /> www.site1.ru/forum_old/showthread.php?s=681498605&amp;t=8243&amp;ref=1311<br /> www.site1.ru/forum_new/showthread.php?s=1e71c417a&amp;t=8243&amp;ref=9896<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: s&amp;ref /forum*/showthread.php<br /> #если параметр используется в нескольких скриптах:<br /> www.site1.ru/forum/showthread.php?s=681498b9648949605&amp;t=8243<br /> www.site1.ru/forum/index.php?s=1e71c4427317a117a&amp;t=8243<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: s /forum/index.php<br /> Clean-param: s /forum/showthread.php</p> <p><br /> <span style="color: #ff0000">Дополнительная информация.</span></p> <p><span style="color: #800000"><strong>Директивы robots.txt, которые не упомянуты в данном описании, робот Яндекса не поддерживает. </strong></span></p> <p>Необходимо помнить, что результат использования расширений формата robots.txt может отличаться от результата без них, а именно: <br /> User-agent: Yandex&nbsp;<br /> Allow: /<br /> Disallow: /<br /> # без расширений все запрещалось так как 'Allow: /' игнорировалось, <br /> # с поддержкой расширений все разрешается</p> <p>User-agent: Yandex<br /> Disallow: /private*html<br /> # без расширений запрещалось '/private*html', <br /> # а с поддержкой расширений и '/private*html', <br /> # и '/private/test.html', и '/private/html/test.aspx' и т.п.</p> <p>User-agent: Yandex<br /> Disallow: /private$<br /> # без расширений запрещалось '/private$' и '/private$test' и т.п., <br /> # а с поддержкой расширений только '/private'</p> <p>User-agent: *<br /> Disallow: /<br /> User-agent: Yandex<br /> Allow: /<br /> # без расширений из-за отсутствия перевода строки, <br /> # 'User-agent: Yandex' было бы проигнорировано и <br /> # результатом стало бы 'Disallow: /', но робот Яндекса <br /> # выделяет записи по наличию в строке 'User-agent:', <br /> # результат для робота Яндекса в данном случае 'Allow: /'</p> <p>User-agent: *<br /> Disallow: /<br /> # комментарий1...<br /> # комментарий2...<br /> # комментарий3...<br /> User-agent: Yandex<br /> Allow: /<br /> # аналогично предыдущему примеру (см. выше)</p> <p>Примеры использования расширенного формата robots.txt: <br /> User-agent: Yandex<br /> Allow: /archive<br /> Disallow: /<br /> # разрешает все, что содержит '/archive', остальное запрещено</p> <p>User-agent: Yandex<br /> Allow: /obsolete/private/*.html$ # разрешает html файлы <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # по пути '/obsolete/private/...'<br /> Disallow: /*.php$&nbsp; # запрещает все '*.php' на данном сайте<br /> Disallow: /*/private/ # запрещает все подпути содержащие <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # '/private/', но Allow выше отменяет <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # часть запрета<br /> Disallow: /*/old/*.zip$ # запрещает все '*.zip' файлы, содержащие <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # в пути '/old/'</p> <p>User-agent: Yandex<br /> Disallow: /add.php?*user= <br /> # запрещает все скрипты 'add.php?' с параметром 'user'</p> <p>При написании robots.txt необходимо помнить, что у робота есть разумное ограничение на его размер. Слишком большие robots.txt (более 32 Кб) считаются полностью разрешающими, то есть рассматриваются аналогично: <br /> User-agent: Yandex<br /> Disallow:</p> <p>Также разрешающими считаются robots.txt, которые не удалось закачать (например, по причине неправильных http-заголовков) или отдающие 404 ошибку.<br /> <br /> <span style="color: #ff0000"><strong>Рамблер - Формат файла robots.txt</strong></span></p> <p><span style="color: #000000"><strong>Формат файла robots.txt</strong></span></p> <p>Формат файла robots.txt - особый. Он состоит из записей, каждая из которых состоит из двух полей: строки с названием клиентского приложения (user-agent), и одной или нескольких строк, начинающихся с директивы Disallow: <br /> &lt;Поле&gt; &quot;:&quot; &lt;значение&gt;</p> <p>Robots.txt должен создаваться в текстовом формате Unix. Большинство хороших текстовых редакторов уже умеют превращать символы перевода строки Windows в Unix. Либо ваш FTP-клиент должен уметь это делать. Для редактирования не пытайтесь пользоваться HTML-редактором, особенно таким, который не имеет текстового режима отображения кода.<br /> Поле User-agent</p> <p>Строка User-agent содержит название робота. Робота Рамблера зовут: StackRambler поэтому если вы хотите создать инструкцию персольнально для нашего робота, то строка должна выглядеть следующим образом:<br /> User-agent: StackRambler</p> <p>Вы можете создать инструкцию для всех роботов: <br /> User-agent: *</p> <p>Поле Disallow:</p> <p>Вторая часть записи состоит из строк Disallow. Эти строки - директивы (указания, команды) для данного робота. В каждой группе, вводимой строкой User-agent, должна быть хотя бы одна инструкция Disallow. Количество инструкций Disallow не ограничено.Они сообщают роботу какие файлы и/или каталоги роботу неразрешено индексировать. Вы можете запретить индексацию файла или каталога.</p> <p>Следующая директива запрещает индексацию каталога /cgi-bin/:<br /> Disallow: /cgi-bin/ Обратите внимание на / в конце названия директории. Это важно. Чтобы запрещать посещение именно каталога &quot;/dir&quot;, инструкция должна иметь вид: &quot;Disallow: /dir/&quot;. А строка &quot;Disallow: /dir&quot; запрещает посещение всех страниц сервера, полное имя которых (от корня сервера) начинается с &quot;/dir&quot;. Например: &quot;/dir.html&quot;, &quot;/dir/index.html&quot;, &quot;/directory.html&quot;.</p> <p>Внимание: точно так же и инструкции &quot;Disallow: *&quot;, &quot;Disallow: *.doc&quot;, &quot;Disallow: /dir/*.doc&quot; не запрещают ничего, поскольку файлов, имя которых начинается со звездочки или содержит ее, не существует! Использование регулярных выражений в строках Disallow, равно как и в файле robots.txt вообще, не предусмотрено.</p> <p>Записаная следующим образом директива запрещает индексацию файла index.htm находящегося в корне:<br /> Disallow: /index.htm</p> <p>К сожалению, инструкций Allow в файлах robots.txt не бывает. Поэтому даже если закрытых для индексирования документов очень много, Вам все равно придется перечислять именно их, а не немногочисленные &quot;открытые&quot; документы. Продумайте структуру сайта, чтобы закрытые для индексирования документы были собраны по возможности в одном месте.</p> <p>Если директива Disallow будет пустой, это значит, что робот может индексировать ВСЕ файлы. Как минимум одна директива Disallow должна присутствовать для каждого поля User-agent, чтобы robots.txt считался верным. Полностью пустой robots.txt означает то же самое, как если бы его не было вообще.</p> <p>Пустые строки и комментарии</p> <p>Пустые строки допускаются между группами инструкций, вводимыми User-agent.</p> <p>Инструкция Disallow учитывается, только если она подчинена какой-либо строке User-agent - то есть если выше нее есть строка User-agent.</p> <p>Любой текст от знака решетки &quot;#&quot; до конца строки считается комментарием и игнорируется.</p> <p>Пример:</p> <p>Следующий простой файл robots.txt запрещает индексацию всех страниц сайта всем роботам, кроме робота Рамблера, которому, наоборот, разрешена индексация всех страниц сайта.<br /> # Инструкции для всех роботов<br /> User-agent: *<br /> Disallow: /</p> <p># Инструкции для робота Рамблера<br /> User-agent: StackRambler<br /> Disallow:<br /> Распространенные ошибки: <br /> Перевернутый синтаксис: <br /> User-agent: /<br /> Disallow: StackRambler<br /> А должно быть так: <br /> User-agent: StackRambler<br /> Disallow: /<br /> Несколько директив Disallow в одной строке: <br /> Disallow: /css/ /cgi-bin/ /images/<br /> Правильно так: <br /> Disallow: /css/<br /> Disallow: /cgi-bin/<br /> Disallow: /images/</p> <p><span style="color: #000000">В принципе это все собрано из хелпов которые вы должны были прочесть прежде чем делать свой первый сайт.<br /> Должны были по логике создателей этих хелпов и разрабов поисковых систем.<br /> Но в жизни все по другому и читать их мы начинаем тогда, когда реально какая то фигня происходит с сайтом. Причем как правило довольно серьезная.<br /> Здесь представлено три взгляда на файл robots.txt от трех самых актуальных для нас поисковиков<br /> <br /> </span><span style="color: #ff0000"><strong>гугл центр вебмастеров</strong></span></p> <p>В простейшем файле robots.txt используются два правила:<br /> User-agent: робот, к которому применяется следующее правило.<br /> Disallow: URL-адреса, которые необходимо заблокировать.</p> <p>Эти две строки рассматриваются как одна запись в этом файле. Можно включить любое необходимое число записей. В одну запись можно включить несколько строк Disallow и несколько User Agent.</p> <p>Каждый раздел файла robots.txt обрабатывается отдельно; содержание предыдущих разделов не учитывается. Рассмотрим пример.<br /> User-agent: *<br /> Disallow: /katalog1/</p> <p>User-Agent: Googlebot<br /> Disallow: /katalog2/</p> <p>В этом примере для поискового робота Googlebot будут запрещены только URL-адреса, включающие /katalog2/.<br /> Роботы user-agent и другие роботы</p> <p>User Agent - это специальный робот поисковой системы. В базе данных роботов Интернета перечислено множество основных роботов. Можно задать запись для применения к конкретному роботу (указав его название) или указать, что она должна применяться ко всем роботам (с помощью звездочки). Запись, которая применяется ко всем роботам, выглядит следующим образом:<br /> User-agent: *</p> <p>В Google используются несколько различных роботов (User Agent). Робот, используемый для поиска в Интернете, называется Googlebot. Другие наши роботы, например Googlebot-Mobile и Googlebot-Image, следуют правилам, заданным для робота Googlebot, однако для них можно указать отдельные правила. <br /> Блокирование роботов user-agent</p> <p>В строке Disallow перечисляются страницы, которые необходимо заблокировать. Можно указать конкретный URL или шаблон. Ввод должен начинаться с косой черты (/).<br /> Чтобы заблокировать весь сайт, используйте косую черту. <br /> Disallow: /<br /> Чтобы заблокировать каталог и все его содержание, введите после названия каталога косую черту. <br /> Disallow: /nenuzhnyj-katalog/ <br /> Чтобы заблокировать страницу, укажите эту страницу. <br /> Disallow: /lichnyj_file.html<br /> Чтобы удалить конкретное изображение из Картинок Google, добавьте следующие строки: <br /> User-agent: Googlebot-Image<br /> Disallow: /kartinki/sobaki.jpg <br /> Чтобы удалить все изображения с вашего сайта из Картинок Google, добавьте следующие строки: <br /> User-agent: Googlebot-Image<br /> Disallow: / <br /> Чтобы заблокировать все файлы определенного типа (например, GIF), используйте такую запись: <br /> User-agent: Googlebot<br /> Disallow: /*.gif$<br /> Чтобы предотвратить сканирование страниц вашего сайта, но сохранить отображение объявлений AdSense на этих страницах, запретите доступ всех роботов, кроме Mediapartners-Google. Это предотвращает появление страниц в результатах поиска, позволяя роботу Mediapartners-Google анализировать страницы, чтобы определить, какие объявления нужно показывать. Робот Mediapartners-Google имеет отдельный доступ к страницам, независимый от других агентов Google. Рассмотрим пример. <br /> User-agent: *<br /> Disallow: /</p> <p>User-agent: MediaPartners-Google<br /> Allow: /</p> <p>Помните, что в командах учитывается регистр. Например, команда Disallow: /junk_file.asp заблокирует файл http://www.example.com/junk_file.asp, но пропустит файл http://www.example.com/Junk_file.asp. Поисковый робот Googlebot игнорирует пробелы (в пустых строках) и неизвестные директивы в файле robots.txt.</p> <p>Googlebot поддерживает отправку файлов Sitemap через файл robots.txt. <br /> Соответствие шаблону</p> <p>Робот Googlebot (но не все поисковые системы) соблюдает некоторые типы соответствия шаблону.<br /> Чтобы сопоставлять последовательность символов, используйте звездочку (*).Например, чтобы заблокировать доступ ко всем вложенным каталогам, начинающимся с private, введите строки: <br /> User-agent: Googlebot<br /> Disallow: /lichnoe*/<br /> Чтобы заблокировать доступ ко всем URL-адресам, содержащим знак вопроса (?) (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат вопросительный знак), добавьте в файл robots.txt следующую запись: <br /> User-agent: Googlebot<br /> Disallow: /*?<br /> Чтобы задать соответствие конечных символов URL-адреса, используйте символ $. Например, чтобы заблокировать доступ к URL, оканчивающемуся на .xls, используйте следующие строки: <br /> User-agent: Googlebot <br /> Disallow: /*.xls$</p> <p>Это соответствие шаблону можно использовать вместе с командой Allow. Например, если знак ? обозначает идентификатор сеанса, можно исключить содержащие этот символ URL-адреса, чтобы робот Googlebot не сканировал повторяющиеся страницы. Но URL-адреса, заканчивающиеся на ?, могут являться версией страницы, которую необходимо включить в индекс. В таком случае можно создать в файле robots.txt следующую запись: <br /> User-agent: *<br /> Allow: /*?$<br /> Disallow: /*?</p> <p>Строка Disallow:/ *? блокирует доступ ко всем URL-адресам со знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, внутри которой встречается знак вопроса).</p> <p>Строка Allow: /*?$ разрешает доступ ко всем URL-адресам, оканчивающимся знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, заканчивающуюся на ?, после которого нет других символов).<br /> <br /> <span style="color: #ff0000"><strong>Яндекс вебмастер помощь </strong></span></p> <p><em><span style="color: #000000"><strong>Использование robots.txt</strong></span></em></p> <p><strong>Что такое файл robots.txt</strong></p> <p>Robots.txt &mdash; текстовый файл, расположенный на сайте, который предназначен для роботов поисковых систем. В этом файле веб-мастер может указать параметры индексирования своего сайта как для всех роботов сразу, так и для каждой поисковой системы по отдельности.</p> <p><br /> <span style="color: #000000"><strong>Как создать robots.txt</strong></span></p> <p>Воспользуйтесь любым текстовым редактором (например, Блокнотом или WordPad'ом), создайте файл с именем &quot;robots.txt&quot; и заполните его в соответствии с представленными ниже правилами. После этого необходимо загрузить файл в корневой каталог вашего сайта.</p> <p>Чтобы проверить правильность обработки вашего файла robots.txt, воспользуйтесь анализатором файла robots.txt.</p> <p><span style="color: #000000"><strong>Директива User-agent</strong></span></p> <p>Управлять доступом робота Яндекса к вашему сайту вы можете при помощи файла robots.txt, который должен быть размещен в корневой директории сайта. Робот Яндекса поддерживает стандарт описания http://www.robotstxt.org/wc/norobots.html с расширенными возможностями, описанными ниже.</p> <p>В роботе Яндекса используется сессионный принцип работы, на каждую сессию формируется определенный пул страниц, которые планирует закачать робот. Сессия начинается с закачки robots.txt сайта, если его нет, он не текстовый или на запрос робота возвращается HTTP-код отличный от '200', считается, что доступ роботу не ограничен. В самом robots.txt проверяется наличие записей, начинающихся с 'User-agent:', в них ищутся подстроки 'Yandex', либо '*' (регистр значения не имеет), причем, если обнаружено 'User-agent: Yandex', директивы для 'User-agent: *' не учитываются. Если записи 'User-agent: Yandex' и 'User-agent: *' отсутствуют, считается, что доступ роботу не ограничен.</p> <p><br /> <span style="color: #000000"><strong>Использование директив Disallow и Allow.</strong></span></p> <p>Чтобы запретить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Disallow'. Примеры: <br /> User-agent: Yandex<br /> Disallow: / # блокирует доступ ко всему сайту</p> <p>User-agent: Yandex<br /> Disallow: /cgi-bin # блокирует доступ к страницам <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; #начинающимся с '/cgi-bin'</p> <p>Примечание:</p> <p>Недопустимо наличие пустых переводов строки между директивами 'User-agent' и 'Disallow' ('Allow'), а также между самими 'Disallow' ('Allow') директивами.</p> <p>Кроме того, в соответствии со стандартом перед каждой директивой 'User-agent' рекомендуется вставлять пустой перевод строки.</p> <p>Символ '#' предназначен для описания комментариев. Все, что находится после этого символа и до первого перевода строки не учитывается.</p> <p>Чтобы разрешить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Allow'. Примеры: <br /> User-agent: Yandex<br /> Allow: /cgi-bin<br /> Disallow: /<br /> # запрещает скачивать все, кроме страниц <br /> # начинающихся с '/cgi-bin'<br /> &nbsp;<br /> <span style="color: #000000"><strong>Совместное использование директив. </strong></span></p> <p>Если для данной страницы сайта подходит несколько директив, то выбирается первая в порядке появления в выбранном User-agent блоке. Примеры, если: <br /> User-agent: Yandex<br /> Allow: /cgi-bin<br /> Disallow: /<br /> # запрещает скачивать все, кроме страниц <br /> # начинающихся с '/cgi-bin'<br /> User-agent: Yandex<br /> Disallow: /<br /> Allow: /cgi-bin<br /> # запрещает скачивать весь сайт</p> <p><span style="color: #000000"><strong>Директивы Allow-Disallow без параметров. </strong></span></p> <p>Отсутствие параметров у директивы трактуется следующим образом: <br /> User-agent: Yandex<br /> Disallow: # тоже что и Allow: /</p> <p>User-agent: Yandex<br /> Allow: # тоже что и Disallow: /<br /> наверх<br /> Использование спецсимволов &quot;*&quot; и &quot;$&quot;.</p> <p>При указании путей директив Allow-Disallow можно использовать спецсимволы '*' и '$', задавая, таким образом, определенные регулярные выражения. Спецсимвол '*' означает любую (в том числе пустую) последовательность символов. Примеры: <br /> User-agent: Yandex<br /> Disallow: /cgi-bin/*.aspx # запрещает '/cgi-bin/example.aspx'<br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # и '/cgi-bin/private/test.aspx'<br /> Disallow: /**$ # так же, как 'Disallow: /example' <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; #запрещает и /example.html и /example</p> <p><span style="color: #000000"><strong>Директива Sitemap.</strong></span></p> <p>Если вы используете описание структуры вашего сайта в формате sitemaps.xml, и хотите, чтобы робот private # запрещает не только '/private',<br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # но и '/cgi-bin/private'</p> <p>Спецсимвол '$'.</p> <p>По умолчанию к концу каждого правила, описанного в robots.txt, приписывается '*', например: <br /> User-agent: Yandex<br /> Disallow: /cgi-bin* # блокирует доступ к страницам <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # начинающимся с '/cgi-bin'<br /> Disallow: /cgi-bin # то же самое</p> <p>чтобы отменить '*' на конце правила, можно использовать спецсимвол '$', например: <br /> User-agent: Yandex<br /> Disallow: /example$ # запрещает '/example', <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # но не запрещает '/example.html'<br /> User-agent: Yandex<br /> Disallow: /example # запрещает и '/example', <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # и '/example.html'<br /> User-agent: Yandex<br /> Disallow: /example$ # запрещает только '/example'<br /> Disallow: /exampleузнал о ней, укажите путь к sitemaps.xml, в качестве параметра директивы 'Sitemap' (если файлов несколько, укажите все), примеры: <br /> User-agent: Yandex<br /> Allow: /<br /> Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br /> Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p> <p>или <br /> User-agent: Yandex<br /> Allow: /</p> <p>User-agent: *<br /> Disallow: /</p> <p>Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br /> Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p> <p>Робот запомнит пути к sitemaps.xml, обработает файлы и будет использовать результаты при последующем формировании сессий закачки.</p> <p><span style="color: #000000"><strong>Директива Host.</strong></span></p> <p>Если ваш сайт имеет зеркала, специальный робот зеркальщик определит их и сформирует группу зеркал вашего сайта. В поиске будет участвовать только главное зеркало. Вы можете указать его у всех зеркал при помощи robots.txt, используя директиву 'Host', определив в качестве ее параметра имя главного зеркала. Директива 'Host' не гарантирует выбор указанного главного зеркала, тем не менее, алгоритм при принятии решения учитывает ее с высоким приоритетом. Пример: <br /> #Если www.glavnoye-zerkalo.ru главное зеркало сайта, то&nbsp; <br /> #robots.txt для всех сайтов из группы зеркал выглядит так <br /> User-Agent: *<br /> Disallow: /forum<br /> Disallow: /cgi-bin<br /> Host: www.glavnoye-zerkalo.ru</p> <p>Важно: в целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву 'Host' необходимо добавлять в группе, начинающейся с записи 'User-Agent', непосредственно после директив 'Disallow'('Allow'). Аргументом директивы 'Host' является доменное имя с номером порта (80 по умолчанию), отделенным двоеточием. <br /> #Пример корректно составленного robots.txt, при обработке <br /> #которого директива Host учитывается<br /> User-Agent: *<br /> Disallow:<br /> Host: www.myhost.ru<br /> &nbsp;<br /> #Примеры некорректно составленных robots.txt, при обработке <br /> #которых директива Host может не учитываться<br /> #1.<br /> User-Agent: *<br /> Host: www.myhost.ru</p> <p>#2.<br /> Host: www.myhost.ru</p> <p>#3.<br /> User-Agent: *<br /> Host: www.myhost.ru<br /> Disallow:</p> <p>#4.<br /> Host: www.myhost.ru<br /> User-Agent: *<br /> Disallow:</p> <p>Важно: параметр директивы Host обязан состоять из одного корректного имени хоста (т.е. соответствующего RFC 952 и не являющегося IP-адресом) и допустимого номера порта. Некорректно составленные строчки 'Host:' игнорируются. <br /> # Примеры игнорируемых директив Host<br /> Host: www.myhost-.ru<br /> Host: www.-myhost.ru<br /> Host: www.myhost.ru:100000<br /> Host: www.my_host.ru<br /> Host: .my-host.ru:8000<br /> Host: my-host.ru.<br /> Host: my..host.ru<br /> Host: www.myhost.ru/<br /> Host: www.myhost.ru:8080/<br /> Host: http://www.myhost.ru<br /> Host: 213.180.194.129<br /> Host: www.firsthost.ru,www.secondhost.ru<br /> Host: www.firsthost.ru www.secondhost.ru</p> <p>Примеры использования директивы Host: <br /> # domen.myhost.ru является главным зеркалом <br /> # www.domen.myhost.ru, тогда корректное использование <br /> # директивы Host такое:<br /> User-Agent: *<br /> Disallow:<br /> Host: domen.myhost.ru</p> <p># domen.myhost.ru является главным зеркалом <br /> # www.domen.myhost.ru, тогда некорректное использование <br /> # директивы Host такое:<br /> User-Agent: *<br /> Disallow:<br /> Host: myhost.ru<br /> &nbsp;<br /> <span style="color: #000000"><strong>Директива Crawl-delay.</strong></span></p> <p>Если сервер сильно нагружен и не успевает отрабатывать запросы на закачку, воспользуйтесь директивой &quot;Crawl-delay&quot;. Она позволяет задать поисковому роботу минимальный период времени (в секундах) между концом закачки одной страницы и началом закачки следующей. В целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву &quot;Crawl-delay&quot; необходимо добавлять в группе, начинающейся с записи &quot;User-Agent&quot;, непосредственно после директив &quot;Disallow&quot; (&quot;Allow&quot;).</p> <p>Поисковый робот Яндекса поддерживает дробные значения Crawl-Delay, например, 0.5. Это не гарантирует, что поисковый робот будет заходить на ваш сайт каждые полсекунды, но дает роботу больше свободы и позволяет ускорить обход сайта.</p> <p>Примеры: <br /> User-agent: Yandex<br /> Crawl-delay: 2 # задает таймаут в 2 секунды</p> <p>User-agent: *<br /> Disallow: /search<br /> Crawl-delay: 4.5 # задает таймаут в 4.5 секунды<br /> Наверх</p> <p><span style="color: #000000"><strong>Директива Clean-param</strong></span></p> <p>Если адреса страниц вашего сайта содержат динамические параметры которые не влияют на их содержимое (например: идентификаторы сессий, пользователей, рефереров и т.п.), вы можете описать их при помощи директивы 'Clean-param'. Робот Яндекса, используя эту информацию, не будет многократно перезакачивать дублирующуюся информацию. Таким образом, увеличится эффективность обхода вашего сайта, снизится нагрузка на сервер.</p> <p>Например, на сайте есть страницы: <br /> www.site.ru/some_dir/get_book.pl?ref=site_1&amp;book_id=123<br /> www.site.ru/some_dir/get_book.pl?ref=site_2&amp;book_id=123<br /> www.site.ru/some_dir/get_book.pl?ref=site_3&amp;book_id=123</p> <p>параметр 'ref=' используется только для того, чтобы отследить с какого ресурса был сделан запрос и не меняет содержимое, по всем трем адресам будет показана одна и та же страница с книгой 'book_id=123'. Тогда, если в robots.txt указать: <br /> Clean-param: ref /some_dir/get_book.pl</p> <p>вот так: <br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: ref /some_dir/get_book.pl</p> <p>робот Яндекса сведет все адреса страницы к одному: <br /> www.site.ru/some_dir/get_book.pl?ref=site_1&amp;book_id=123,</p> <p>Если на сайте доступна страница без параметров:<br /> www.site.ru/some_dir/get_book.pl?book_id=123</p> <p>То все сведется именно к ней, когда она будет проиндексирована роботом. Другие страницы вашего сайта будут обходиться чаще, так как нет необходимости обновлять страницы: <br /> www.site.ru/some_dir/get_book.pl?ref=site_2&amp;book_id=123<br /> www.site.ru/some_dir/get_book.pl?ref=site_3&amp;book_id=123</p> <p>Синтаксис использования директивы: <br /> Clean-param: p0[&amp;p1&amp;p2&amp;..&amp;pn] [path]</p> <p>В первом поле через '&amp;' перечисляются параметры, которые нужно не учитывать. Во втором поле указывается префикс пути страниц, для которых нужно применить правило.</p> <p><strong>Примечание:</strong></p> <p>Префикс может содержать регулярное выражение в формате, аналогичном robots.txt, но с некоторыми ограничениями: можно использовать только символы A-Za-z0-9.-/*_. При этом * трактуется так же, как в robots.txt. В конец префикса всегда неявно дописывается '*', то есть: <br /> Clean-param: s /forum/showthread.php</p> <p>означает, что параметр s будет считаться незначащим для всех url-ов, начинающихся с /forum/showthread.php. Второе поле указывать необязательно, в этом случае правило будет применяться для всех страниц сайта. Регистр учитывается. Действует ограничение на длину правила &mdash; 500 символов. Например: <br /> Clean-param: abc /forum/showthread.php<br /> Clean-param: sid&amp;sort /forumt/*.php<br /> Clean-param: someTrash&amp;otherTrash</p> <p>Дополнительные примеры: <br /> #для адресов вида:<br /> www.site1.ru/forum/showthread.php?s=681498b9648949605&amp;t=8243<br /> www.site1.ru/forum/showthread.php?s=1e71c4427317a117a&amp;t=8243<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: s /forum/showthread.php<br /> #для адресов&nbsp; вида:<br /> www.site2.ru/index.php?page=1&amp;sort=3a&amp;sid=2564126ebdec301c607e5df<br /> www.site2.ru/index.php?page=1&amp;sort=3a&amp;sid=974017dcd170d6c4a5d76ae<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: sid /index.php<br /> #если таких параметров несколько:<br /> www.site1.ru/forum_old/showthread.php?s=681498605&amp;t=8243&amp;ref=1311<br /> www.site1.ru/forum_new/showthread.php?s=1e71c417a&amp;t=8243&amp;ref=9896<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: s&amp;ref /forum*/showthread.php<br /> #если параметр используется в нескольких скриптах:<br /> www.site1.ru/forum/showthread.php?s=681498b9648949605&amp;t=8243<br /> www.site1.ru/forum/index.php?s=1e71c4427317a117a&amp;t=8243<br /> #robots.txt будет содержать:<br /> User-agent: Yandex<br /> Disallow:<br /> Clean-param: s /forum/index.php<br /> Clean-param: s /forum/showthread.php</p> <p><br /> <span style="color: #ff0000">Дополнительная информация.</span></p> <p><span style="color: #800000"><strong>Директивы robots.txt, которые не упомянуты в данном описании, робот Яндекса не поддерживает. </strong></span></p> <p>Необходимо помнить, что результат использования расширений формата robots.txt может отличаться от результата без них, а именно: <br /> User-agent: Yandex&nbsp;<br /> Allow: /<br /> Disallow: /<br /> # без расширений все запрещалось так как 'Allow: /' игнорировалось, <br /> # с поддержкой расширений все разрешается</p> <p>User-agent: Yandex<br /> Disallow: /private*html<br /> # без расширений запрещалось '/private*html', <br /> # а с поддержкой расширений и '/private*html', <br /> # и '/private/test.html', и '/private/html/test.aspx' и т.п.</p> <p>User-agent: Yandex<br /> Disallow: /private$<br /> # без расширений запрещалось '/private$' и '/private$test' и т.п., <br /> # а с поддержкой расширений только '/private'</p> <p>User-agent: *<br /> Disallow: /<br /> User-agent: Yandex<br /> Allow: /<br /> # без расширений из-за отсутствия перевода строки, <br /> # 'User-agent: Yandex' было бы проигнорировано и <br /> # результатом стало бы 'Disallow: /', но робот Яндекса <br /> # выделяет записи по наличию в строке 'User-agent:', <br /> # результат для робота Яндекса в данном случае 'Allow: /'</p> <p>User-agent: *<br /> Disallow: /<br /> # комментарий1...<br /> # комментарий2...<br /> # комментарий3...<br /> User-agent: Yandex<br /> Allow: /<br /> # аналогично предыдущему примеру (см. выше)</p> <p>Примеры использования расширенного формата robots.txt: <br /> User-agent: Yandex<br /> Allow: /archive<br /> Disallow: /<br /> # разрешает все, что содержит '/archive', остальное запрещено</p> <p>User-agent: Yandex<br /> Allow: /obsolete/private/*.html$ # разрешает html файлы <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # по пути '/obsolete/private/...'<br /> Disallow: /*.php$&nbsp; # запрещает все '*.php' на данном сайте<br /> Disallow: /*/private/ # запрещает все подпути содержащие <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # '/private/', но Allow выше отменяет <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # часть запрета<br /> Disallow: /*/old/*.zip$ # запрещает все '*.zip' файлы, содержащие <br /> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; # в пути '/old/'</p> <p>User-agent: Yandex<br /> Disallow: /add.php?*user= <br /> # запрещает все скрипты 'add.php?' с параметром 'user'</p> <p>При написании robots.txt необходимо помнить, что у робота есть разумное ограничение на его размер. Слишком большие robots.txt (более 32 Кб) считаются полностью разрешающими, то есть рассматриваются аналогично: <br /> User-agent: Yandex<br /> Disallow:</p> <p>Также разрешающими считаются robots.txt, которые не удалось закачать (например, по причине неправильных http-заголовков) или отдающие 404 ошибку.<br /> <br /> <span style="color: #ff0000"><strong>Рамблер - Формат файла robots.txt</strong></span></p> <p><span style="color: #000000"><strong>Формат файла robots.txt</strong></span></p> <p>Формат файла robots.txt - особый. Он состоит из записей, каждая из которых состоит из двух полей: строки с названием клиентского приложения (user-agent), и одной или нескольких строк, начинающихся с директивы Disallow: <br /> &lt;Поле&gt; &quot;:&quot; &lt;значение&gt;</p> <p>Robots.txt должен создаваться в текстовом формате Unix. Большинство хороших текстовых редакторов уже умеют превращать символы перевода строки Windows в Unix. Либо ваш FTP-клиент должен уметь это делать. Для редактирования не пытайтесь пользоваться HTML-редактором, особенно таким, который не имеет текстового режима отображения кода.<br /> Поле User-agent</p> <p>Строка User-agent содержит название робота. Робота Рамблера зовут: StackRambler поэтому если вы хотите создать инструкцию персольнально для нашего робота, то строка должна выглядеть следующим образом:<br /> User-agent: StackRambler</p> <p>Вы можете создать инструкцию для всех роботов: <br /> User-agent: *</p> <p>Поле Disallow:</p> <p>Вторая часть записи состоит из строк Disallow. Эти строки - директивы (указания, команды) для данного робота. В каждой группе, вводимой строкой User-agent, должна быть хотя бы одна инструкция Disallow. Количество инструкций Disallow не ограничено.Они сообщают роботу какие файлы и/или каталоги роботу неразрешено индексировать. Вы можете запретить индексацию файла или каталога.</p> <p>Следующая директива запрещает индексацию каталога /cgi-bin/:<br /> Disallow: /cgi-bin/ Обратите внимание на / в конце названия директории. Это важно. Чтобы запрещать посещение именно каталога &quot;/dir&quot;, инструкция должна иметь вид: &quot;Disallow: /dir/&quot;. А строка &quot;Disallow: /dir&quot; запрещает посещение всех страниц сервера, полное имя которых (от корня сервера) начинается с &quot;/dir&quot;. Например: &quot;/dir.html&quot;, &quot;/dir/index.html&quot;, &quot;/directory.html&quot;.</p> <p>Внимание: точно так же и инструкции &quot;Disallow: *&quot;, &quot;Disallow: *.doc&quot;, &quot;Disallow: /dir/*.doc&quot; не запрещают ничего, поскольку файлов, имя которых начинается со звездочки или содержит ее, не существует! Использование регулярных выражений в строках Disallow, равно как и в файле robots.txt вообще, не предусмотрено.</p> <p>Записаная следующим образом директива запрещает индексацию файла index.htm находящегося в корне:<br /> Disallow: /index.htm</p> <p>К сожалению, инструкций Allow в файлах robots.txt не бывает. Поэтому даже если закрытых для индексирования документов очень много, Вам все равно придется перечислять именно их, а не немногочисленные &quot;открытые&quot; документы. Продумайте структуру сайта, чтобы закрытые для индексирования документы были собраны по возможности в одном месте.</p> <p>Если директива Disallow будет пустой, это значит, что робот может индексировать ВСЕ файлы. Как минимум одна директива Disallow должна присутствовать для каждого поля User-agent, чтобы robots.txt считался верным. Полностью пустой robots.txt означает то же самое, как если бы его не было вообще.</p> <p>Пустые строки и комментарии</p> <p>Пустые строки допускаются между группами инструкций, вводимыми User-agent.</p> <p>Инструкция Disallow учитывается, только если она подчинена какой-либо строке User-agent - то есть если выше нее есть строка User-agent.</p> <p>Любой текст от знака решетки &quot;#&quot; до конца строки считается комментарием и игнорируется.</p> <p>Пример:</p> <p>Следующий простой файл robots.txt запрещает индексацию всех страниц сайта всем роботам, кроме робота Рамблера, которому, наоборот, разрешена индексация всех страниц сайта.<br /> # Инструкции для всех роботов<br /> User-agent: *<br /> Disallow: /</p> <p># Инструкции для робота Рамблера<br /> User-agent: StackRambler<br /> Disallow:<br /> Распространенные ошибки: <br /> Перевернутый синтаксис: <br /> User-agent: /<br /> Disallow: StackRambler<br /> А должно быть так: <br /> User-agent: StackRambler<br /> Disallow: /<br /> Несколько директив Disallow в одной строке: <br /> Disallow: /css/ /cgi-bin/ /images/<br /> Правильно так: <br /> Disallow: /css/<br /> Disallow: /cgi-bin/<br /> Disallow: /images/</p> Внешние и внутренние ссылки. Поддомен. 2010-10-24T20:21:14Z 2010-10-24T20:21:14Z http://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/vneshnie-i-vnutrennie-ssylki-poddomen.html Николай nash17@yandex.ru Считается ли ссылка на поддомен внешней?<br /><br />И как расценивается ссылка с поддомена на основной сайт? Стоит ли на поддоменах делать сателиты? Считается ли ссылка на поддомен внешней?<br /><br />И как расценивается ссылка с поддомена на основной сайт? Стоит ли на поддоменах делать сателиты? IP-шники Яндекса 2010-09-25T19:52:04Z 2010-09-25T19:52:04Z http://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/ip-shniki-yandeksa.html Николай nash17@yandex.ru Подскажите ip адреса Яндекса Подскажите ip адреса Яндекса SeoPult, отзывы. 2010-05-28T05:32:17Z 2010-05-28T05:32:17Z http://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/seopult-otzyvy.html Николай nash17@yandex.ru Кто пользуется системой SeoPult, интересны отзывы, насколько результативна система. Кто пользуется системой SeoPult, интересны отзывы, насколько результативна система.