Поисковая оптимизация сайтаПоисковая оптимизация сайта сложный процесс направленный на хорошие позиции в результатах выдачи по поисковым запросам. Поисковаhttp://hostpartner.com.ua/2018-11-23T21:06:45ZJoomla! 1.5 - Open Source Content Managementподбор ключевых слов для оптимизации и раскрутки сайта2011-04-05T12:01:56Z2011-04-05T12:01:56Zhttp://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/podbor-klyuchevyh-slov-dlya-optimizatsii-i-raskrutki-sayta.htmldonikromanroman@hostpartner.com.ua<p>Вообще, сам процесс грамотного подбора ключевых слов для сайта, уже есть поисковая оптимизация сайта.<br />
Ключевые слова побираются по тематике сайта, для определения и создания семантического ядра сайта и создания точек входа. Точки входа, это внутренние страницы с менее частотными запросами, которые заточены под среднечастотный или низкочастотный трафик.</p>
<p>Подбор ключевых слов для сайта, это подбор слов и комбинаций со словами и словосочетаниями (словоформами), по которым сайт будет находиться пользователями в сети.<br />
Прежде всего это должны быть слова по теме сайта.<br />
Например делаем сайт посвященный велосипедам.<br />
Основное ключевое слово – велосипед. Но оно кроме того что очень конкурентное, еще и ниочем, потому что это общее определение. Кто то ищет где купить велосипед, кто то ищет где продать. Кто то ищет картинку с велосипедом, кто то ищет устройство или чертежи. То есть запросов и посетителей может быть очень много, но все ли они нам нужны. Кроме того, если вы не знаете ничего о подборе слов, значит вы новичок в оптимизации и просто вряд ли вытянете в топ слишком высокочастотный запрос.<br />
Поэтому начинаем подбирать максимально точные вхождения из двух и более слов.<br />
Если наш сайт о продаже велосипедов, то начинаем перебирать варианты.<br />
Купить велосипед, купить велосипед недорого, недорогой велосипед, дешевый велосипед.<br />
То же самое можно проделать уже с классификаторами – купить горный велосипед, горный велосипед недорого и так далее. Меняем определяющее, к примеру шоссейный - купить шоссейный велосипед, шоссейный велосипед недорого далее сколько хватит фантазии. <br />
Чем точнее и длиннее запрос, тем реже его набирают и тем ниже конкуренция. А значит его легче вытащить в топ.<br />
На каждый класс или разновидность товара/ключа желательно подбирать любые возможные варианты.<br />
Если фантазии не хватает, можно воспользоваться сервисами статистики запросов в яндекс директе и гугл адвордсе. <br />
Но следует помнить, что первоначальная цель этих сервисов – заставить вас рекламировать свой сайт в их системах за деньги. Поэтому данные там не всегда точные и не всегда честные. Все как то с уклоном в одни ворота.<br />
Эти сервисы полезны тем, что они фиксирую все запросы, даже самые дурацкие, которые даже в голову не сразу придут. Но иногда вот такие запросы и дают не мало трафика.<br />
У яндекса справа в колонке есть еще запросы – что еще искали с запросом, то есть это смежные запросы. Эту колонку тоже стоит внимательно изучить, потому что попадаются интересные варианты, которые так же приводят посетителя.<br />
И вот когда у вас составлен список из всевозможных словосочетаний, отбирайте нужные вам и потихоньку на основании этого списка пишите текст (контент) на сайт.<br />
Самые частые запросы, размещайте на главную страницу, поменьше на разделы и категории, а совсем уж низкочастотные на самые последние страница 3 и больше уровня вложенности.</p><p>Вообще, сам процесс грамотного подбора ключевых слов для сайта, уже есть поисковая оптимизация сайта.<br />
Ключевые слова побираются по тематике сайта, для определения и создания семантического ядра сайта и создания точек входа. Точки входа, это внутренние страницы с менее частотными запросами, которые заточены под среднечастотный или низкочастотный трафик.</p>
<p>Подбор ключевых слов для сайта, это подбор слов и комбинаций со словами и словосочетаниями (словоформами), по которым сайт будет находиться пользователями в сети.<br />
Прежде всего это должны быть слова по теме сайта.<br />
Например делаем сайт посвященный велосипедам.<br />
Основное ключевое слово – велосипед. Но оно кроме того что очень конкурентное, еще и ниочем, потому что это общее определение. Кто то ищет где купить велосипед, кто то ищет где продать. Кто то ищет картинку с велосипедом, кто то ищет устройство или чертежи. То есть запросов и посетителей может быть очень много, но все ли они нам нужны. Кроме того, если вы не знаете ничего о подборе слов, значит вы новичок в оптимизации и просто вряд ли вытянете в топ слишком высокочастотный запрос.<br />
Поэтому начинаем подбирать максимально точные вхождения из двух и более слов.<br />
Если наш сайт о продаже велосипедов, то начинаем перебирать варианты.<br />
Купить велосипед, купить велосипед недорого, недорогой велосипед, дешевый велосипед.<br />
То же самое можно проделать уже с классификаторами – купить горный велосипед, горный велосипед недорого и так далее. Меняем определяющее, к примеру шоссейный - купить шоссейный велосипед, шоссейный велосипед недорого далее сколько хватит фантазии. <br />
Чем точнее и длиннее запрос, тем реже его набирают и тем ниже конкуренция. А значит его легче вытащить в топ.<br />
На каждый класс или разновидность товара/ключа желательно подбирать любые возможные варианты.<br />
Если фантазии не хватает, можно воспользоваться сервисами статистики запросов в яндекс директе и гугл адвордсе. <br />
Но следует помнить, что первоначальная цель этих сервисов – заставить вас рекламировать свой сайт в их системах за деньги. Поэтому данные там не всегда точные и не всегда честные. Все как то с уклоном в одни ворота.<br />
Эти сервисы полезны тем, что они фиксирую все запросы, даже самые дурацкие, которые даже в голову не сразу придут. Но иногда вот такие запросы и дают не мало трафика.<br />
У яндекса справа в колонке есть еще запросы – что еще искали с запросом, то есть это смежные запросы. Эту колонку тоже стоит внимательно изучить, потому что попадаются интересные варианты, которые так же приводят посетителя.<br />
И вот когда у вас составлен список из всевозможных словосочетаний, отбирайте нужные вам и потихоньку на основании этого списка пишите текст (контент) на сайт.<br />
Самые частые запросы, размещайте на главную страницу, поменьше на разделы и категории, а совсем уж низкочастотные на самые последние страница 3 и больше уровня вложенности.</p>правильный файл robots txt для яндекса и для google. Директива disallow - запрет индексации robots txt 2011-02-20T16:29:19Z2011-02-20T16:29:19Zhttp://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/pravilnyy-fayl-robots-txt-dlya-yandeksa-i-dlya-google-direktiva-disallow-zapret-indeksatsii-robots-txt.htmlhostpartnerinfo@hostpartner.com.ua<p><span style="color: #000000">В принципе это все собрано из хелпов которые вы должны были прочесть прежде чем делать свой первый сайт.<br />
Должны были по логике создателей этих хелпов и разрабов поисковых систем.<br />
Но в жизни все по другому и читать их мы начинаем тогда, когда реально какая то фигня происходит с сайтом. Причем как правило довольно серьезная.<br />
Здесь представлено три взгляда на файл robots.txt от трех самых актуальных для нас поисковиков<br />
<br />
</span><span style="color: #ff0000"><strong>гугл центр вебмастеров</strong></span></p>
<p>В простейшем файле robots.txt используются два правила:<br />
User-agent: робот, к которому применяется следующее правило.<br />
Disallow: URL-адреса, которые необходимо заблокировать.</p>
<p>Эти две строки рассматриваются как одна запись в этом файле. Можно включить любое необходимое число записей. В одну запись можно включить несколько строк Disallow и несколько User Agent.</p>
<p>Каждый раздел файла robots.txt обрабатывается отдельно; содержание предыдущих разделов не учитывается. Рассмотрим пример.<br />
User-agent: *<br />
Disallow: /katalog1/</p>
<p>User-Agent: Googlebot<br />
Disallow: /katalog2/</p>
<p>В этом примере для поискового робота Googlebot будут запрещены только URL-адреса, включающие /katalog2/.<br />
Роботы user-agent и другие роботы</p>
<p>User Agent - это специальный робот поисковой системы. В базе данных роботов Интернета перечислено множество основных роботов. Можно задать запись для применения к конкретному роботу (указав его название) или указать, что она должна применяться ко всем роботам (с помощью звездочки). Запись, которая применяется ко всем роботам, выглядит следующим образом:<br />
User-agent: *</p>
<p>В Google используются несколько различных роботов (User Agent). Робот, используемый для поиска в Интернете, называется Googlebot. Другие наши роботы, например Googlebot-Mobile и Googlebot-Image, следуют правилам, заданным для робота Googlebot, однако для них можно указать отдельные правила. <br />
Блокирование роботов user-agent</p>
<p>В строке Disallow перечисляются страницы, которые необходимо заблокировать. Можно указать конкретный URL или шаблон. Ввод должен начинаться с косой черты (/).<br />
Чтобы заблокировать весь сайт, используйте косую черту. <br />
Disallow: /<br />
Чтобы заблокировать каталог и все его содержание, введите после названия каталога косую черту. <br />
Disallow: /nenuzhnyj-katalog/ <br />
Чтобы заблокировать страницу, укажите эту страницу. <br />
Disallow: /lichnyj_file.html<br />
Чтобы удалить конкретное изображение из Картинок Google, добавьте следующие строки: <br />
User-agent: Googlebot-Image<br />
Disallow: /kartinki/sobaki.jpg <br />
Чтобы удалить все изображения с вашего сайта из Картинок Google, добавьте следующие строки: <br />
User-agent: Googlebot-Image<br />
Disallow: / <br />
Чтобы заблокировать все файлы определенного типа (например, GIF), используйте такую запись: <br />
User-agent: Googlebot<br />
Disallow: /*.gif$<br />
Чтобы предотвратить сканирование страниц вашего сайта, но сохранить отображение объявлений AdSense на этих страницах, запретите доступ всех роботов, кроме Mediapartners-Google. Это предотвращает появление страниц в результатах поиска, позволяя роботу Mediapartners-Google анализировать страницы, чтобы определить, какие объявления нужно показывать. Робот Mediapartners-Google имеет отдельный доступ к страницам, независимый от других агентов Google. Рассмотрим пример. <br />
User-agent: *<br />
Disallow: /</p>
<p>User-agent: MediaPartners-Google<br />
Allow: /</p>
<p>Помните, что в командах учитывается регистр. Например, команда Disallow: /junk_file.asp заблокирует файл http://www.example.com/junk_file.asp, но пропустит файл http://www.example.com/Junk_file.asp. Поисковый робот Googlebot игнорирует пробелы (в пустых строках) и неизвестные директивы в файле robots.txt.</p>
<p>Googlebot поддерживает отправку файлов Sitemap через файл robots.txt. <br />
Соответствие шаблону</p>
<p>Робот Googlebot (но не все поисковые системы) соблюдает некоторые типы соответствия шаблону.<br />
Чтобы сопоставлять последовательность символов, используйте звездочку (*).Например, чтобы заблокировать доступ ко всем вложенным каталогам, начинающимся с private, введите строки: <br />
User-agent: Googlebot<br />
Disallow: /lichnoe*/<br />
Чтобы заблокировать доступ ко всем URL-адресам, содержащим знак вопроса (?) (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат вопросительный знак), добавьте в файл robots.txt следующую запись: <br />
User-agent: Googlebot<br />
Disallow: /*?<br />
Чтобы задать соответствие конечных символов URL-адреса, используйте символ $. Например, чтобы заблокировать доступ к URL, оканчивающемуся на .xls, используйте следующие строки: <br />
User-agent: Googlebot <br />
Disallow: /*.xls$</p>
<p>Это соответствие шаблону можно использовать вместе с командой Allow. Например, если знак ? обозначает идентификатор сеанса, можно исключить содержащие этот символ URL-адреса, чтобы робот Googlebot не сканировал повторяющиеся страницы. Но URL-адреса, заканчивающиеся на ?, могут являться версией страницы, которую необходимо включить в индекс. В таком случае можно создать в файле robots.txt следующую запись: <br />
User-agent: *<br />
Allow: /*?$<br />
Disallow: /*?</p>
<p>Строка Disallow:/ *? блокирует доступ ко всем URL-адресам со знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, внутри которой встречается знак вопроса).</p>
<p>Строка Allow: /*?$ разрешает доступ ко всем URL-адресам, оканчивающимся знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, заканчивающуюся на ?, после которого нет других символов).<br />
<br />
<span style="color: #ff0000"><strong>Яндекс вебмастер помощь </strong></span></p>
<p><em><span style="color: #000000"><strong>Использование robots.txt</strong></span></em></p>
<p><strong>Что такое файл robots.txt</strong></p>
<p>Robots.txt — текстовый файл, расположенный на сайте, который предназначен для роботов поисковых систем. В этом файле веб-мастер может указать параметры индексирования своего сайта как для всех роботов сразу, так и для каждой поисковой системы по отдельности.</p>
<p><br />
<span style="color: #000000"><strong>Как создать robots.txt</strong></span></p>
<p>Воспользуйтесь любым текстовым редактором (например, Блокнотом или WordPad'ом), создайте файл с именем "robots.txt" и заполните его в соответствии с представленными ниже правилами. После этого необходимо загрузить файл в корневой каталог вашего сайта.</p>
<p>Чтобы проверить правильность обработки вашего файла robots.txt, воспользуйтесь анализатором файла robots.txt.</p>
<p><span style="color: #000000"><strong>Директива User-agent</strong></span></p>
<p>Управлять доступом робота Яндекса к вашему сайту вы можете при помощи файла robots.txt, который должен быть размещен в корневой директории сайта. Робот Яндекса поддерживает стандарт описания http://www.robotstxt.org/wc/norobots.html с расширенными возможностями, описанными ниже.</p>
<p>В роботе Яндекса используется сессионный принцип работы, на каждую сессию формируется определенный пул страниц, которые планирует закачать робот. Сессия начинается с закачки robots.txt сайта, если его нет, он не текстовый или на запрос робота возвращается HTTP-код отличный от '200', считается, что доступ роботу не ограничен. В самом robots.txt проверяется наличие записей, начинающихся с 'User-agent:', в них ищутся подстроки 'Yandex', либо '*' (регистр значения не имеет), причем, если обнаружено 'User-agent: Yandex', директивы для 'User-agent: *' не учитываются. Если записи 'User-agent: Yandex' и 'User-agent: *' отсутствуют, считается, что доступ роботу не ограничен.</p>
<p><br />
<span style="color: #000000"><strong>Использование директив Disallow и Allow.</strong></span></p>
<p>Чтобы запретить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Disallow'. Примеры: <br />
User-agent: Yandex<br />
Disallow: / # блокирует доступ ко всему сайту</p>
<p>User-agent: Yandex<br />
Disallow: /cgi-bin # блокирует доступ к страницам <br />
#начинающимся с '/cgi-bin'</p>
<p>Примечание:</p>
<p>Недопустимо наличие пустых переводов строки между директивами 'User-agent' и 'Disallow' ('Allow'), а также между самими 'Disallow' ('Allow') директивами.</p>
<p>Кроме того, в соответствии со стандартом перед каждой директивой 'User-agent' рекомендуется вставлять пустой перевод строки.</p>
<p>Символ '#' предназначен для описания комментариев. Все, что находится после этого символа и до первого перевода строки не учитывается.</p>
<p>Чтобы разрешить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Allow'. Примеры: <br />
User-agent: Yandex<br />
Allow: /cgi-bin<br />
Disallow: /<br />
# запрещает скачивать все, кроме страниц <br />
# начинающихся с '/cgi-bin'<br />
<br />
<span style="color: #000000"><strong>Совместное использование директив. </strong></span></p>
<p>Если для данной страницы сайта подходит несколько директив, то выбирается первая в порядке появления в выбранном User-agent блоке. Примеры, если: <br />
User-agent: Yandex<br />
Allow: /cgi-bin<br />
Disallow: /<br />
# запрещает скачивать все, кроме страниц <br />
# начинающихся с '/cgi-bin'<br />
User-agent: Yandex<br />
Disallow: /<br />
Allow: /cgi-bin<br />
# запрещает скачивать весь сайт</p>
<p><span style="color: #000000"><strong>Директивы Allow-Disallow без параметров. </strong></span></p>
<p>Отсутствие параметров у директивы трактуется следующим образом: <br />
User-agent: Yandex<br />
Disallow: # тоже что и Allow: /</p>
<p>User-agent: Yandex<br />
Allow: # тоже что и Disallow: /<br />
наверх<br />
Использование спецсимволов "*" и "$".</p>
<p>При указании путей директив Allow-Disallow можно использовать спецсимволы '*' и '$', задавая, таким образом, определенные регулярные выражения. Спецсимвол '*' означает любую (в том числе пустую) последовательность символов. Примеры: <br />
User-agent: Yandex<br />
Disallow: /cgi-bin/*.aspx # запрещает '/cgi-bin/example.aspx'<br />
# и '/cgi-bin/private/test.aspx'<br />
Disallow: /**$ # так же, как 'Disallow: /example' <br />
#запрещает и /example.html и /example</p>
<p><span style="color: #000000"><strong>Директива Sitemap.</strong></span></p>
<p>Если вы используете описание структуры вашего сайта в формате sitemaps.xml, и хотите, чтобы робот private # запрещает не только '/private',<br />
# но и '/cgi-bin/private'</p>
<p>Спецсимвол '$'.</p>
<p>По умолчанию к концу каждого правила, описанного в robots.txt, приписывается '*', например: <br />
User-agent: Yandex<br />
Disallow: /cgi-bin* # блокирует доступ к страницам <br />
# начинающимся с '/cgi-bin'<br />
Disallow: /cgi-bin # то же самое</p>
<p>чтобы отменить '*' на конце правила, можно использовать спецсимвол '$', например: <br />
User-agent: Yandex<br />
Disallow: /example$ # запрещает '/example', <br />
# но не запрещает '/example.html'<br />
User-agent: Yandex<br />
Disallow: /example # запрещает и '/example', <br />
# и '/example.html'<br />
User-agent: Yandex<br />
Disallow: /example$ # запрещает только '/example'<br />
Disallow: /exampleузнал о ней, укажите путь к sitemaps.xml, в качестве параметра директивы 'Sitemap' (если файлов несколько, укажите все), примеры: <br />
User-agent: Yandex<br />
Allow: /<br />
Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br />
Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p>
<p>или <br />
User-agent: Yandex<br />
Allow: /</p>
<p>User-agent: *<br />
Disallow: /</p>
<p>Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br />
Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p>
<p>Робот запомнит пути к sitemaps.xml, обработает файлы и будет использовать результаты при последующем формировании сессий закачки.</p>
<p><span style="color: #000000"><strong>Директива Host.</strong></span></p>
<p>Если ваш сайт имеет зеркала, специальный робот зеркальщик определит их и сформирует группу зеркал вашего сайта. В поиске будет участвовать только главное зеркало. Вы можете указать его у всех зеркал при помощи robots.txt, используя директиву 'Host', определив в качестве ее параметра имя главного зеркала. Директива 'Host' не гарантирует выбор указанного главного зеркала, тем не менее, алгоритм при принятии решения учитывает ее с высоким приоритетом. Пример: <br />
#Если www.glavnoye-zerkalo.ru главное зеркало сайта, то <br />
#robots.txt для всех сайтов из группы зеркал выглядит так <br />
User-Agent: *<br />
Disallow: /forum<br />
Disallow: /cgi-bin<br />
Host: www.glavnoye-zerkalo.ru</p>
<p>Важно: в целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву 'Host' необходимо добавлять в группе, начинающейся с записи 'User-Agent', непосредственно после директив 'Disallow'('Allow'). Аргументом директивы 'Host' является доменное имя с номером порта (80 по умолчанию), отделенным двоеточием. <br />
#Пример корректно составленного robots.txt, при обработке <br />
#которого директива Host учитывается<br />
User-Agent: *<br />
Disallow:<br />
Host: www.myhost.ru<br />
<br />
#Примеры некорректно составленных robots.txt, при обработке <br />
#которых директива Host может не учитываться<br />
#1.<br />
User-Agent: *<br />
Host: www.myhost.ru</p>
<p>#2.<br />
Host: www.myhost.ru</p>
<p>#3.<br />
User-Agent: *<br />
Host: www.myhost.ru<br />
Disallow:</p>
<p>#4.<br />
Host: www.myhost.ru<br />
User-Agent: *<br />
Disallow:</p>
<p>Важно: параметр директивы Host обязан состоять из одного корректного имени хоста (т.е. соответствующего RFC 952 и не являющегося IP-адресом) и допустимого номера порта. Некорректно составленные строчки 'Host:' игнорируются. <br />
# Примеры игнорируемых директив Host<br />
Host: www.myhost-.ru<br />
Host: www.-myhost.ru<br />
Host: www.myhost.ru:100000<br />
Host: www.my_host.ru<br />
Host: .my-host.ru:8000<br />
Host: my-host.ru.<br />
Host: my..host.ru<br />
Host: www.myhost.ru/<br />
Host: www.myhost.ru:8080/<br />
Host: http://www.myhost.ru<br />
Host: 213.180.194.129<br />
Host: www.firsthost.ru,www.secondhost.ru<br />
Host: www.firsthost.ru www.secondhost.ru</p>
<p>Примеры использования директивы Host: <br />
# domen.myhost.ru является главным зеркалом <br />
# www.domen.myhost.ru, тогда корректное использование <br />
# директивы Host такое:<br />
User-Agent: *<br />
Disallow:<br />
Host: domen.myhost.ru</p>
<p># domen.myhost.ru является главным зеркалом <br />
# www.domen.myhost.ru, тогда некорректное использование <br />
# директивы Host такое:<br />
User-Agent: *<br />
Disallow:<br />
Host: myhost.ru<br />
<br />
<span style="color: #000000"><strong>Директива Crawl-delay.</strong></span></p>
<p>Если сервер сильно нагружен и не успевает отрабатывать запросы на закачку, воспользуйтесь директивой "Crawl-delay". Она позволяет задать поисковому роботу минимальный период времени (в секундах) между концом закачки одной страницы и началом закачки следующей. В целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву "Crawl-delay" необходимо добавлять в группе, начинающейся с записи "User-Agent", непосредственно после директив "Disallow" ("Allow").</p>
<p>Поисковый робот Яндекса поддерживает дробные значения Crawl-Delay, например, 0.5. Это не гарантирует, что поисковый робот будет заходить на ваш сайт каждые полсекунды, но дает роботу больше свободы и позволяет ускорить обход сайта.</p>
<p>Примеры: <br />
User-agent: Yandex<br />
Crawl-delay: 2 # задает таймаут в 2 секунды</p>
<p>User-agent: *<br />
Disallow: /search<br />
Crawl-delay: 4.5 # задает таймаут в 4.5 секунды<br />
Наверх</p>
<p><span style="color: #000000"><strong>Директива Clean-param</strong></span></p>
<p>Если адреса страниц вашего сайта содержат динамические параметры которые не влияют на их содержимое (например: идентификаторы сессий, пользователей, рефереров и т.п.), вы можете описать их при помощи директивы 'Clean-param'. Робот Яндекса, используя эту информацию, не будет многократно перезакачивать дублирующуюся информацию. Таким образом, увеличится эффективность обхода вашего сайта, снизится нагрузка на сервер.</p>
<p>Например, на сайте есть страницы: <br />
www.site.ru/some_dir/get_book.pl?ref=site_1&book_id=123<br />
www.site.ru/some_dir/get_book.pl?ref=site_2&book_id=123<br />
www.site.ru/some_dir/get_book.pl?ref=site_3&book_id=123</p>
<p>параметр 'ref=' используется только для того, чтобы отследить с какого ресурса был сделан запрос и не меняет содержимое, по всем трем адресам будет показана одна и та же страница с книгой 'book_id=123'. Тогда, если в robots.txt указать: <br />
Clean-param: ref /some_dir/get_book.pl</p>
<p>вот так: <br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: ref /some_dir/get_book.pl</p>
<p>робот Яндекса сведет все адреса страницы к одному: <br />
www.site.ru/some_dir/get_book.pl?ref=site_1&book_id=123,</p>
<p>Если на сайте доступна страница без параметров:<br />
www.site.ru/some_dir/get_book.pl?book_id=123</p>
<p>То все сведется именно к ней, когда она будет проиндексирована роботом. Другие страницы вашего сайта будут обходиться чаще, так как нет необходимости обновлять страницы: <br />
www.site.ru/some_dir/get_book.pl?ref=site_2&book_id=123<br />
www.site.ru/some_dir/get_book.pl?ref=site_3&book_id=123</p>
<p>Синтаксис использования директивы: <br />
Clean-param: p0[&p1&p2&..&pn] [path]</p>
<p>В первом поле через '&' перечисляются параметры, которые нужно не учитывать. Во втором поле указывается префикс пути страниц, для которых нужно применить правило.</p>
<p><strong>Примечание:</strong></p>
<p>Префикс может содержать регулярное выражение в формате, аналогичном robots.txt, но с некоторыми ограничениями: можно использовать только символы A-Za-z0-9.-/*_. При этом * трактуется так же, как в robots.txt. В конец префикса всегда неявно дописывается '*', то есть: <br />
Clean-param: s /forum/showthread.php</p>
<p>означает, что параметр s будет считаться незначащим для всех url-ов, начинающихся с /forum/showthread.php. Второе поле указывать необязательно, в этом случае правило будет применяться для всех страниц сайта. Регистр учитывается. Действует ограничение на длину правила — 500 символов. Например: <br />
Clean-param: abc /forum/showthread.php<br />
Clean-param: sid&sort /forumt/*.php<br />
Clean-param: someTrash&otherTrash</p>
<p>Дополнительные примеры: <br />
#для адресов вида:<br />
www.site1.ru/forum/showthread.php?s=681498b9648949605&t=8243<br />
www.site1.ru/forum/showthread.php?s=1e71c4427317a117a&t=8243<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: s /forum/showthread.php<br />
#для адресов вида:<br />
www.site2.ru/index.php?page=1&sort=3a&sid=2564126ebdec301c607e5df<br />
www.site2.ru/index.php?page=1&sort=3a&sid=974017dcd170d6c4a5d76ae<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: sid /index.php<br />
#если таких параметров несколько:<br />
www.site1.ru/forum_old/showthread.php?s=681498605&t=8243&ref=1311<br />
www.site1.ru/forum_new/showthread.php?s=1e71c417a&t=8243&ref=9896<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: s&ref /forum*/showthread.php<br />
#если параметр используется в нескольких скриптах:<br />
www.site1.ru/forum/showthread.php?s=681498b9648949605&t=8243<br />
www.site1.ru/forum/index.php?s=1e71c4427317a117a&t=8243<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: s /forum/index.php<br />
Clean-param: s /forum/showthread.php</p>
<p><br />
<span style="color: #ff0000">Дополнительная информация.</span></p>
<p><span style="color: #800000"><strong>Директивы robots.txt, которые не упомянуты в данном описании, робот Яндекса не поддерживает. </strong></span></p>
<p>Необходимо помнить, что результат использования расширений формата robots.txt может отличаться от результата без них, а именно: <br />
User-agent: Yandex <br />
Allow: /<br />
Disallow: /<br />
# без расширений все запрещалось так как 'Allow: /' игнорировалось, <br />
# с поддержкой расширений все разрешается</p>
<p>User-agent: Yandex<br />
Disallow: /private*html<br />
# без расширений запрещалось '/private*html', <br />
# а с поддержкой расширений и '/private*html', <br />
# и '/private/test.html', и '/private/html/test.aspx' и т.п.</p>
<p>User-agent: Yandex<br />
Disallow: /private$<br />
# без расширений запрещалось '/private$' и '/private$test' и т.п., <br />
# а с поддержкой расширений только '/private'</p>
<p>User-agent: *<br />
Disallow: /<br />
User-agent: Yandex<br />
Allow: /<br />
# без расширений из-за отсутствия перевода строки, <br />
# 'User-agent: Yandex' было бы проигнорировано и <br />
# результатом стало бы 'Disallow: /', но робот Яндекса <br />
# выделяет записи по наличию в строке 'User-agent:', <br />
# результат для робота Яндекса в данном случае 'Allow: /'</p>
<p>User-agent: *<br />
Disallow: /<br />
# комментарий1...<br />
# комментарий2...<br />
# комментарий3...<br />
User-agent: Yandex<br />
Allow: /<br />
# аналогично предыдущему примеру (см. выше)</p>
<p>Примеры использования расширенного формата robots.txt: <br />
User-agent: Yandex<br />
Allow: /archive<br />
Disallow: /<br />
# разрешает все, что содержит '/archive', остальное запрещено</p>
<p>User-agent: Yandex<br />
Allow: /obsolete/private/*.html$ # разрешает html файлы <br />
# по пути '/obsolete/private/...'<br />
Disallow: /*.php$ # запрещает все '*.php' на данном сайте<br />
Disallow: /*/private/ # запрещает все подпути содержащие <br />
# '/private/', но Allow выше отменяет <br />
# часть запрета<br />
Disallow: /*/old/*.zip$ # запрещает все '*.zip' файлы, содержащие <br />
# в пути '/old/'</p>
<p>User-agent: Yandex<br />
Disallow: /add.php?*user= <br />
# запрещает все скрипты 'add.php?' с параметром 'user'</p>
<p>При написании robots.txt необходимо помнить, что у робота есть разумное ограничение на его размер. Слишком большие robots.txt (более 32 Кб) считаются полностью разрешающими, то есть рассматриваются аналогично: <br />
User-agent: Yandex<br />
Disallow:</p>
<p>Также разрешающими считаются robots.txt, которые не удалось закачать (например, по причине неправильных http-заголовков) или отдающие 404 ошибку.<br />
<br />
<span style="color: #ff0000"><strong>Рамблер - Формат файла robots.txt</strong></span></p>
<p><span style="color: #000000"><strong>Формат файла robots.txt</strong></span></p>
<p>Формат файла robots.txt - особый. Он состоит из записей, каждая из которых состоит из двух полей: строки с названием клиентского приложения (user-agent), и одной или нескольких строк, начинающихся с директивы Disallow: <br />
<Поле> ":" <значение></p>
<p>Robots.txt должен создаваться в текстовом формате Unix. Большинство хороших текстовых редакторов уже умеют превращать символы перевода строки Windows в Unix. Либо ваш FTP-клиент должен уметь это делать. Для редактирования не пытайтесь пользоваться HTML-редактором, особенно таким, который не имеет текстового режима отображения кода.<br />
Поле User-agent</p>
<p>Строка User-agent содержит название робота. Робота Рамблера зовут: StackRambler поэтому если вы хотите создать инструкцию персольнально для нашего робота, то строка должна выглядеть следующим образом:<br />
User-agent: StackRambler</p>
<p>Вы можете создать инструкцию для всех роботов: <br />
User-agent: *</p>
<p>Поле Disallow:</p>
<p>Вторая часть записи состоит из строк Disallow. Эти строки - директивы (указания, команды) для данного робота. В каждой группе, вводимой строкой User-agent, должна быть хотя бы одна инструкция Disallow. Количество инструкций Disallow не ограничено.Они сообщают роботу какие файлы и/или каталоги роботу неразрешено индексировать. Вы можете запретить индексацию файла или каталога.</p>
<p>Следующая директива запрещает индексацию каталога /cgi-bin/:<br />
Disallow: /cgi-bin/ Обратите внимание на / в конце названия директории. Это важно. Чтобы запрещать посещение именно каталога "/dir", инструкция должна иметь вид: "Disallow: /dir/". А строка "Disallow: /dir" запрещает посещение всех страниц сервера, полное имя которых (от корня сервера) начинается с "/dir". Например: "/dir.html", "/dir/index.html", "/directory.html".</p>
<p>Внимание: точно так же и инструкции "Disallow: *", "Disallow: *.doc", "Disallow: /dir/*.doc" не запрещают ничего, поскольку файлов, имя которых начинается со звездочки или содержит ее, не существует! Использование регулярных выражений в строках Disallow, равно как и в файле robots.txt вообще, не предусмотрено.</p>
<p>Записаная следующим образом директива запрещает индексацию файла index.htm находящегося в корне:<br />
Disallow: /index.htm</p>
<p>К сожалению, инструкций Allow в файлах robots.txt не бывает. Поэтому даже если закрытых для индексирования документов очень много, Вам все равно придется перечислять именно их, а не немногочисленные "открытые" документы. Продумайте структуру сайта, чтобы закрытые для индексирования документы были собраны по возможности в одном месте.</p>
<p>Если директива Disallow будет пустой, это значит, что робот может индексировать ВСЕ файлы. Как минимум одна директива Disallow должна присутствовать для каждого поля User-agent, чтобы robots.txt считался верным. Полностью пустой robots.txt означает то же самое, как если бы его не было вообще.</p>
<p>Пустые строки и комментарии</p>
<p>Пустые строки допускаются между группами инструкций, вводимыми User-agent.</p>
<p>Инструкция Disallow учитывается, только если она подчинена какой-либо строке User-agent - то есть если выше нее есть строка User-agent.</p>
<p>Любой текст от знака решетки "#" до конца строки считается комментарием и игнорируется.</p>
<p>Пример:</p>
<p>Следующий простой файл robots.txt запрещает индексацию всех страниц сайта всем роботам, кроме робота Рамблера, которому, наоборот, разрешена индексация всех страниц сайта.<br />
# Инструкции для всех роботов<br />
User-agent: *<br />
Disallow: /</p>
<p># Инструкции для робота Рамблера<br />
User-agent: StackRambler<br />
Disallow:<br />
Распространенные ошибки: <br />
Перевернутый синтаксис: <br />
User-agent: /<br />
Disallow: StackRambler<br />
А должно быть так: <br />
User-agent: StackRambler<br />
Disallow: /<br />
Несколько директив Disallow в одной строке: <br />
Disallow: /css/ /cgi-bin/ /images/<br />
Правильно так: <br />
Disallow: /css/<br />
Disallow: /cgi-bin/<br />
Disallow: /images/</p><p><span style="color: #000000">В принципе это все собрано из хелпов которые вы должны были прочесть прежде чем делать свой первый сайт.<br />
Должны были по логике создателей этих хелпов и разрабов поисковых систем.<br />
Но в жизни все по другому и читать их мы начинаем тогда, когда реально какая то фигня происходит с сайтом. Причем как правило довольно серьезная.<br />
Здесь представлено три взгляда на файл robots.txt от трех самых актуальных для нас поисковиков<br />
<br />
</span><span style="color: #ff0000"><strong>гугл центр вебмастеров</strong></span></p>
<p>В простейшем файле robots.txt используются два правила:<br />
User-agent: робот, к которому применяется следующее правило.<br />
Disallow: URL-адреса, которые необходимо заблокировать.</p>
<p>Эти две строки рассматриваются как одна запись в этом файле. Можно включить любое необходимое число записей. В одну запись можно включить несколько строк Disallow и несколько User Agent.</p>
<p>Каждый раздел файла robots.txt обрабатывается отдельно; содержание предыдущих разделов не учитывается. Рассмотрим пример.<br />
User-agent: *<br />
Disallow: /katalog1/</p>
<p>User-Agent: Googlebot<br />
Disallow: /katalog2/</p>
<p>В этом примере для поискового робота Googlebot будут запрещены только URL-адреса, включающие /katalog2/.<br />
Роботы user-agent и другие роботы</p>
<p>User Agent - это специальный робот поисковой системы. В базе данных роботов Интернета перечислено множество основных роботов. Можно задать запись для применения к конкретному роботу (указав его название) или указать, что она должна применяться ко всем роботам (с помощью звездочки). Запись, которая применяется ко всем роботам, выглядит следующим образом:<br />
User-agent: *</p>
<p>В Google используются несколько различных роботов (User Agent). Робот, используемый для поиска в Интернете, называется Googlebot. Другие наши роботы, например Googlebot-Mobile и Googlebot-Image, следуют правилам, заданным для робота Googlebot, однако для них можно указать отдельные правила. <br />
Блокирование роботов user-agent</p>
<p>В строке Disallow перечисляются страницы, которые необходимо заблокировать. Можно указать конкретный URL или шаблон. Ввод должен начинаться с косой черты (/).<br />
Чтобы заблокировать весь сайт, используйте косую черту. <br />
Disallow: /<br />
Чтобы заблокировать каталог и все его содержание, введите после названия каталога косую черту. <br />
Disallow: /nenuzhnyj-katalog/ <br />
Чтобы заблокировать страницу, укажите эту страницу. <br />
Disallow: /lichnyj_file.html<br />
Чтобы удалить конкретное изображение из Картинок Google, добавьте следующие строки: <br />
User-agent: Googlebot-Image<br />
Disallow: /kartinki/sobaki.jpg <br />
Чтобы удалить все изображения с вашего сайта из Картинок Google, добавьте следующие строки: <br />
User-agent: Googlebot-Image<br />
Disallow: / <br />
Чтобы заблокировать все файлы определенного типа (например, GIF), используйте такую запись: <br />
User-agent: Googlebot<br />
Disallow: /*.gif$<br />
Чтобы предотвратить сканирование страниц вашего сайта, но сохранить отображение объявлений AdSense на этих страницах, запретите доступ всех роботов, кроме Mediapartners-Google. Это предотвращает появление страниц в результатах поиска, позволяя роботу Mediapartners-Google анализировать страницы, чтобы определить, какие объявления нужно показывать. Робот Mediapartners-Google имеет отдельный доступ к страницам, независимый от других агентов Google. Рассмотрим пример. <br />
User-agent: *<br />
Disallow: /</p>
<p>User-agent: MediaPartners-Google<br />
Allow: /</p>
<p>Помните, что в командах учитывается регистр. Например, команда Disallow: /junk_file.asp заблокирует файл http://www.example.com/junk_file.asp, но пропустит файл http://www.example.com/Junk_file.asp. Поисковый робот Googlebot игнорирует пробелы (в пустых строках) и неизвестные директивы в файле robots.txt.</p>
<p>Googlebot поддерживает отправку файлов Sitemap через файл robots.txt. <br />
Соответствие шаблону</p>
<p>Робот Googlebot (но не все поисковые системы) соблюдает некоторые типы соответствия шаблону.<br />
Чтобы сопоставлять последовательность символов, используйте звездочку (*).Например, чтобы заблокировать доступ ко всем вложенным каталогам, начинающимся с private, введите строки: <br />
User-agent: Googlebot<br />
Disallow: /lichnoe*/<br />
Чтобы заблокировать доступ ко всем URL-адресам, содержащим знак вопроса (?) (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат вопросительный знак), добавьте в файл robots.txt следующую запись: <br />
User-agent: Googlebot<br />
Disallow: /*?<br />
Чтобы задать соответствие конечных символов URL-адреса, используйте символ $. Например, чтобы заблокировать доступ к URL, оканчивающемуся на .xls, используйте следующие строки: <br />
User-agent: Googlebot <br />
Disallow: /*.xls$</p>
<p>Это соответствие шаблону можно использовать вместе с командой Allow. Например, если знак ? обозначает идентификатор сеанса, можно исключить содержащие этот символ URL-адреса, чтобы робот Googlebot не сканировал повторяющиеся страницы. Но URL-адреса, заканчивающиеся на ?, могут являться версией страницы, которую необходимо включить в индекс. В таком случае можно создать в файле robots.txt следующую запись: <br />
User-agent: *<br />
Allow: /*?$<br />
Disallow: /*?</p>
<p>Строка Disallow:/ *? блокирует доступ ко всем URL-адресам со знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, внутри которой встречается знак вопроса).</p>
<p>Строка Allow: /*?$ разрешает доступ ко всем URL-адресам, оканчивающимся знаком вопроса (то есть ко всем URL-адресам, которые начинаются с названия домена и содержат цепочку, заканчивающуюся на ?, после которого нет других символов).<br />
<br />
<span style="color: #ff0000"><strong>Яндекс вебмастер помощь </strong></span></p>
<p><em><span style="color: #000000"><strong>Использование robots.txt</strong></span></em></p>
<p><strong>Что такое файл robots.txt</strong></p>
<p>Robots.txt — текстовый файл, расположенный на сайте, который предназначен для роботов поисковых систем. В этом файле веб-мастер может указать параметры индексирования своего сайта как для всех роботов сразу, так и для каждой поисковой системы по отдельности.</p>
<p><br />
<span style="color: #000000"><strong>Как создать robots.txt</strong></span></p>
<p>Воспользуйтесь любым текстовым редактором (например, Блокнотом или WordPad'ом), создайте файл с именем "robots.txt" и заполните его в соответствии с представленными ниже правилами. После этого необходимо загрузить файл в корневой каталог вашего сайта.</p>
<p>Чтобы проверить правильность обработки вашего файла robots.txt, воспользуйтесь анализатором файла robots.txt.</p>
<p><span style="color: #000000"><strong>Директива User-agent</strong></span></p>
<p>Управлять доступом робота Яндекса к вашему сайту вы можете при помощи файла robots.txt, который должен быть размещен в корневой директории сайта. Робот Яндекса поддерживает стандарт описания http://www.robotstxt.org/wc/norobots.html с расширенными возможностями, описанными ниже.</p>
<p>В роботе Яндекса используется сессионный принцип работы, на каждую сессию формируется определенный пул страниц, которые планирует закачать робот. Сессия начинается с закачки robots.txt сайта, если его нет, он не текстовый или на запрос робота возвращается HTTP-код отличный от '200', считается, что доступ роботу не ограничен. В самом robots.txt проверяется наличие записей, начинающихся с 'User-agent:', в них ищутся подстроки 'Yandex', либо '*' (регистр значения не имеет), причем, если обнаружено 'User-agent: Yandex', директивы для 'User-agent: *' не учитываются. Если записи 'User-agent: Yandex' и 'User-agent: *' отсутствуют, считается, что доступ роботу не ограничен.</p>
<p><br />
<span style="color: #000000"><strong>Использование директив Disallow и Allow.</strong></span></p>
<p>Чтобы запретить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Disallow'. Примеры: <br />
User-agent: Yandex<br />
Disallow: / # блокирует доступ ко всему сайту</p>
<p>User-agent: Yandex<br />
Disallow: /cgi-bin # блокирует доступ к страницам <br />
#начинающимся с '/cgi-bin'</p>
<p>Примечание:</p>
<p>Недопустимо наличие пустых переводов строки между директивами 'User-agent' и 'Disallow' ('Allow'), а также между самими 'Disallow' ('Allow') директивами.</p>
<p>Кроме того, в соответствии со стандартом перед каждой директивой 'User-agent' рекомендуется вставлять пустой перевод строки.</p>
<p>Символ '#' предназначен для описания комментариев. Все, что находится после этого символа и до первого перевода строки не учитывается.</p>
<p>Чтобы разрешить доступ робота к некоторым частям сайта или сайту целиком, используйте директиву 'Allow'. Примеры: <br />
User-agent: Yandex<br />
Allow: /cgi-bin<br />
Disallow: /<br />
# запрещает скачивать все, кроме страниц <br />
# начинающихся с '/cgi-bin'<br />
<br />
<span style="color: #000000"><strong>Совместное использование директив. </strong></span></p>
<p>Если для данной страницы сайта подходит несколько директив, то выбирается первая в порядке появления в выбранном User-agent блоке. Примеры, если: <br />
User-agent: Yandex<br />
Allow: /cgi-bin<br />
Disallow: /<br />
# запрещает скачивать все, кроме страниц <br />
# начинающихся с '/cgi-bin'<br />
User-agent: Yandex<br />
Disallow: /<br />
Allow: /cgi-bin<br />
# запрещает скачивать весь сайт</p>
<p><span style="color: #000000"><strong>Директивы Allow-Disallow без параметров. </strong></span></p>
<p>Отсутствие параметров у директивы трактуется следующим образом: <br />
User-agent: Yandex<br />
Disallow: # тоже что и Allow: /</p>
<p>User-agent: Yandex<br />
Allow: # тоже что и Disallow: /<br />
наверх<br />
Использование спецсимволов "*" и "$".</p>
<p>При указании путей директив Allow-Disallow можно использовать спецсимволы '*' и '$', задавая, таким образом, определенные регулярные выражения. Спецсимвол '*' означает любую (в том числе пустую) последовательность символов. Примеры: <br />
User-agent: Yandex<br />
Disallow: /cgi-bin/*.aspx # запрещает '/cgi-bin/example.aspx'<br />
# и '/cgi-bin/private/test.aspx'<br />
Disallow: /**$ # так же, как 'Disallow: /example' <br />
#запрещает и /example.html и /example</p>
<p><span style="color: #000000"><strong>Директива Sitemap.</strong></span></p>
<p>Если вы используете описание структуры вашего сайта в формате sitemaps.xml, и хотите, чтобы робот private # запрещает не только '/private',<br />
# но и '/cgi-bin/private'</p>
<p>Спецсимвол '$'.</p>
<p>По умолчанию к концу каждого правила, описанного в robots.txt, приписывается '*', например: <br />
User-agent: Yandex<br />
Disallow: /cgi-bin* # блокирует доступ к страницам <br />
# начинающимся с '/cgi-bin'<br />
Disallow: /cgi-bin # то же самое</p>
<p>чтобы отменить '*' на конце правила, можно использовать спецсимвол '$', например: <br />
User-agent: Yandex<br />
Disallow: /example$ # запрещает '/example', <br />
# но не запрещает '/example.html'<br />
User-agent: Yandex<br />
Disallow: /example # запрещает и '/example', <br />
# и '/example.html'<br />
User-agent: Yandex<br />
Disallow: /example$ # запрещает только '/example'<br />
Disallow: /exampleузнал о ней, укажите путь к sitemaps.xml, в качестве параметра директивы 'Sitemap' (если файлов несколько, укажите все), примеры: <br />
User-agent: Yandex<br />
Allow: /<br />
Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br />
Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p>
<p>или <br />
User-agent: Yandex<br />
Allow: /</p>
<p>User-agent: *<br />
Disallow: /</p>
<p>Sitemap: http://mysite.ru/site_structure/my_sitemaps1.xml<br />
Sitemap: http://mysite.ru/site_structure/my_sitemaps2.xml</p>
<p>Робот запомнит пути к sitemaps.xml, обработает файлы и будет использовать результаты при последующем формировании сессий закачки.</p>
<p><span style="color: #000000"><strong>Директива Host.</strong></span></p>
<p>Если ваш сайт имеет зеркала, специальный робот зеркальщик определит их и сформирует группу зеркал вашего сайта. В поиске будет участвовать только главное зеркало. Вы можете указать его у всех зеркал при помощи robots.txt, используя директиву 'Host', определив в качестве ее параметра имя главного зеркала. Директива 'Host' не гарантирует выбор указанного главного зеркала, тем не менее, алгоритм при принятии решения учитывает ее с высоким приоритетом. Пример: <br />
#Если www.glavnoye-zerkalo.ru главное зеркало сайта, то <br />
#robots.txt для всех сайтов из группы зеркал выглядит так <br />
User-Agent: *<br />
Disallow: /forum<br />
Disallow: /cgi-bin<br />
Host: www.glavnoye-zerkalo.ru</p>
<p>Важно: в целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву 'Host' необходимо добавлять в группе, начинающейся с записи 'User-Agent', непосредственно после директив 'Disallow'('Allow'). Аргументом директивы 'Host' является доменное имя с номером порта (80 по умолчанию), отделенным двоеточием. <br />
#Пример корректно составленного robots.txt, при обработке <br />
#которого директива Host учитывается<br />
User-Agent: *<br />
Disallow:<br />
Host: www.myhost.ru<br />
<br />
#Примеры некорректно составленных robots.txt, при обработке <br />
#которых директива Host может не учитываться<br />
#1.<br />
User-Agent: *<br />
Host: www.myhost.ru</p>
<p>#2.<br />
Host: www.myhost.ru</p>
<p>#3.<br />
User-Agent: *<br />
Host: www.myhost.ru<br />
Disallow:</p>
<p>#4.<br />
Host: www.myhost.ru<br />
User-Agent: *<br />
Disallow:</p>
<p>Важно: параметр директивы Host обязан состоять из одного корректного имени хоста (т.е. соответствующего RFC 952 и не являющегося IP-адресом) и допустимого номера порта. Некорректно составленные строчки 'Host:' игнорируются. <br />
# Примеры игнорируемых директив Host<br />
Host: www.myhost-.ru<br />
Host: www.-myhost.ru<br />
Host: www.myhost.ru:100000<br />
Host: www.my_host.ru<br />
Host: .my-host.ru:8000<br />
Host: my-host.ru.<br />
Host: my..host.ru<br />
Host: www.myhost.ru/<br />
Host: www.myhost.ru:8080/<br />
Host: http://www.myhost.ru<br />
Host: 213.180.194.129<br />
Host: www.firsthost.ru,www.secondhost.ru<br />
Host: www.firsthost.ru www.secondhost.ru</p>
<p>Примеры использования директивы Host: <br />
# domen.myhost.ru является главным зеркалом <br />
# www.domen.myhost.ru, тогда корректное использование <br />
# директивы Host такое:<br />
User-Agent: *<br />
Disallow:<br />
Host: domen.myhost.ru</p>
<p># domen.myhost.ru является главным зеркалом <br />
# www.domen.myhost.ru, тогда некорректное использование <br />
# директивы Host такое:<br />
User-Agent: *<br />
Disallow:<br />
Host: myhost.ru<br />
<br />
<span style="color: #000000"><strong>Директива Crawl-delay.</strong></span></p>
<p>Если сервер сильно нагружен и не успевает отрабатывать запросы на закачку, воспользуйтесь директивой "Crawl-delay". Она позволяет задать поисковому роботу минимальный период времени (в секундах) между концом закачки одной страницы и началом закачки следующей. В целях совместимости с роботами, которые не полностью следуют стандарту при обработке robots.txt, директиву "Crawl-delay" необходимо добавлять в группе, начинающейся с записи "User-Agent", непосредственно после директив "Disallow" ("Allow").</p>
<p>Поисковый робот Яндекса поддерживает дробные значения Crawl-Delay, например, 0.5. Это не гарантирует, что поисковый робот будет заходить на ваш сайт каждые полсекунды, но дает роботу больше свободы и позволяет ускорить обход сайта.</p>
<p>Примеры: <br />
User-agent: Yandex<br />
Crawl-delay: 2 # задает таймаут в 2 секунды</p>
<p>User-agent: *<br />
Disallow: /search<br />
Crawl-delay: 4.5 # задает таймаут в 4.5 секунды<br />
Наверх</p>
<p><span style="color: #000000"><strong>Директива Clean-param</strong></span></p>
<p>Если адреса страниц вашего сайта содержат динамические параметры которые не влияют на их содержимое (например: идентификаторы сессий, пользователей, рефереров и т.п.), вы можете описать их при помощи директивы 'Clean-param'. Робот Яндекса, используя эту информацию, не будет многократно перезакачивать дублирующуюся информацию. Таким образом, увеличится эффективность обхода вашего сайта, снизится нагрузка на сервер.</p>
<p>Например, на сайте есть страницы: <br />
www.site.ru/some_dir/get_book.pl?ref=site_1&book_id=123<br />
www.site.ru/some_dir/get_book.pl?ref=site_2&book_id=123<br />
www.site.ru/some_dir/get_book.pl?ref=site_3&book_id=123</p>
<p>параметр 'ref=' используется только для того, чтобы отследить с какого ресурса был сделан запрос и не меняет содержимое, по всем трем адресам будет показана одна и та же страница с книгой 'book_id=123'. Тогда, если в robots.txt указать: <br />
Clean-param: ref /some_dir/get_book.pl</p>
<p>вот так: <br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: ref /some_dir/get_book.pl</p>
<p>робот Яндекса сведет все адреса страницы к одному: <br />
www.site.ru/some_dir/get_book.pl?ref=site_1&book_id=123,</p>
<p>Если на сайте доступна страница без параметров:<br />
www.site.ru/some_dir/get_book.pl?book_id=123</p>
<p>То все сведется именно к ней, когда она будет проиндексирована роботом. Другие страницы вашего сайта будут обходиться чаще, так как нет необходимости обновлять страницы: <br />
www.site.ru/some_dir/get_book.pl?ref=site_2&book_id=123<br />
www.site.ru/some_dir/get_book.pl?ref=site_3&book_id=123</p>
<p>Синтаксис использования директивы: <br />
Clean-param: p0[&p1&p2&..&pn] [path]</p>
<p>В первом поле через '&' перечисляются параметры, которые нужно не учитывать. Во втором поле указывается префикс пути страниц, для которых нужно применить правило.</p>
<p><strong>Примечание:</strong></p>
<p>Префикс может содержать регулярное выражение в формате, аналогичном robots.txt, но с некоторыми ограничениями: можно использовать только символы A-Za-z0-9.-/*_. При этом * трактуется так же, как в robots.txt. В конец префикса всегда неявно дописывается '*', то есть: <br />
Clean-param: s /forum/showthread.php</p>
<p>означает, что параметр s будет считаться незначащим для всех url-ов, начинающихся с /forum/showthread.php. Второе поле указывать необязательно, в этом случае правило будет применяться для всех страниц сайта. Регистр учитывается. Действует ограничение на длину правила — 500 символов. Например: <br />
Clean-param: abc /forum/showthread.php<br />
Clean-param: sid&sort /forumt/*.php<br />
Clean-param: someTrash&otherTrash</p>
<p>Дополнительные примеры: <br />
#для адресов вида:<br />
www.site1.ru/forum/showthread.php?s=681498b9648949605&t=8243<br />
www.site1.ru/forum/showthread.php?s=1e71c4427317a117a&t=8243<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: s /forum/showthread.php<br />
#для адресов вида:<br />
www.site2.ru/index.php?page=1&sort=3a&sid=2564126ebdec301c607e5df<br />
www.site2.ru/index.php?page=1&sort=3a&sid=974017dcd170d6c4a5d76ae<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: sid /index.php<br />
#если таких параметров несколько:<br />
www.site1.ru/forum_old/showthread.php?s=681498605&t=8243&ref=1311<br />
www.site1.ru/forum_new/showthread.php?s=1e71c417a&t=8243&ref=9896<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: s&ref /forum*/showthread.php<br />
#если параметр используется в нескольких скриптах:<br />
www.site1.ru/forum/showthread.php?s=681498b9648949605&t=8243<br />
www.site1.ru/forum/index.php?s=1e71c4427317a117a&t=8243<br />
#robots.txt будет содержать:<br />
User-agent: Yandex<br />
Disallow:<br />
Clean-param: s /forum/index.php<br />
Clean-param: s /forum/showthread.php</p>
<p><br />
<span style="color: #ff0000">Дополнительная информация.</span></p>
<p><span style="color: #800000"><strong>Директивы robots.txt, которые не упомянуты в данном описании, робот Яндекса не поддерживает. </strong></span></p>
<p>Необходимо помнить, что результат использования расширений формата robots.txt может отличаться от результата без них, а именно: <br />
User-agent: Yandex <br />
Allow: /<br />
Disallow: /<br />
# без расширений все запрещалось так как 'Allow: /' игнорировалось, <br />
# с поддержкой расширений все разрешается</p>
<p>User-agent: Yandex<br />
Disallow: /private*html<br />
# без расширений запрещалось '/private*html', <br />
# а с поддержкой расширений и '/private*html', <br />
# и '/private/test.html', и '/private/html/test.aspx' и т.п.</p>
<p>User-agent: Yandex<br />
Disallow: /private$<br />
# без расширений запрещалось '/private$' и '/private$test' и т.п., <br />
# а с поддержкой расширений только '/private'</p>
<p>User-agent: *<br />
Disallow: /<br />
User-agent: Yandex<br />
Allow: /<br />
# без расширений из-за отсутствия перевода строки, <br />
# 'User-agent: Yandex' было бы проигнорировано и <br />
# результатом стало бы 'Disallow: /', но робот Яндекса <br />
# выделяет записи по наличию в строке 'User-agent:', <br />
# результат для робота Яндекса в данном случае 'Allow: /'</p>
<p>User-agent: *<br />
Disallow: /<br />
# комментарий1...<br />
# комментарий2...<br />
# комментарий3...<br />
User-agent: Yandex<br />
Allow: /<br />
# аналогично предыдущему примеру (см. выше)</p>
<p>Примеры использования расширенного формата robots.txt: <br />
User-agent: Yandex<br />
Allow: /archive<br />
Disallow: /<br />
# разрешает все, что содержит '/archive', остальное запрещено</p>
<p>User-agent: Yandex<br />
Allow: /obsolete/private/*.html$ # разрешает html файлы <br />
# по пути '/obsolete/private/...'<br />
Disallow: /*.php$ # запрещает все '*.php' на данном сайте<br />
Disallow: /*/private/ # запрещает все подпути содержащие <br />
# '/private/', но Allow выше отменяет <br />
# часть запрета<br />
Disallow: /*/old/*.zip$ # запрещает все '*.zip' файлы, содержащие <br />
# в пути '/old/'</p>
<p>User-agent: Yandex<br />
Disallow: /add.php?*user= <br />
# запрещает все скрипты 'add.php?' с параметром 'user'</p>
<p>При написании robots.txt необходимо помнить, что у робота есть разумное ограничение на его размер. Слишком большие robots.txt (более 32 Кб) считаются полностью разрешающими, то есть рассматриваются аналогично: <br />
User-agent: Yandex<br />
Disallow:</p>
<p>Также разрешающими считаются robots.txt, которые не удалось закачать (например, по причине неправильных http-заголовков) или отдающие 404 ошибку.<br />
<br />
<span style="color: #ff0000"><strong>Рамблер - Формат файла robots.txt</strong></span></p>
<p><span style="color: #000000"><strong>Формат файла robots.txt</strong></span></p>
<p>Формат файла robots.txt - особый. Он состоит из записей, каждая из которых состоит из двух полей: строки с названием клиентского приложения (user-agent), и одной или нескольких строк, начинающихся с директивы Disallow: <br />
<Поле> ":" <значение></p>
<p>Robots.txt должен создаваться в текстовом формате Unix. Большинство хороших текстовых редакторов уже умеют превращать символы перевода строки Windows в Unix. Либо ваш FTP-клиент должен уметь это делать. Для редактирования не пытайтесь пользоваться HTML-редактором, особенно таким, который не имеет текстового режима отображения кода.<br />
Поле User-agent</p>
<p>Строка User-agent содержит название робота. Робота Рамблера зовут: StackRambler поэтому если вы хотите создать инструкцию персольнально для нашего робота, то строка должна выглядеть следующим образом:<br />
User-agent: StackRambler</p>
<p>Вы можете создать инструкцию для всех роботов: <br />
User-agent: *</p>
<p>Поле Disallow:</p>
<p>Вторая часть записи состоит из строк Disallow. Эти строки - директивы (указания, команды) для данного робота. В каждой группе, вводимой строкой User-agent, должна быть хотя бы одна инструкция Disallow. Количество инструкций Disallow не ограничено.Они сообщают роботу какие файлы и/или каталоги роботу неразрешено индексировать. Вы можете запретить индексацию файла или каталога.</p>
<p>Следующая директива запрещает индексацию каталога /cgi-bin/:<br />
Disallow: /cgi-bin/ Обратите внимание на / в конце названия директории. Это важно. Чтобы запрещать посещение именно каталога "/dir", инструкция должна иметь вид: "Disallow: /dir/". А строка "Disallow: /dir" запрещает посещение всех страниц сервера, полное имя которых (от корня сервера) начинается с "/dir". Например: "/dir.html", "/dir/index.html", "/directory.html".</p>
<p>Внимание: точно так же и инструкции "Disallow: *", "Disallow: *.doc", "Disallow: /dir/*.doc" не запрещают ничего, поскольку файлов, имя которых начинается со звездочки или содержит ее, не существует! Использование регулярных выражений в строках Disallow, равно как и в файле robots.txt вообще, не предусмотрено.</p>
<p>Записаная следующим образом директива запрещает индексацию файла index.htm находящегося в корне:<br />
Disallow: /index.htm</p>
<p>К сожалению, инструкций Allow в файлах robots.txt не бывает. Поэтому даже если закрытых для индексирования документов очень много, Вам все равно придется перечислять именно их, а не немногочисленные "открытые" документы. Продумайте структуру сайта, чтобы закрытые для индексирования документы были собраны по возможности в одном месте.</p>
<p>Если директива Disallow будет пустой, это значит, что робот может индексировать ВСЕ файлы. Как минимум одна директива Disallow должна присутствовать для каждого поля User-agent, чтобы robots.txt считался верным. Полностью пустой robots.txt означает то же самое, как если бы его не было вообще.</p>
<p>Пустые строки и комментарии</p>
<p>Пустые строки допускаются между группами инструкций, вводимыми User-agent.</p>
<p>Инструкция Disallow учитывается, только если она подчинена какой-либо строке User-agent - то есть если выше нее есть строка User-agent.</p>
<p>Любой текст от знака решетки "#" до конца строки считается комментарием и игнорируется.</p>
<p>Пример:</p>
<p>Следующий простой файл robots.txt запрещает индексацию всех страниц сайта всем роботам, кроме робота Рамблера, которому, наоборот, разрешена индексация всех страниц сайта.<br />
# Инструкции для всех роботов<br />
User-agent: *<br />
Disallow: /</p>
<p># Инструкции для робота Рамблера<br />
User-agent: StackRambler<br />
Disallow:<br />
Распространенные ошибки: <br />
Перевернутый синтаксис: <br />
User-agent: /<br />
Disallow: StackRambler<br />
А должно быть так: <br />
User-agent: StackRambler<br />
Disallow: /<br />
Несколько директив Disallow в одной строке: <br />
Disallow: /css/ /cgi-bin/ /images/<br />
Правильно так: <br />
Disallow: /css/<br />
Disallow: /cgi-bin/<br />
Disallow: /images/</p>Внешние и внутренние ссылки. Поддомен.2010-10-24T20:21:14Z2010-10-24T20:21:14Zhttp://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/vneshnie-i-vnutrennie-ssylki-poddomen.htmlНиколайnash17@yandex.ruСчитается ли ссылка на поддомен внешней?<br /><br />И как расценивается ссылка с поддомена на основной сайт? Стоит ли на поддоменах делать сателиты?Считается ли ссылка на поддомен внешней?<br /><br />И как расценивается ссылка с поддомена на основной сайт? Стоит ли на поддоменах делать сателиты?IP-шники Яндекса2010-09-25T19:52:04Z2010-09-25T19:52:04Zhttp://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/ip-shniki-yandeksa.htmlНиколайnash17@yandex.ruПодскажите ip адреса ЯндексаПодскажите ip адреса ЯндексаSeoPult, отзывы.2010-05-28T05:32:17Z2010-05-28T05:32:17Zhttp://hostpartner.com.ua/poiskovaya-optimizatsiya-sayta/seopult-otzyvy.htmlНиколайnash17@yandex.ruКто пользуется системой SeoPult, интересны отзывы, насколько результативна система.Кто пользуется системой SeoPult, интересны отзывы, насколько результативна система.