• Страница 1 из 1
  • 1
Обзор трех основных поисковых систем Рунета: ч. 1
otpmДата: Среда, 24.Дек.2008, 12:27 | Сообщение # 1
Admin
Сообщений: 554
« 3 »
Статус: :-(
Найденные поисковой машиной документы относятся к одной из двух категорий: одни соответствуют запросу (релевантны), другие ему не соответствуют, то есть нерелевантны...
На этом простом механизме в настоящее время строится перспективный бизнес. Сами поисковые машины тоже относятся к одной из двух категорий: одни технологически эффективны, другие наоборот. Однако, современные поисковики настолько сложные системы, что уже не могут быть описаны в кооординатах "хорошо-плохо". Настоящий обзор представляет основные характеристики и текущее положение на рынке трех ведущих поисковых систем.

"Рамблер"

Поисковая машина "Рамблер" начала работу в октябре 1996 года, на стартовом этапе содержала всего 100 тысяч документов. "Рамблер" не был первой отечественной поисковой системой, однако в первый год своего существования (когда весь русский веб с приемлемой степенью правдоподобия индексировался "Рамблером", "Апортом", "Русской поисковой машиной", а также шведской и калифорнийской AltaVista) вынес основной груз поисковых запросов. Вторая версия "Рамблера" начала разрабатываться летом 2000 года, в марте нынешнего года приняла достаточно законченные очертания. В нее были введены функции, давно уже имевшиеся в конкурирующих системах. Она учитывает координаты слов, обучена строгой и нечеткой морфологии, связывает поиск с каталогом, в качестве которого используется Top100 (http://top100.rambler.ru/), группирует результаты поиска по сайтам, ищет по числам. Достаточно удачная архитектура продукта позволяет "Рамблеру" иметь для поисковика количество серверов в 2 раза меньшее, чем у "Яндекса", и в 3 раза меньшее, чем у "Апорта".

Важно для рекламодателей. Примерно половину показов на "Рамблере" дает поисковая система. Новый "Рамблер" распознает темы по аннотациям, чтобы связывать результаты поиска с другими разделами портала. Составлен тезаурус запросов, с помощью которого выделяются их темы. К примеру, запрос "лекарство такое-то" и реклама того же лекарства в некой аптеке дает CTR в 10 раз больше обычного. Делаются "перевязки" на другие разделы портала, которые выдаются вместе с результатами поиска, обеспечивая примерно 20% общей посещаемости разделов Rambler.ru (их средний CTR 4%). Существует статистический сервис, пока не сделанный публичным (доступен только работникам "Рамблера" и некоторым рекламодателям): выдача списка других запросов, которые делают авторы базового запроса, интересующего рекламодателя.

Важно для вебмастеров. "Паук" "Рамблера" производит индексирование в новостях 5 раз в день; в сайтах, входящих в Top100, - 1 раз в день; все прочие посещаются не чаще, чем 1 раз в две недели. Рамблер не индексирует личные странички, находящиеся на публичных зарубежных серверах (geocities, tripod и других), а страницы подобных отечественных сайтов (narod, boom) обходит медленней, чем другие ресурсы. Поскольку новостными считаются всего около 40 сайтов, выгодно иметь на своих страницах счетчик Top100 для быстрого отображения страниц в поисковой машине "Рамблера". К тому же, в рейтинг Top100 можно вносить подробные аннотации объемом до 4 Кб. Динамические страницы "Рамблер" пока не индексирует. На выставке "Комтек" руководством компании было указано, что именно нынешним летом эта ситуация может измениться. Новый и. о. президента "Рамблера" Антон Носик против этого запланированного нововведения.
Специалисты "Рамблера" пришли к выводу, что борьба с копиями не может идти только на уровне программных алгоритмов. Например, такая простая операция как отслеживание (с участием модератора) ситуации, при которой каждый документ, имеющий на 40 зеркалах библиотеки Мошкова, считается системой за один, экономит до 10% ресурсов поисковой базы.

"Апорт"

Поисковая машина "Апорт" была впервые продемонстрирована в феврале 1996 года на пресс-конференции "Агамы" по поводу открытия "Русского клуба". Тогда она искала только по сайту russia.agama.com. Потом она начала искать по четырем, потом по шести серверам... Короче, день рождения и фактический старт системы сильно "размазались" по времени, а официальная презентация "Апорта" состоялась только 11 ноября 1997 года. К тому времени в его базе был проиндексирован первый миллион документов, расположенных на 10 тысячах серверов. Создателем системы выступила компания "Агама" - разработчик программного обеспечения для платформы Windows, главным из которых являлся корректор орфографии "Пропись". Лингвистические разработки "Агамы" использовались при создании поисковой машины, в которой, скажем, в отличие от "Рамблера", изначально учитывалась морфология слов и осуществлялась по желанию клиента проверка орфографии запроса.

По тем же историческим причинам "Апорт" создавался и продолжает функционировать под Windows NT, хотя в XXI веке уже становится очевидным, что поисковая машина должна работать на платформе UNIX (когда речь идет о системе на базе NT, включающей 40-50 серверов, то кнопку Reset приходится нажимать несколько раз в день, а вовсе не один раз в месяц). Правда, "Апорт" не использует единственное кластерное решение, которое предлагает Microsoft (MS Claster Server со всеми его ограничениями), и вообще избегает универсальных решений (не используется, например, SQL-сервер или Oracle - они хороши для большого круга задач, но не для полнотекстового поиска).

Важнейшими свойствами первой версии "Апорта" являлся перевод запроса и результатов поиска на английский язык и обратно, а также реконструкция всех проидексированных страниц из собственной базы (что означает возможность просмотра страниц, уже несуществующих в оригинале).

В ноябре 1998 года компания "Агама" была куплена за 55 тысяч долларов израильским капиталом в лице Джозефа Авчука (с сохранением торговых марок "Апорт" и "Агама"). В марте 1999 года Авчук входит в долю, а летом того же года окончательно покупает каталог Ау!, торговой марке которого повезло существенно меньше - она была переименована сначала в AtRus, а потом и вовсе уничтожена при экспорте каталога на сайты "России он-лайн", "Омен" и "Апорт". К концу 1999 года Авчук вложил в "Апорт" и AtRus первый миллион долларов, позволивший в октябре того же года представить на компьютерных выставках по обе стороны океана принципиально новую поисковую машину "Апорт 2000", полностью интегрированную с Atrus (ныне "Каталог-Апорт").

"Апорт 2000" стал первым русским поисковиком, построенным на основе выдачи результатов по отдельно взятым сайтам. Для разделения ресурсов на сайты используется информация, которую "Апорту" предоставляет каталог AtRus или сведения, введенные в "Апорт" владельцами ресурсов. На худой конец, приходится опираться на алгоритм, который позволяет по некоторым формальным признакам выделить отдельные сайты.

"Апорт 2000" стал первой российской поисковой машиной, практически реализовавший две базовых технологии американской поисковой машины Google. Первая - учет "ранга страницы" (Page Rank), который характеризует ее популярность (вычисляется по количеству ссылок на ресурс из внешнего Интернета: вес ссылки с популярного сайта выше, чем вес ссылки с менее популярного; ссылки, включающие слова запроса, имеют больший вес, чем, скажем, слово "здесь"). Вторая - обработка запроса, ориентируясь на HTML-код страницы (к примеру, анализ текста, содержащегося между тегами шрифтов h2 и h6 дает больший приоритет для первого варианта). В "Апорт 2000" учитывается также вхождение слов запроса в URL. Среди недокументированных особенностей - больший приоритет сайтам, получившим высшую и элитную лигу в каталоге AtRus.

Еще на этапе разработки "Апорта 2000" в него были заложены "крючечки", позволяющие корректировать приоритеты в выдаче результатов с учетом посещаемости сайтов по счетчику Aport Top 1000 и для сайтов, чье название в службах реальных имен является синонимом или совпадает со словами запроса (так как любая служба имен модеририруется, и полной чуши в ее данных быть не может). Обе эти возможности до сих пор не реализованы.

Можно отметить и то, что "Апорт" первым устроил поиск по новостным лентам (какие бы ложные сведения о приоритете "Яндекса" в этом сервисе не распускал в свое время Internet.ru).

И, наконец, еще одно первенство "Апорта" - использование платной нулевой строки в выдаче (кстати, "Апорт" первым среди наших поисковиков начал покупать такой сервис у AltaVista, которая за небольшую плату выдавала его ссылку первой при запросе "Russian Search"). Однако в "Апорте" нельзя купить не нулевое, а просто более высокое место для своего сайта в результатах поиска.

Пользователи "Апорта" (в отличие завсегдатаев "Яндекса") мало пользуются расширенным поиском (на 8000 загрузок простой страницы приходится 300 вызовов страницы "Расширенный поиск").

Организация масштабируемости в архитектуре "Апорт 2000" такова, что можно дробить поисковую базу "Апорта" на несколько отдельных баз, каждый маленький "Апорт" работает на своем компьютере. "Апорт 2000" считает, что весь Интернет поделен на фрагменты. После проведения поиска по этим фрагментам, пользователю интегрируется и выдается общий ответ. Добавлять новые маленькие "апортики" можно путем не очень сложной процедуры. В случаях аварий отдельных машин выдаются несколько отличные от штатных интегральные результаты, что мы можем время от времени наблюдать.

31 июля 2000 года Golden Telecom купил семейство интернет-проектов "Агама", включающее "Апорт" и AtRus, для включения в "Россию-он-лайн" и околоконтентные проекты.
В мае 2001 года окончательно завершилась сделка по смене хозяина самого Golden Telecom. Андрей Косогов (первый заместитель председателя правления "Альфа-банка") сообщил "Интерфаксу" о том, что новые владельцы контрольного пакета будут осуществлять только стратегическое управление Golden Telecom через совет директоров (все прежние хозяева "Апорта" непосредственно вмешивались в управление проектом).

Важно для вебмастеров. "Апорт" индексирует динамические страницы, но не по умолчанию, а по отдельным просьбам владельцев сайтов. "Апорт" изначально и по настоящее время учитывает метатеги.

"Яндекс"

В 1996 году компанией CompTek, созданной со стопроцентным американским участием, на выставке Internetcom было официально объявлено о существовании "Яндекса". Это была морфологическая приставка к "Альтависте", которую отличало быстродействие и умение строить гипотезы. Пословный индекс для незнакомых слов организован также, как и для словарных - этим "Яндекс" отличается от других поисковиков.
23 сентября 1997 года "Яндекс" стал интернет-проектом. Релевантность документов вычислялась в зависимости от частотных характеристик искомых слов, веса слова или выражения, близости искомых слов в тексте документа друг к другу и так далее. В октябре 1999 года в интервью "ИнфоБизнесу" Аркадий Волож указал: "Финансирование "Яндекса" всегда было не ниже сегодняшнего финансирования "Апорта". В результате, 6 июня 2000 года была представлена вторая версия системы, а нынешняя версия функционирует с 23 мая 2001 года. Ее главное нововведение, которое потребовало неизбежной перестройки ядра, - ранжирование по ссылкам. Другие нововведения относятся, главным образом, к переформулированию системой запросов пользователя: "что такое предмет" преобразуется в "предмет - это...", а если запрос начинается на слово "как", то в результатах в первую очередь пытаются выдать FAQ или иной справочный документ. Новый "Яндекс" стал "понимать" альтернативную лексику, которая входит в 5 процентов запросов. Только в последней версии Яндекса индекс цитируемости стал непосредственно использоваться поисковой машиной.

В настоящее время "Яндекс" обладает самой полной базой документов среди русских искалок, а также самой узнаваемой маркой.


Заработок для веб-мастеров
 
  • Страница 1 из 1
  • 1
Поиск:

Счетчик тИЦ и PR