Независимые поисковые системы интернета. Поисковые системы интернета: обзор существующих решений

Здравствуйте, уважаемые читатели блога сайт. , то его немногочисленным пользователям было достаточно собственных закладок. Однако, как вы помните, происходил в геометрической прогрессии, и совсем скоро ориентироваться во всем ее многообразии стало сложнее.

Тогда появились каталоги (Яху, Дмоз и другие), в которых их авторы добавляли и сортировали по категориям различные сайты. Это сразу же облегчило жизнь тогдашним, еще не очень многочисленным пользователям глобальной сети. Многие из этих каталогов живы и до сих пор.

Но через некоторое время размеры их баз стали настолько большими, что разработчики сначала задумались о создании поиска внутри них, а потом уже и о создании автоматизированной системы индексации всего содержимого интернета, чтобы сделать его доступным всем желающим.

Основные поисковики русскоязычного сегмента интернета

Как вы понимаете, идея эта реализовалась с ошеломительным успехом, но, правда, все сложилось хорошо только для горстки избранных компаний, которым удалось не сгинуть на просторах интернета. Почти все поисковые системы, которые появились на первой волне, сейчас либо исчезли, либо прозябают, либо были куплены более удачными конкурентами.

Поисковая система представляет из себя очень сложный и, что немаловажно, очень ресурсоемкий механизм (имеются в виду не только материальные ресурсы, но и людские). За внешне простой , или ее аскетичным аналогом от Гугла, стоят тысячи сотрудников, сотни тысяч серверов и многие миллиарды вложений, которые необходимы для того, чтобы эта махина продолжала работать и оставалась конкурентоспособной.

Выйти на этот рынок сейчас и начать все с нуля — это скорее утопия, чем реальный бизнес проект. Например, одна из богатейших в мире корпораций Микрософт десятилетиями пыталась закрепиться на рынке поиска, и только сейчас их поисковик Бинг начинает потихоньку оправдывать их ожидания. А до этого была целая череда провалов и неудач.

Что уж говорить о том, чтобы выйти на этот рынок без особых финансовых влияний. К примеру, наша отечественная поисковая система Нигма имеет много чего полезного и инновационного в своем арсенале, но их посещаемость в тысячи раз уступает лидерам рынка России. Для примера взгляните на суточную аудиторию Яндекса:

В связи с этим можно считать, что список основных (лучших и самых удачливых) поисковиков рунета и всего интернета уже сформировался и вся интрига заключается только в том, кто кого в итоге сожрет, ну или каким образом распределится их процентная доля, если все они уцелеют и останутся на плаву.

Рынок поисковых систем России очень хорошо просматривается и тут, наверное, можно выделить двух или трех основных игроков и парочку второстепенных. Вообще, в рунете сложилась достаточно уникальная ситуация, которая повторилась, как я понимаю, только еще в двух странах в мире.

Я говорю о том, что поисковик Google, придя в Россию в 2004 году, не смог до сих пор захватить лидерства. На самом деле, они пытались примерно в этот период купить Яндекс, но что-то там не сложилось и сейчас «наша Раша» вместе с Чехией и Китаем являются теми местами, где всемогущий Гугл, если не потерпел поражение, то, во всяком случае, встретил серьезное сопротивление.

На самом деле, увидеть текущее положение дел среди лучших поисковиков рунета может любой желающий. Достаточно будет вставить этот Урл в адресную строку вашего браузера:

Http://www.liveinternet.ru/stat/ru/searches.html?period=month;total=yes

Дело в том, что большая часть использует на своих сайтах , а данный Урл позволяет увидеть статистику захода посетителей с различных поисковых систем на все сайты, которые принадлежат доменной зоне RU.

После ввода приведенного Урла вы увидите не очень приглядную и презентабельную, но зато хорошо отражающую суть дела картинку. Обратите внимание на первую пятерку поисковых систем, с которых сайты на русском языке получают трафик:

Да, конечно же, не все ресурсы с русскоязычным контентом размещаются в этой зоне. Есть еще и SU, и РФ, да и общих зонах типа COM или NET полно интернет проектов ориентированных на рунет, но все же, выборка получается довольно-таки репрезентативная.

Эту зависимость можно оформить и более красочно, как, например, сделал кто-то в сети для своей презентации:

Сути это не меняет. Есть пара лидеров и несколько сильно и очень сильно отстающих поисковых систем. Кстати, о многих из них я уже писал. Иногда бывает довольно занимательно окунуться в историю успеха или, наоборот, покопаться в причинах неудач когда-то перспективных поисковиков.

Итак, в порядке значимости для России и рунета в целом, перечислю их и дам им краткие характеристики:

Поиск в Гугле стал для многих жителей планеты уже нарицательным — о том, вы можете прочитать по ссылке. Мне в этом поисковике нравился вариант «перевод результатов», когда ответы вы получали со всего мира, но на своем родном языке, однако сейчас он, к сожалению, не доступен (во всяком случае на google.ru).

Так же в последнее время меня озадачивает и качество их выдачи (Search Engine Result Page). Лично я всегда сначала использую поисковую систему зеркала рунете (там есть , ну и привык я к ней) и только не найдя там вразумительного ответа обращаюсь к Гуглу.

Обычно их выдача меня радовала, но последнее время только озадачивает — порой такой бред вылазит. Возможно, что их борьба за повышение дохода с контекстной рекламы и постоянная перетасовка выдачи с целью дискредитировать Seo продвижение могут привести к обратному результату. Во всяком случае в рунете конкурент у этого поисковика имеется, да еще какой.

Думаю, что вряд ли кто-то специально будет заходить на Go.mail.ru для поиска в рунете. Поэтому трафик на развлекательных проектах с этой поисковой системы может быть существенно больше, чем десять процентов. Владельцам таких проектов стоит обратить внимание на эту систему.

Однако, кроме ярко выраженных лидеров на рынке поисковых систем русскоязычного сегмента интернета, существует еще несколько игроков, доля которых довольно низка, но тем не менее сам факт их существования заставляет сказать о них пару слов.

Поисковые системы рунета из второго эшелона

Поисковые системы масштаба всего интернета

По большому счету в масштабах всего интернета серьезный игрок только один — Гугл . Это безусловный лидер, однако некоторая конкуренция у него все же имеется.

Во-первых, это все тот же Бинг , который, например, на американском рынке имеет очень хорошие позиции, особенно, если учитывать, что его движок используется так же и на всех сервисах Яху (почти треть от всего рынка поиска США).

Ну, а во-вторых, в силу огромной доли, которую составляют пользователи из Китая в общем числе пользователей интернета, их главный поисковик под названием Baidu вклинивается в распределение мест на мировом олимпе. Он появился на свет в 2000 году и сейчас его доля составляет около 80% процентов от всей национальной аудитории Китая.

Трудно о Байду сказать еще что-то вразумительное, но на просторах интернета встречаются суждения, что места в его Топе занимают не только наиболее релевантные запросу сайты, но и те, кто за это заплатил (напрямую поисковику, а не Сео конторе). Конечно же, это относится в первую очередь к коммерческой выдаче.

В общем-то, глядя на статистику становится понятно, почему Google там легко идет на то, чтобы ухудшать свою выдачу в обмен на увеличение прибыли с контекстной рекламы. Фактически они не боятся оттока пользователей, ибо в большинстве случаев им уходить особо и некуда. Такая ситуация несколько печалит, но посмотрим, что будет дальше.

К слову сказать, чтобы еще больше усложнить жизнь оптимизаторам, а может быть, чтобы поддержать спокойствие пользователей этого поисковика, Google с недавних пор применяет шифрование при передаче запросов из браузера пользователей в поисковую строку. Скоро уже нельзя будет увидеть в статистике счетчиков посетителей, по каким запросам приходили к вам пользователи с Гугла.

Конечно же, кроме озвученных в этой публикации поисковых систем, существует еще не одна тысяча других — региональных, специализированных, экзотических и т.д. Пытаться их все перечислить и описать в рамках одной статьи будет не возможно, да и, наверное, не нужно. Давайте лучше скажу пару слов о том, как не легко создать поисковик и как не просто и не дешево его поддерживать в актуальном состоянии.

Подавляющее большинство систем работают по схожим принципам (читайте о том, и про ) и преследуют одну и ту же цель — дать пользователям ответ на их вопрос. Причем ответ этот должен быть релевантным (соответствующим вопросу), исчерпывающим и, что не маловажно, актуальным (первой свежести).

Решить эту задачу не так-то уж и просто, особенно учитывая, что поисковой системе нужно будет налету проанализировать содержимое миллиардов интернет страниц, отсеять лишние, а из оставшихся сформировать список (выдачу), где вначале будут идти наиболее подходящие под вопрос пользователя ответы.

Эта сверхсложная задача решается предварительным сбором информации с этих страниц с помощью различных индексирующих роботов . Они собирают ссылки с уже посещенных страниц и загружают с них информацию в базу поисковой системы. Бывают боты индексирующие текст (обычный и быстробот, который живет на новостных и часто обновляемых ресурсах, чтобы в выдаче всегда были представлены самые свежие данные).

Кроме этого бывают роботы индексаторы изображений (для последующего их вывода в ), фавиконок, зеркал сайтов (для их последующего сравнения и возможной склейки), боты проверяющие работоспособность интернет страниц, которые пользователи или же через инструменты для вебмастеров (тут можете почитать про , и ).

Сам процесс индексации и следующий за ним процесс обновления индексных баз довольно времязатратный. Хотя Гугл делает это значительно быстрее конкурентов, во всяком случае Яндекса, которому на это дело требует неделя-другая (читайте про ).

Обычно текстовое содержимое интернет страницы поисковик разбивает на отдельные слова, которые приводит к базовым основам, чтобы потом можно было давать правильные ответы на вопросы, заданные в разных морфологических формах. Весь лишний обвес в виде Html тегов, пробелов и т.п. вещей удаляется, а оставшиеся слова сортируются по алфавиту и рядом с ними указывается их позиция в данном документе.

Такая шняга называется обратным индексом и позволяет искать уже не по вебстраницам, а по структурированным данным, находящимся на серверах поисковой системы.

Число таких серверов у Яндекса (который ищет в основном только по русскоязычным сайтам и чуток по украинским и турецким) исчисляется десятками или даже сотнями тысяч, а у Google (который ищет на сотнях языков) — миллионами.

Многие сервера имеют копии, которые служат как для повышения сохранности документов, так и помогают увеличить скорость обработки запроса (за счет распределения нагрузки). Оцените расходы на поддержание всего этого хозяйства.

Запрос пользователя будет направляться балансировщиком нагрузки на тот серверный сегмент, который менее всего сейчас нагружен. Потом проводится анализ региона, откуда пользователь поисковой системы отправил свой запрос, и делается его морфологически разбор. Если аналогичный запрос недавно вводили в поисковой строке, то пользователю подсовываются данные из кеша, чтобы лишний раз не грузить сервера.

Если запрос еще не был закеширован, то его передают в область, где расположена индексная база поисковика. В ответ будет получен список всех интернет страниц, которые имеют хоть какое-то отношение к запросу. Учитываются не только прямые вхождения, но и другие морфологические формы, а так же , и т.п. вещи.

Их нужно отранжировать, и на этом этапе в дело вступает алгоритм (искусственный интеллект). Фактически запрос пользователя размножается за счет всех возможных вариантов его интерпретации и ищутся одновременно ответы на множество запросов (за счет использования операторов языка запросов, некоторые из которых доступны и обычным пользователям).

Как правило, в выдаче присутствует по одной странице от каждого сайта (иногда больше). сейчас очень сложны и учитывают множество факторов. К тому же, для их корректировки используются и , которые вручную оценивают реперные сайты, что позволяет скорректировать работу алгоритма в целом.

В общем, дело ясное, что дело темное. Говорить об этом можно долго, но и так понято, что удовлетворенность пользователей поисковой системой достигается, ох как не просто. И всегда найдутся те, кому что-то не нравится, как, например, нам с вами, уважаемые читатели.

Удачи вам! До скорых встреч на страницах блога сайт

посмотреть еще ролики можно перейдя на

");">

Вам может быть интересно

Яндекс Пипл - как искать людей по социальным сетям Апометр - бесплатный сервис по отслеживанию изменений выдачи и апдейтов поисковых систем DuckDuckGo - поисковая система, которая не следит за тобой
Как проверить скорость интернета - онлайн тест соединения на компьютере и телефоне, SpeedTest, Яндекс и другие измерители
Яндекс и Гугл картинки, а так же поиск по файлу изображения в Tineye (тинай) и Google

На первый взгляд может показаться, что быть лучше Google может только «Яндекс», да и то не факт. Эти компании вкладывают в инновации и развитие огромные суммы. Неужели хоть у кого-то есть шанс не только соперничать с лидерами, но и побеждать? Ответ Лайфхакера : «Да!» Есть несколько поисковиков, которым это удалось. Давайте посмотрим на наших героев.

Что это

Это довольно известная поисковая система с открытым исходным кодом. Серверы находятся в США. Кроме собственного робота, поисковик использует результаты других источников: Yahoo! Search BOSS, «Википедия», Wolfram|Alpha.

Чем лучше

DuckDuckGo позиционирует себя как поиск, обеспечивающий максимальную приватность и конфиденциальность. Система не собирает никаких данных о пользователе, не хранит логи (нет истории поиска), использование файлов cookie максимально ограничено.

DuckDuckGo не собирает личную информацию пользователей и не делится ею. Это наша политика конфиденциальности.
Гэбриел Вайнберг (Gabriel Weinberg), основатель DuckDuckGo

Зачем это вам

Все крупные поисковые системы стараются персонализировать поисковую выдачу на основе данных о человеке перед монитором. Этот феномен получил название «пузырь фильтров»: пользователь видит только те результаты, которые согласуются с его предпочтениями или которые система сочтёт таковыми.

DuckDuckGo формирует объективную картину, не зависящую от вашего прошлого поведения в Сети, и избавляет от тематической рекламы Google и «Яндекса», основанной на ваших запросах. При помощи DuckDuckGo легко искать информацию на иностранных языках: Google и «Яндекс» по умолчанию отдают предпочтение русскоязычным сайтам, даже если запрос введён на другом языке.

Что это

« » - российская метапоисковая система, разработанная выпускниками МГУ Виктором Лавренко и Владимиром Чернышовым. Осуществляет поиск по индексам Google, Bing, «Яндекса» и другим, а также имеет собственный поисковый алгоритм.

Чем лучше

Поиск по индексам всех крупных поисковых систем позволяет формировать релевантную выдачу. Помимо этого, «Нигма» разбивает результаты на несколько тематических групп (кластеров) и предлагает пользователю сузить поле поиска, отбросив ненужные или выделив приоритетные. Благодаря модулям «Математика» и «Химия» можно прямо в строке поиска решать математические задачи и запрашивать результаты химических реакций.

Зачем это вам

Избавляет от необходимости искать один и тот же запрос в разных поисковиках. Кластерная система позволяет легко манипулировать результатами поиска. Например, «Нигма» собирает в отдельный кластер результаты из интернет-магазинов. Если вы не намереваетесь что-то покупать, то просто исключите эту группу. Выбрав кластер «Англоязычные сайты», вы получите выдачу только на английском. Модули «Математика» и «Химия» помогут школьникам.

К сожалению, в настоящее время проект не развивается, так как разработчики перенесли свою активность на вьетнамский рынок. Тем не менее «Нигма» пока не только не устарела, но в некоторых вещах по-прежнему даёт фору Google. Будем надеяться, что разработка возобновится.

Что это

not Evil - система, осуществляющая поиск по анонимной сети Tor. Для использования нужно зайти в эту сеть, например запустив специализированный браузер с одноимённым названием. not Evil не единственный поисковик в своём роде. Есть LOOK (поиск по умолчанию в Tor-браузере, доступен из обычного интернета) или TORCH (один из самых старых поисковиков в Tor-сети) и другие. Мы остановились на not Evil из-за недвусмысленного намёка на сам Google (достаточно посмотреть на стартовую страницу).

Чем лучше

Ищет там, куда Google, «Яндексу» и другим поисковикам вход закрыт в принципе.

Зачем это вам

В сети Tor много ресурсов, которые невозможно встретить в законопослушном интернете. И по мере того как ужесточается контроль властей над содержанием Сети, их число будет расти. Tor - это своеобразная Сеть внутри Сети: со своими социалками, торрент-трекерами, СМИ, торговыми площадками, блогами, библиотеками и так далее.

YaCy

Что это

YaCy - децентрализованная поисковая система, работающая по принципу сетей P2P. Каждый компьютер, на котором установлен основной программный модуль, сканирует интернет самостоятельно, то есть является аналогом поискового робота. Полученные результаты собираются в общую базу, которую используют все участники YaCy.

Чем лучше

Здесь сложно говорить, лучше это или хуже, так как YaCy - это совершенно иной подход к организации поиска. Отсутствие единого сервера и компании-владельца делает результаты полностью независимыми от чьих-то предпочтений. Автономность каждого узла исключает цензуру. YaCy способен вести поиск в глубоком вебе и неиндексируемых сетях общего пользования.

Зачем это вам

Если вы сторонник открытого ПО и свободного интернета, не подверженного влиянию государственных органов и крупных корпораций, то YaCy это ваш выбор. Также с его помощью можно организовать поиск внутри корпоративной или другой автономной сети. И пусть пока в быту YaCy не слишком полезен, он является достойной альтернативой Google с точки зрения процесса поиска.

Pipl

Что это

Pipl - система, предназначенная для поиска информации о конкретном человеке.

Чем лучше

Авторы Pipl утверждают, что их специализированные алгоритмы ищут эффективнее, чем «обычные» поисковики. В частности, приоритетными источниками информации являются профили социальных сетей, комментарии, списки участников и различные базы данных, где публикуются сведения о людях, например базы судебных решений. Лидерство Pipl в этой области подтверждено оценками Lifehacker.com, TechCrunch и других изданий.

Зачем это вам

Если вам нужно найти информацию о человеке, проживающем в США, то Pipl будет намного эффективнее Google. Базы данных российских судов, видимо, недоступны для поисковика. Поэтому с гражданами России он справляется не так хорошо.

Что это

Ещё один специализированный поисковик. Ищет различные звуки (дом, природа, машины, люди и так далее) в открытых источниках. Сервис не поддерживает запросы на русском языке, но есть внушительный список русскоязычных тегов, по которым можно выполнить поиск.

Чем лучше

В выдаче только звуки и ничего лишнего. В настройках поиска можно выставить желаемый формат и качество звучания. Все найденные звуки доступны для скачивания. Имеется поиск звуков по образцу.

Зачем это вам

Если вам нужно быстро найти звук мушкетного выстрела, удары дятла-сосуна или крик Гомера Симпсона, то этот сервис для вас. И это я выбрал только из доступных русскоязычных запросов. На английском языке спектр ещё шире. А если серьёзно, специализированный сервис предполагает специализированную аудиторию. Но вдруг и вам пригодится?

Жизнь альтернативных поисковиков часто бывает скоротечной. О долгосрочных перспективах подобных проектов Лайфхакер спросил бывшего генерального директора украинского филиала компании «Яндекс» Сергея Петренко.

Что касается судьбы альтернативных поисковиков, то она проста: быть очень нишевыми проектами с небольшой аудиторией, следовательно без ясных коммерческих перспектив или, наоборот, с полной ясностью их отсутствия.

Если посмотреть на примеры в статье, то видно, что такие поисковики либо специализируются в узкой, но востребованной нише, которая, возможно только пока, не выросла настолько, чтобы оказаться заметной на радарах Google или «Яндекса», либо тестируют оригинальную гипотезу в ранжировании, которая пока не применима в обычном поиске.

Например, если поиск по Tor вдруг окажется востребованным, то есть результаты оттуда понадобятся хотя бы проценту аудитории Google, то, конечно, обычные поисковики начнут решать проблему, как их найти и показать пользователю. Если поведение аудитории покажет, что заметной доле пользователей в заметном количестве запросов более релевантными кажутся результаты, данные без учёта факторов, зависящих от пользователя, то «Яндекс» или Google начнут давать такие результаты.

«Быть лучше» в контексте этой статьи не означает «быть лучше во всём». Да, во многих аспектах нашим героям далеко до Google и «Яндекса» (даже до Bing далековато). Но зато каждый из этих сервисов даёт пользователю нечто такое, чего не могут предложить гиганты поисковой индустрии.

Следопыт поможет посетителям Вашего Web-сервера просто и быстро находить нужную информацию.

Значительный рост объема информации в Internet привел к тому, что поиск нужного документа даже на одном единственном Web-сервере стал представлять настоящую проблему. Опыт показывает, что с ростом объема Web-узла даже самая совершенная и продуманная система ссылок между документами часто не позволяет пользователю найти требуемую информацию за разумное время. Для решения этой проблемы и был разработан пакет Серверный Следопыт.

Система Серверный Следопыт относится к классу так называемых поисковых машин , то есть программ поиска информации на отдельном узле Web или сервере корпоративной интрасети. При разработке Следопыта учитывались следующие две особенности работы программ в Internet. Во-первых, было учтено, что основная часть пользователей Internet не является специалистами в области компьютерных технологий. Это означает, что процедура поиска информации должна быть максимально простой, а результаты поиска - наглядными и информативными. В результате в систему Следопыт были включены следующие свойства, существенно упрощающие работу непрофессиональных пользователей:

поиск документов по запросам на естественном русском и английском языке,
ранжирование документов по степени близости к запросу,
подсветка обнаруженных фраз и выражений в найденных документах,
автоматическое составление рефератов документов.

Поясним значение этих особенностей, выделяющих Следопыт из ряда других поисковых серверов.

Поиск документов по запросам на естественном языке реализован на основе технологии поиска Следопыт™, разработанной компанией «МедиаЛингва». Эта технология прекрасно зарекомендовала себя в персональной поисковой системе Следопыт v1.0 . Таким образом, посетителям Вашего Web-узла уже не требуется изучать формальный язык запросов к поисковой машине и составлять сложные конструкции из слов, выражений и логических операторов: достаточно написать вопрос в произвольной форме, как если бы он передавался человеку. По такому запросу будут найдены не только документы, содержащие в точности такую же фразу, но и все документы, содержащие близкие по смыслу выражения. Запросы обрабатываются на русском и английском языке.

Ранжирование документов по степени близости к запросу . Отчет Серверного Следопыта содержит список найденных документов, упорядоченный следующим образом: первыми в отчете идут документы, наиболее точно соответствующие запросу. Таким образом, если нужные документы обнаружены, то они почти наверняка окажутся в верхней части отчета. Это избавляет пользователя системы от утомительного просмотра большого количества не интересных ему документов.

Подсветка фраз и выражений в документах. Для того чтобы упростить анализ документов, обнаруженных Следопытом, в них выделяются слова и фразы, по которым принималось решение о соответствии документа запросу. Эта особенность системы существенно упрощает работу с найденными документами и позволяет при необходимости просматривать только интересующие фрагменты больших документов. Нужно отметить, что ранжирование и подсветка в найденных документах также реализованы на основе технологии Следопыт™.

Автоматическое составление рефератов документов. Для каждого документа, обработанного поисковой системой, автоматически составляется короткий реферат, отражающий содержание документа. Эти рефераты выдаются пользователю в отчете о найденных документах и позволяют оценить содержание документа, даже не обращаясь к нему. Для составления рефератов применяется технология автоматического реферирования текстов, разработанная специалистами компании «МедиаЛингва».

Вторым моментом, который был учтен при разработке данного программного продукта, стало то, что система предназначена для работы в Internet. Это означает, что система должна быть совместима с существующими Internet-технологиями и стандартами, устойчиво работать в условиях высокой нагрузки, характерной для Web-серверов. Отсюда ряд технологических особенностей:

индексирование Web-страниц,
клиент-серверное исполнение поисковой системы,
высокая скорость работы,
поддержка основных технологий Internet,
работа с пятью кодировками кириллицы.

Индексирование Web-страниц. Поисковая система Серверный Следопыт является так называемой индексирующей системой. Это означает, что прежде чем производить поиск документов, система накапливает информацию о положении всех слов на всех страницах Web-узла. Эта информация сохраняется внутри специализированной компактной базы данных, в дальнейшем обеспечивающей быстрое обнаружение требуемых документов.

Клиент-серверное исполнение системы. Поисковая система выполнена по клиент-серверной технологии. Это означает, что функции индексирования, поиска и отображения информации распределены между различными компонентами системы. Такой подход позволяет при необходимости эффективно распределить нагрузку между различными компьютерами и, тем самым, повысить производительность системы в целом.

Высокая скорость работы. Для всех серверных систем наиболее важным критерием их эффективности является скорость их работы. Для Серверного Следопыта, в частности, важными параметрами является скорость индексирования и поиска информации. Как показало тестирование и опыт эксплуатации, Следопыт позволяет индексировать информацию со скоростью до 80–100 МБ в час и обрабатывать не менее 10–15 тысяч запросов в сутки.

Поддержка основных технологий Internet. Для обмена между компонентами Серверного Следопыта используется стандартный протокол Internet TCP/IP, а для взаимодействия между поисковыми клиентами и Web-сервером протокол CGI/1.1. Это позволяет Следопыту работать с большинством Web-серверов, работающих на платформе Windows/Intel.

Работа с пятью кодировками кириллицы. Исторически сложилось так, что в русской части Internet одновременно используется несколько кодировок кириллицы. Серверный Следопыт автоматически распознает пять основных кодировок: Windows-1251, DOS Cyrillic 866, KOI8-R (Unix), Mac Cyrillic и ISO 8859-5 (Sun). Отчеты о найденных документах могут генерироваться в любой из перечисленных кодировок.

Таким образом, Серверный Следопыт представляет собой мощную поисковую систему, позволяющую упростить работу с информацией на Вашем узле World Wide Web.

Серверный Следопыт используется для поиска информации на сервере МедиаЛингва.

Посмотреть в действии Серверный Следопыт можно также на сервере электронного издательства «

Сегодня рынок предлагает значительный перечень всевозможных поисковых утилит, программ и систем разного уровня. Программное обеспечение этого класса бывает двух типов*. {Градский П. Поисковые системы. // Санкт-Петербургские ведомости //, 26 июня 2002 года; Дериев И. Особенности национального поиска. // Компьютерное Обозрение // №15,17 - 23 апреля 2002. Уваров С. Ищущие да обрящут. http://nrd.pnpi.spb.ru/UseSoft/Journals/IntemetZone/ izone229/pub/izone8.htm www.cronos.ru }

Программные продукты использующие технологию прямого поиска, просто перебирают файлы и выполняют поиск в каждом из них. Недостатком этой технологии являются значительные временные затраты. Аналогичные утилиты традиционно присутствуют во всех операционных системах, файловых менеджерах и инструментальных пакетах.

1. Поисковик AVSearch . Если у вас совсем нет денег, то вам может помочь бесплатная программа Анатолия Вознюка - AVSearch (www.avtlab.ru). Однако этот программный продукт умеет работать только с текстовыми файлами и файлами формата RTF, правда во всех кодировках от СР866 до Unicode, что, в частности, обеспечивает «поддержку» и формата DOC, т.к. документы Microsoft Word исследуются как обычный текст. Программа осуществляет поиск во всех популярных архивах без использования внешних модулей. Ее интерфейс достаточно прост и удобен. В общем программа неплохая, но ее существенным недостатком является медлительность.

2. Поисковик SSScanner с достаточно высокой скоростью работает с документами Word, WordPerfect, PDF, HLP, а также с несколькими десятками языков и кодировок.

Имеется возможность нечеткого поиска (по контексту) с оценкой релевантности и формальный. Результаты отображаются в отдельном окне с выдержками из оригинальных документов. SSScanner стоит около $30, условно-бесплатная версия имеет ряд ограничений.

В настоящее время программы прямого поиска уходят на второй план, их активно вытесняют программные продукты, использующие технологию поиска с индексированием. Программное обеспечение этого типа просматривает и анализирует указанные текстовые файлы, создавая собственную базу данных («индекс»), по которой затем и осуществляется поиск. Индексирование -процесс достаточно длительный, но зато поиск занимает считанные секунды. До недавнего времени основными недостатками данного ПО считались продолжительность операции первичного создания индекса и дополнительный расход дискового пространства. Однако для мощных современных компьютеров это не существенно. Некоторое неудобство по-прежнему связано с необходимостью регулярного обновления индексов, однако и это не проблема.

Начнем свое рассмотрение этого сегмента рынка полнотекстовых поисковиков с западных образцов.

1. Поисковик Advanced Document Server http://ads.newmail.ru/1 занимает немного дискового пространства, распространяется бесплатно, имеет массу возможностей: поддержка документов Microsoft Office, PDF, некоторых баз данных; поиск в архивных файлах; встроенный Web-сервер для удаленного доступа. Правда, имеется одно существенное «но»: для работы почти с каждым форматом необходимо «родное» ПО. Для DOC - Microsoft Word, для XLS - Excel, для PDF - полноценный Adobe Acrobat, а также Internet Explorer, архиваторы и пр.

И если многие, кто работает с документами Word, используют само приложение (хотя у Microsoft есть и специальная программа просмотра), то для PDF этот принцип уже не подходит. Помимо этого, применение средств автоматизации OLE в данном случае крайне негативно сказывается на производительности.

2. Программное обеспечение Greenstone предназначено для создания «цифровых библиотек», что подразумевает нечто большее, чем просто поиск с предварительным индексированием по документам DOC, PDF и пр. Этот программный продукт создает каталог документов, конвертирует их в HTML-формат, обеспечивает к библиотеке удаленный доступ посредством броузера. Распространяется бесплатно, с исходными текстами. Правда, работает довольно медленно.

3. Поисковик dtSearch Desktop (автоматически распознает различные кодировки, в том числе и кириллические (за исключением KOI-8), а также пару десятков форматов файлов, среди которых стоит выделить DOC, XLS, RTF, PDF, DBX (Outlook Express), XML, плюс популярные базы данных (через ODBC). В БД и гипертекстовых документах возможен поиск по содержимому конкретных полей и тегов. Даже защищенные PDF индексируются, но получить их названия и другие атрибуты программа не может. Несомненным достоинством программы является поиск в архивах ZIP.

По виду поиска используются: морфологический, фонетический, поиск синонимов, а также поиск в словах с орфографическими ошибками. Помимо этого, dtSearch Desktop предлагает пользователю словарь (построенный в процессе создания индекса) и при вводе запроса выполняет в нем автоматический поиск.

В качестве недостатка можно отметить только английский интерфейс программы. Стоит dtSearch Desktop около $200.

Российское программное обеспечение. По своим поисковым возможностям отечественные разработки имеют определенное преимущество перед западными, поскольку их разработчики априори лучше иностранцев разбираются во всевозможных лингвистических нюансах нашего государственного языка.

1. Поисковик " Ищейка " www.isleuthhound.com или http://www.isleuthhound.ru) (iSleuthHound Technologies).

«Ищейка» - это полнотекстовая персональная поисковая система, работа с которой напоминает работу в поисковых системах Интернета, таких как AltaVista, Yahoo, Rambler. При первом запуске она создает базу данных по имеющимся документам и индексирует ее. Каждая база данных представляет собой зону поиска - пространство на жестком диске, состоящее из каталогов, в пределах которого программа мгновенно находит документы и файлы. Тест-версия программы поддерживает возможность создания лишь двух зон поиска с индексированием в каждой максимально 500 файлов. Перед проведением поиска документов «Ищейке» необходимо указать зону поиска или создать новую, после чего ввести в окошке диалогового окна ключевые слова, которые должен содержать документ, и нажать кнопку Ищи!

Бесплатная версия «Ищейки» работает только с текстовыми и DOC-файлами, профессиональная ($15) еще с RTF и HTML. Помимо этого для профессиональной версии имеется набор дополнительных подключаемых фильтров - для текста во всех кодировках, документов других приложений Microsoft Office и PDF.

Поддержка PDF появилась в программе недавно, и пока этот модуль «не понимает» русского языка, хотя представители компании обещают устранить этот недостаток в самое ближайшее время. Зато модуль великолепно работает с защищенными документами - не только индексирует их содержимое, но и способен корректно определить название и даже извлечь текст.

2. Интеллектуальная поисковая система «Следопыт» ( («МедиаЛингва»). Последняя версия программы для хранения информации использует Microsoft SQL Server Desktop Edition. В ней устранены практически все замечания и вопросы, которые возникали прежде.

По своей функциональности «Следопыт» напоминает dtSearch. В распоряжении пользователей несколько вариантов поиска: нечеткий, т.е. «на естественном языке», система сама отбросит «шумовые» слова, а остальные приведет к морфологической основе; строгий, при котором ищутся в точности те слова, что указаны в запросе; формальный - с логическими и другими операторами и возможностью комбинирования двух предыдущих.

Поддерживаются текстовые файлы в самых разных кодировках, документы основных приложений Microsoft Office, PDF-файлы, в том числе и упакованные в zip-архивы, а также папки (как сами сообщения, так и вложения) Microsoft Outlook. Следует отметить, что используемые фильтры достаточно «честные», они работают с DOC-файлами именно как с документами Word, не индексируют PDF-файлы, защищенные от копирования информации, и т. д. - естественно, это может быть расценено двояко. Тем не менее PDF-фильтр из «Следопыта» показался одним из лучших при работе с русским языком.

Интерфейс программы достаточно удобен, за исключением нескольких нюансов. Например, окно просмотра найденных документов необходимо вызывать специально, при этом оно все время остается самым «верхним» и в некоторых случаях мешает работать с программой. Зато очень корректно извлекается текст из документов всех поддерживаемых форматов и подсвечиваются слова запроса.

Стоит только иметь в виду, что «Следопыт» работает лишь при запущенном приложении Microsoft SQL Server, это приложение устанавливается одновременно с установкой самого «Следопыта».

Программа распространяется в трех вариантах - персональном, профессиональном и корпоративном.

Персональный при цене в $10 лишен фактически всех наиболее интересных функций - не поддерживает морфологию и формальные запросы, не индексирует PDF и папки Outlook.

Профессиональный «Следопыт» обойдется в $48 и может явиться золотой серединой, так как корпоративная версия распространяется с довольно дорогими пакетами лицензий, хотя дополнительным сервисом является только работа с ресурсами локальной сети.

3. Документальная система поиска информации « Cros » (www.cronos.ru («Кронос-Информ»), как и прежде, претендует на нечто большее, чем звание простого поисковика. Разработчики называют «Cros» «системой накопления и обработки информации». Под накоплением подразумевается то, «Cros» не просто создает «индекс» указанных ему текстовых файлов, он копирует их в собственный архив - банк документов, при этом сжимает их и индексирует. Поиск осуществляется уже по своему собственному архиву. Такое решение имеет сразу несколько эффектов: быстрота поиска и надежная защита банков документов от несанкционированного доступа.

«CROS» при загрузке в него автоматически распознает все основные форматы и кодировки текстовых файлов, поддерживает архивы электронных документов и с высокой скоростью осуществляет поиск информации в них по любым сочетаниям слов и свойств документов. Программа обладает развитыми средствами навигации (простой, но мощный язык запросов), сортировки и просмотра найденных фрагментов документов, а также автоматизированной компоновки отчетов.

Имеется также отдельно распространяемый Web-интерфейс (в виде Web-сайта для IIS, Apache или другого сервера с поддержкой CGI), обеспечивающий подключение к «Cros» удаленных пользователей и выполнение с банком данных всех основных операций.

Данное программное обеспечение устойчиво работает в ОС Windows, нетребовательно к ресурсам, удобно и просто в эксплуатации. Существуют как локальная, так и сетевая версии этого программного продукта.

Если сравнивать с имеющимися аналогами, то «CROS» практически не имеет ограничений по объему накапливаемой информации, при этом значительно экономит пространство на жестком диске.

Имеется бесплатная демонстрационная версия с усеченными возможностями, она работает с одним банком данных объемом до 5000 документов. Цена однопользовательской версии «CROS» - $140, при установке на несколько компьютеров в одной и той же организации предлагаются существенные скидки.

4. " Евфрат 99" ) (Cognitive Technologies). Этот продукт тоже представляет собой не «чистый» поисковик, а систему организации электронного документооборота в персональном масштабе, что подразумевает максимальную автоматизацию создания и ввода типичных офисных документов, а также их организацию, регистрацию, хранение, архивирование и, соответственно, поиск.

«Евфрат @SOHO» - это практически полноценная рабочая среда со своим рабочим столом, корзиной, средствами работы с файлами и т. д. Помимо всех этих «прибамбасов» программа «понимает» документы Microsoft Office, индексирует их и выполняет контекстный поиск и даже автоматически следит за обновлением указанных документов и папок. Основной ее недостаток - отсутствие поддержки прочих форматов, в частности PDF, но имеются и кое-какие приятные дополнительные возможности вроде встроенной OCR для ввода документов со сканера. Стоимость программы $20.

«Евфрат Office» поддерживает форматы документов MS Office 95/97/2000 (DOC, XLS, PPT), текстовые (RTF, HTML, TXT (ASCII, ANSI, KOI-8), графические документы - черно-белые и цветные - TIF, PCX, JPG, BMP, GIF и другие. Работает «черновой» режим просмотра (с учетом оригинального оформления и форматирования документа). Имеется функция экспорта во внешние приложения, поддерживающие необходимый формат.

«Евфрат Office» осуществляет полнотекстовый и реквизитный поиск документов по запросу любой сложности с использованием логических операций "И", «ИЛИ», «НЕ», контекстный поиск (запрос по выделенным словам документа в режиме просмотра его текста). Скорость поиска достаточно высока и не зависит от количества зарегистрированных документов и сложности запроса.

Имеется дополнительно устанавливаемый модуль Евфрат Document Server, который обеспечивает одновременную работу нескольких пользователей с единой базой данных.

Краткое резюме. В конце нашего обзора хотелось бы отметить, что выбор программного обеспечения у вас есть - это весьма эффективные dtSearch Desktop, «Ищейка», «Следопыт», «Cros» и «Ефрат», за обладание которыми придется расстаться с некой толикой зеленых общечеловеческих ценностей.

Ну в если ваше прижимистое руководство денег на программное обеспечение не дает, а результаты требует, то не стоит забывать про AVSearch. Правда, временные и трудовые затраты в данном случае значительно возрастают.

Новейшие технологии, которые взяла на вооружение полиция Москвы, позволят в считаные минуты определить, причастен человек к преступлению или нет. Да и вообще, интересен ли остановленный на улице или в автомобиле гражданин полиции? В МВД России сообщили, что внедрена информационно-поисковая система "Следопыт-М", которая интегрирована с системами Главного информационно-аналитического центра министерства в части розыска людей. Причем всех, находящихся в розыске, не только преступников или подозреваемых, но и пропавших без вести.

Главное здесь - в скорости проверки. Человеку предлагают приложить пальчик к прибору, и прибор почти мгновенно выдает ответ: мол, никаких данных об этом конкретном гражданине нет. То есть автоматически сработал один из многочисленных сервисов - централизованной дактилоскопической информации, где поиск ведется по колоссальному массиву, состоящему из более чем 72 (!) миллионов дактокарт.

Как рассказали эксперты МВД, смысл этой новации не только в том, чтобы побыстрее найти преступника, но и чтобы защитить права обычного ни в чем не виноватого гражданина и сэкономить его время и нервы. Представьте ситуацию: в доме, мимо которого вы идете по улице, произошло, допустим, ограбление или даже убийство. Полиция уже сняла все имеющиеся отпечатки пальцев и прочие следы, опросила свидетелей, изучила записи видеокамер и даже составила фоторобот предполагаемого преступника. Разумеется, объявила все возможные мероприятия - планы "Перехват", "Заслон" и т.д. И вот - "удача": идете вы, так похожий на только что составленный фоторобот. Вас вправе задержать на двое суток. Потом, конечно, отпустят и даже извинятся. Но осадок, как говорится, останется. А теперь, благодаря "умной" электронике, процедура проверки займет несколько минут. Если, конечно, вы действительно не наследили на месте преступления.

И это всего лишь одна из многих, так сказать, опций, которую три года назад стали внедрять по утвержденной мэром Москвы Сергеем Собяниным специальной программе "Перечень мероприятий по закупке, созданию, внедрению и эксплуатации средств информационных технологий, связи и защиты информации в интересах ГУ МВД России по г. Москве". За год была создана интегрированная мультисервисная телекоммуникационная сеть. До каждого районного отдела полиции дотянули мощнейший канал связи, установили сетевое оборудование, маршрутизаторы и коммутаторы. Оснащаются средствами информатизации все патрульные автомобили. Экипажам патрульно- постовой службы уже выдано 800 планшетов. До конца года будет закуплено еще около двух тысяч компьютерных устройств. Каждый автопатруль получит доступ к информационным сервисам, чтобы на месте проверять по базам данных задержанных правонарушителей или подозреваемых в преступлении.

Человек, добровольно прошедший процедуру дактилоскопии, имеет право в последующем отказаться от нее

Кстати, именно на базе этого сервиса в подразделениях УГИБДД, лицензионно-разрешительной работы, миграционной и других служб развернули электронную очередь, что позволило значительно сократить время приема населения. Чтобы банк данных был максимально полным и объективным, столичная полиция заключила соглашения об информационном взаимодействии с правительством Москвы, различными ведомствами и службами, в том числе налоговой, судебных приставов.

Акцент на дактилоскопию сделан в этом информационном банке не случайно. Дело в том, что все больше людей добровольно сдают свои отпечатки пальцев. Эта процедура регулируется Федеральным законом "О государственной дактилоскопической регистрации в Российской Федерации". Чтобы вовремя сообщить близким, достать нужную группу крови, надо точно все знать о попавшем в беду человеке и не тратить драгоценное время на поиск нужной информации.

Что важно, эта процедура считается государственной услугой, которая оказывается совершенно бесплатно. Максимально храниться материалы с отпечатками пальцев будут до достижения человеком 100-летнего возраста. Уничтожить их могут, помимо личного требования "хозяина", после смерти человека по заявлению родственников.

Тем не менее человек, добровольно прошедший такую регистрацию, имеет право в последующем отказаться от нее и потребовать уничтожения результатов дактилоскопирования. И его просьбу обязаны удовлетворить в течение 30 суток с момента поступления такого требования.