является обучение методам проектирования приложений для использования в среде Интернет, а

жүктеу/скачать 0,93 Mb.

Pdf көрінісі

бет	15/22
Дата	09.09.2022
өлшемі	0,93 Mb.
	#38729
түрі	Лекции

1 ... 11 12 13 14 15 16 17 18 ... 22

Индексті құру.
Желілік агенттер немесе робот-өрмекшілер Желі бойымен
«өрмелейді», Web – беттерді талдайды және не әрі қай парақта табылғаны
туралы ақпарат жинайды. Кезекті HTML-парақтарды табысымен көптеген
іздеу машиналары (әр іздеу машиналарында әртүрлі) сөздерді, суреттерді,
сілтемелерді және де басқа да элементтерді белгілейді. Сөздердің парақта

34
барлығы ғана емес, әрі оның орналасуы, яғни бұл сөздің қайда
орналасқаны: тақырыпта (title), тақырыпшаларда ( subtitles ), метатэгте (
meta tags ) немесе басқа орындарда. Әдетте негізгі сөз ескеріледі де, шылау
мен одағайлар: «ал», «бірақ» және «немесе» еленбейді. Метатегтер парақ
иелерінің өзіне сол арқылы ізделінетін кілттік сөздер мен тақырыпты
анықтауға мүмкіндік береді. Бұл әсіресе кілттік сөздің бірнеше мағынасы
болғанда қажет. Метатегтер іздеу машинасын сөздердің бірнеше
мағынасынан дұрысын таңдауға көмектеседі. Алайда, метатегтер адал
толтырылғанда ғана сенімді жұмыс істей алады. Web-парақтардың кейбір
иелері өздерінің метатегтеріне желіде көп аталатын өз сайт тақырыбына
қатысы жоқ сөздермен толтырады, сол арқылы өзінің жаңа келушілерін
тарту әрі қор қатысуы рейтингісін жоғарылату үшін жасайды. Іздеуден осы
сияқты сайттарды шығару – жақсы іздеу жүйесінің тағы бір тапсырмасы.
Әрбір роботтың өз қараниетті жарнама үшін жазаланған қор тізімі бар.
Тапсырма берілген Web-парақтарда ақпарат жиналғаннан кейін
алынған мәліметтерді индекстеу жүреді. Робот-өрмекшілер Web-
парақтардың
ақпараттарын
қарастырып,
кілттік
сөздер
арқылы
индекстенген іздеу базасын құрады, содан кейін пайдаланушы сұранысы
арқылы жүйе дұрыстығына (релевантты) қарай сайттар тізімін береді.
Айқын, егер сіз сайтты «гүл» деген кілттік сөзбен іздесеңіз, онда іздеу
машинасы сол сөз бар парақтарды тауып қана қоймай, бұл сөздің қай жерде
сайт тақырыбына қатыстылығын анықтай алуы керек. Сөздің Web-
парақтың профиліне қатыстығын анықтау үшін оның парақта қаншалықты
жиі ұшырасатынын, берілген сөз туралы сілтемелердің бар-жоқтығын
бағалау керек. Қысқаша айтқанда, парақта табылған сөздерді маңыздылық
дәрежесіне қарай рангілеу керек.
Сөздерге салмақтылық коэффициенттері оның қанша және қайда
кездесетініне қарай (парақ тақырыбында, беттің басы не аяғында, сілтемеде,
метатегте және т.б) меншіктеледі. әрбір іздеу механизмі салмақ
коэффициенттерін берудің өз алгоритмдері бар – бұл әртүрлі іздеу
машиналарының бір кілттік сөз арқылы сұрауға әртүрлі қорлар тізімін
берудің бір себебі. Парақтар әрдайым жаңартылып отыратындықтан, онда
индекстеу үрдісі де жиі орындалып отырылуы керек. Робот-өрмекшілер
сілтемелерді аралай жүріп, индекстен тұратын файлды құрады, ол үлкен
болуы мүмкін. Оның көлемін азайту үшін ақпарат көлемін минимизациялау
мен файлды сығуға жүгінеді. Өңделгеннен кейін мәліметтер үнемі жаңарып
отыратын базада сақталады. Бірнеше роботтары бар іздеу машинасы
секундына жүздеген парақтарды өңдей алады. Бүгінде мықты іздеу
машиналары жүздеген миллион парақты сақтайды және күніне ондаған
миллион сұранысты қабылдайды.
Индексті құруда көшірмелердің санын азайту тапсырмасы да
шешіледі – қатесіз салыстыру үшін алдымен құжаттың кодировкасын
анықтау қажеттігін ескерсек, тапсырма оңай емес. Бұдан да қиын
тапсырмаға өте ұқсас құжаттарды айыру жатады (оларды «көшірме дерлік»

35
деп атайды), мысалы оларға мазмұны бір ал тақырыбы әртүрлі болып
келеді. Бұл сияқты құжаттар Желіде өте көп – мысалы біреу рефератты
көшіріп алып өз сайтында басқа атпен басып шығаруы мүмкін. Қазіргі
заманғы іздеу машиналары барлық бұл проблемаларды шешуге мүмкіндік
береді.
Индекс арқылы іздеу.
Индекс арқылы іздеу мынадан құралады, яғни пайдаланушы сұраныс
құрастырып оны іздеу машинасына береді. Бірнеше кілттік сөздерді
қолдануда сұраныс тілін пайдаланған пайдалы, оның негізін буль
операторлары құрайды.
Ең жиі қолданылатын буль операторлары:
-
AND – бұл арқылы біріктірілген барлық терминдер ұсынылған
құжатта қатысуы керек. Кейбір іздеу жүйелері «+» белгісін «AND» орнына
қолданады;
-
OR – кем дегенде бір кілттік сөз «OR »-мен қатысты, ізделінетін
құжатта болуы керек;
-
NOT- «NOT»-тан кейінгі кілттік сөз ізделінетін құжатта
кездеспеуі керек. Кейбір іздеу жүйелері «-» белгісін «NOT» орнына
пайдаланады;
-
FOLLOWED BY – кілттік сөздер бірінен кейін бірі кезектесіп
келуі керек;
-
NEAR – сөздердің бірі екінші сөзден белгілі санды сөздерден
кейін келуі керек;
-
тырнақшалар – тырнақша ішіндегі сөздер - бұл текст фрагменті
құжат немесе файл ішінде кездесуі тиіс. Айта кетейік, сұраныс тілі
семантикасы нақты бір іздеу машиналарында бір біріне ұқсамауы мүмкін,
әдетте ол туралы іздеу машинасының нұсқауында мәлімет келтіріледі.
Шектерінде логикалық комбинация анықталатын мәтін іздеу бірлігі
деп аталады. Бұл сөйлем, абзац не бүкіл құжат болуы мүмкін. Түрлі іздеу
жүйелерінде әртүрлі іздеу бірліктері қолданылуы мүмкін. Сөйлем шегіндегі
іздеу тек индексінде толық мекенжай (адрес) бар жүйелерде ғана болуы
мүмкін.
Пайдаланушы іздеу жүйесіне сұраныс жібергеннен кейін, ол сұраныс
синтаксисін өңдейді, кілттік сөздерді индекстегі сөздермен салыстырады.
Содан кейін сұранысқа жауап беретін сайттар тізімі релеванттылығына
қарай
рангіленіп,
пайдаланушыға
берілетіндей
іздеу
нәтижесі
құрастырылады.
Бақылау сұрақтары:
1)
Интернетте қажетті ақпаратты іздеудің жалпы принциптері
қандай?
2)
Іздеу машинасының жұмыс механизмі қандай?
3)
Интернетте ақпарат іздеу технологияларында индекс ұғымы
нені білдіреді?

36
4)
Индексті құру принциптері қандай?

жүктеу/скачать 0,93 Mb.

Достарыңызбен бөлісу:

1 ... 11 12 13 14 15 16 17 18 ... 22