Effective Seed URL Selection and Scope Extension Algorithm for Web Crawler-Reference-Cited by-同舟云学术

Effective Seed URL Selection and Scope Extension Algorithm for Web Crawler

Published:2023-03-30 Issue:1 Volume:35 Page:27-38
ISSN:2636-8277
Container-title:International Journal of Advances in Engineering and Pure Sciences
language:
Short-container-title:

Author:

ALANOĞLU Zülfü¹^ORCID,AKÇAYOL Mehmet²^ORCID

Affiliation:

1. MUSTAFA KEMAL ÜNİVERSİTESİ

2. GAZİ ÜNİVERSİTESİ, MÜHENDİSLİK FAKÜLTESİ

Abstract

Web, hızla büyüyen ve her türden verilerin bulunduğu devasa bir veri kaynağıdır. Kullanıcılar bu veri kaynağından istedikleri verileri almak için arama motorlarını kullanırlar. Arama motorları bu verileri web tarayıcıları ile elde ederler. Web tarayıcıları web sayfalarındaki tek düzen kaynak bulucuları (URL-Uniform Resource Locator) izleyerek ulaştıkları tüm sayfalardaki verileri alır, ayrıştırır ve indekslerler. Web tarama sürecindeki en önemli konular hangi URL’lerden başlanacağı ve taramanın kapsamıdır. Bu yazıda kapsamı tüm web olan genel bir tarayıcının tohum URL seçim ve kapsam genişletme yöntemleri sunulmuştur. Tohum URL seçiminde 102 farklı ülkede ziyaretçinin günlük harcadığı saat, ziyaretçi başına günlük sayfa görüntüleme sayısı, aramadan gelen trafiğin yüzdesi ve toplam bağlı site sayısı temel alınarak oluşturulmuş üç farklı tohum URL seti oluşturulup detaylı bir şekilde performansları analiz edilmiştir. Ayrıca kapsamı hızlı bir şekilde genişletmek için link skoruna dayalı yeni bir tarama algoritması önerilmiş, tohum URL setleri kullanılarak taramalar yapılmış, karşılaştırılmış ve detaylı analizleri yapılmıştır.

Funder

TÜBİTAK

Publisher

Marmara University

Subject

General Medicine

Reference29 articles.

1. [1] "Internet Users Distribution in the World." https://www.internetworldstats.com/stats.htm (accessed 30/03/2022, 2022).

2. [2] M. Abu Kausar, V. Dhaka, and S. Singh, "Web Crawler: A Review," International Journal of Computer Applications, vol. 63, pp. 31-36, 02/01 2013, doi: 10.5120/10440-5125.

3. [3] S. M. Pavalam, S. V. K. Raja, F. K. Akorli, and M. Jawahar, "A survey of web crawler algorithms," International Journal of Computer Science Issues (IJCSI), vol. 8, no. 6, p. 309, 2011.

4. [4] F. Menczer, G. Pant, P. Srinivasan, and M. E. Ruiz, "Evaluating topic-driven Web crawlers," in Proceedings of the 24th annual international ACM SIGIR conference on Research and development in information retrieval, 2001, pp. 241-249.

5. [5] A. Arasu, J. Cho, H. Garcia-Molina, A. Paepcke, and S. Raghavan, "Searching the web," ACM Transactions on Internet Technology (TOIT), vol. 1, no. 1, pp. 2-43, 2001.

Cited by 1 articles. 订阅此论文施引文献订阅此论文施引文献，注册后可以免费订阅5篇论文的施引文献，订阅后可以查看论文全部施引文献

1. Developing a RBFN-Based Enhanced Web Crawler for Tamil Text Categorization;2024 5th International Conference for Emerging Technology (INCET);2024-05-24