İstatiksel Kodlama Yöntemlerinin Türkçe ve İngilizce Metinlerde Sıkıştırma Başarımı Karşılaştırma Örneği-Reference-Cited by-同舟云学术

İstatiksel Kodlama Yöntemlerinin Türkçe ve İngilizce Metinlerde Sıkıştırma Başarımı Karşılaştırma Örneği

Published:2023-07-12 Issue: Volume: Page:
ISSN:1308-5514
Container-title:Uluslararası Muhendislik Arastirma ve Gelistirme Dergisi
language:en
Short-container-title:UMAG

Author:

OZTURK Ibrahim¹^ORCID,KAYA Hakan Celil¹^ORCID

Affiliation:

1. OSMANIYE KORKUT ATA UNIVERSITY

Abstract

Veri sıkıştırma, dijital ortamda bulunan verilerin hafızada olduğundan daha az yer kaplayabilmesi için yapılan işlem adımları bütünüdür. Bu işlemler dosya türlerine göre değişen az ya da çok tekrar eden veri öbeklerinden yararlanarak gerçekleştirilir. Böylece sıkıştırma işlemleri hafızanın ve veri iletişim hattının taşıma kapasitesini daha verimli kullanımına olanak sağlamaktadır. Sıkıştırma teknikleri kayıplı ve kayıpsız olarak iki gruba ayrılmaktadırlar. Kayıpsız sıkıştırma, sözlük tabanlı kodlama ve istatistiksel kodlama yöntemlerini içermektedir. İstatiksel kodlama, veri içindeki sık görülen karakterleri daha kısa kod kelimesiyle temsil ederken, daha az görülen karakterleri daha uzun kod kelimesiyle temsil edilmesi mantığına dayanmaktadır. İstatiksel kodlama yöntemlerinin temelinde karakter kullanım sıklıkları yer alsa da işlem basamakları yöntemlere bağlı olarak farklılık göstermektedir. Bu çalışmada sıkıştırma için istatiksel kodlamayı kullanan Huffman, Shannon-Fano ve Aritmetik kodlama yöntemlerinin İngilizce ve Türkçe metinler üzerindeki başarımları karşılaştırılmıştır. Çalışmada kullanılmak üzere İngilizce için Calgary külliyatı içerisinde bulunan metin tabanlı dosyalar, Türkçe için gazetelerde yayımlanmış köşe yazılarından derlemeler yapılmıştır. Karşılaştırmalar tasarruf oranı, sıkıştırma-açma süreleri, BPC (Bit per character) ve entropi metrikleri üzerinden sağlanmıştır. Sonuçlar istatiksel kodlama yöntemlerinin İngilizce ve Türkçe metinler arasında tasarruf oranı, BPC ve entropi ölçütlerinde başarım farklılıkları olduğunu ortaya koymaktadır.

Publisher

Uluslararasi Muhendislik Arastirma ve Gelistirme Dergisi

Subject

General Medicine

Reference29 articles.

1. Abramson, N. (1963). Information theory and coding.

2. Aktaner, A. (1995). Entropi Kodlama ile EKG Veri Sıkıştırma İstanbul Teknik Üniversitesi]. Fen Bilimleri Enstitüsü.

3. Bell, T., Witten, I. H., & Cleary, J. G. (1989). Modeling for text compression. ACM Comput. Surv., 21(4), 557–591. https://doi.org/10.1145/76894.76896

4. Bulut, F. (2016). Huffman Algoritmasıyla Kayıpsız Hızlı Metin Sıkıştırma. El-Cezerî Fen ve Mühendislik Dergisi, 3(2), 0-0. https://doi.org/10.31202/ecjse.264192

5. Bulut, F. (2017). Bilgi Kuramındaki Entropi Kavramıyla İlgili Farklı Matematiksel Modeller. Bilge International Journal of Science and Technology Research, 1(2), 167-174.