Fuzzy or Similarity join has been widely studied and applied in various practical fields. There are many different approaches to the fuzzy join problem using MapReduce. The common challenge of these studies is to find pairs of data with similarity greater than or equal to a given threshold within a reasonable time and resource efficiency. This work proposes a new approach that applies neural networks, which is the Siamese Recurrent Network, to process fuzzy join queries on large-scale datasets. Additionally, this study applies the Bloom filter to eliminate redundant intermediate data, aiming to improve fuzzy join algorithms according to the MapReduce model with Hamming, Levenshtein, and Cosine distance measures. The research results are analyzed, evaluated, and demonstrated through experiments on large datasets on a Spark cluster.
Tạp chí: Hội nghị khoa học quốc gia lần thứ XVII về Nghiên cứu cơ bản và ứng dụng Công nghệ thông tin, tại Học viện Công nghệ Bưu chính Viễn thông, Hà Nội, ngày 08 - 09/08/2024
Tạp chí: Hội nghị khoa học quốc gia lần thứ XVI về Nghiên cứu cơ bản và ứng dụng Công nghệ thông tin (FAIR 2023), Trường Đại học Sư phạm Kỹ thuật - Đại học Đà Nẵng, 28-29/09/2023
Tạp chí: Hội nghị khoa học quốc gia lần thứ XV về về Nghiên cứu cơ bản và ứng dụng Công nghệ thông tin (FAIR 2022), Học Viện Kỹ Thuật Mật Mã, Hà Nội, Ngày 03-04/11/2022
Tạp chí: Hội nghị khoa học quốc gia lần thứ XV về về Nghiên cứu cơ bản và ứng dụng Công nghệ thông tin (FAIR 2022), Học Viện Kỹ Thuật Mật Mã, Hà Nội, Ngày 03-04/11/2022
Tạp chí: Hội nghị khoa học quốc gia lần thứ XV về về Nghiên cứu cơ bản và ứng dụng Công nghệ thông tin (FAIR 2022), Học Viện Kỹ Thuật Mật Mã, Hà Nội, Ngày 03-04/11/2022
Tạp chí: 32ème Conférence sur la Gestion de Données - Principes, Technologies et Applications (BDA 2016), Futuroscop - Poitiers - France, 15 au 18 Novembre, 2016
Tạp chí khoa học Trường Đại học Cần Thơ
Lầu 4, Nhà Điều Hành, Khu II, đường 3/2, P. Xuân Khánh, Q. Ninh Kiều, TP. Cần Thơ
Điện thoại: (0292) 3 872 157; Email: tapchidhct@ctu.edu.vn
Chương trình chạy tốt nhất trên trình duyệt IE 9+ & FF 16+, độ phân giải màn hình 1024x768 trở lên